首页

开源项目

GitHub 实核数据 + 实战解读的开源 AI 项目盘点。

DSH Desktop 拆解:GitHub 周榜第一的桌面壳,把 20 万星 Harness 变成双击即用

anywhere-labs/dsh-desktop(原名 deepseek-harness-desktop;21,750 星/1,062 fork,MIT,TypeScript,2026-08-29 API 实测)是给 20 万星 DeepSeek Harness 套的 Windows/macOS 原生桌面壳:把上游的本地 Web UI、Host 服务与插件系统集成进桌面应用,窗口、托盘、终端、更新一步到位,核心理念是「万物皆插件,桌面本身也是插件」。8 月 23 日当周以周增 12,488 星登顶 GitHub 周榜第一。README 明确声明这是独立社区项目,与深度求索无隶属、合作或背书关系,采用上游版本钉死策略保证稳定性;文档体系覆盖用户指南、隐私政策、插件开发与生态倡议书,靠阿里云无影、UCloud、88API 等赞助维持商业化。一周 1.2 万星的背后,是上游官方专注本体、社区补齐产品化的生态位分工样本。

Open-AutoGLM 拆解:智谱把手机 Agent 开源了,一句「打开小红书搜美食」它自己动手

zai-org/Open-AutoGLM(26,104 星 / 4,019 fork,Apache-2.0,Python)是智谱开源的手机端 GUI Agent 框架:ADB 控制真机 + VLM 屏幕感知,截图、看懂界面、规划、点击循环执行,10 个固定操作原语,不依赖无障碍接口和控件树。配 AutoGLM-Phone-9B 专用模型(第三方 API / vLLM 本地部署 24GB+ 显存 / Claude Code+GLM Coding Plan 三种取用),内置敏感操作确认与人工接管两道安全门,官方覆盖 Android 50+、鸿蒙 60+ 主流应用。README 专设「给 AI 看的部署指南」,用 agent 装 agent。注意口径:仓库最近 push 停在 2026-03-06,星数是历史积累。

GPT-Image 2 提示词被逆向工程:538 个案例 21 套模板打包开源(星 20.2k)

GitHub 周榜第 5 名(周增 5,329 星):freestylefly/awesome-gpt-image-2 把散落社区的 GPT-Image 2 出图案例逆向工程成结构化提示词资产--538 个案例按 13 类组织(UI 73/海报 88/摄影 78/插画 58/信息图 52/电商 41),再提炼出 21 套工业级模板,每套含填空模板、JSON 进阶模板与避坑指南。核心命题 Prompt as Code:把散文式提示词压缩成主体/光照/材质/布局/文字锁定的原子化结构,面向 agent 与自动化复用。还打包成 npm Agent Skill(gpt-image-2-style-library),一条命令装进 Claude Code/Codex。API 实测 2026-08-26:20,193 星/2,033 fork,MIT,创建于 GPT-Image 2 发布后第 4 天,四个月日更不断。

OpenViking:给 Agent 装上「上下文数据库」,字节开源 33000 星

字节火山引擎开源 OpenViking:把 agent 的记忆、资源、技能统一成 viking:// 虚拟文件系统,用 ls/tree/find 浏览上下文,替代黑盒向量库。核心设计含 L0/L1/L2 三层分级加载(省 token)、目录递归检索、可观测检索、会话沉淀记忆。GitHub 33,172 星(API 实测 2026-08-25),周榜第 6,周增 3,540 星。官方基准:Claude Code 长对话记忆 57.21%->80.32%,输入 token 降 34.3%-91.0%。AGPL-3.0,商用 SaaS 注意传染性。

让 Agent 拿走你的手机:phone-harness 开源两周 2000 星,iPhone 不越狱也能被 AI 全权操控

ShawnPana/phone-harness(1,977 星/183 fork,MIT,Python,GitHub API 实测 2026-08-22,创建于 8-07 开源刚两周):let your agent control your phone。iPhone 不越狱--macOS Sequoia+ 的 iPhone Mirroring 窗口作传输层,screencapture 截屏+Vision OCR 拿"穷人版 DOM"、CGEvent 注入 HID 级点击键盘;Android 走 adb(USB/Wi-Fi)+screencap+uiautomator 精确控件树+input。安装是一段粘给 Claude Code/Codex 的 prompt,--doctor 自检。哲学:不预置专用工具,缺什么模型在 agent_helpers.py 里现场写 Python。附"learned the hard way"坑清单(AppleScript click 无效/unicode 输入不行/慢拖不动 iOS 列表)与三道安全门(备用机/支付审批/API 优先)。

给 LLM 一整台 Mac:browser-use 出了个「零护栏」harness,两天 480 星

browser-use/macos-harness(480星/33 fork,MIT,Python,GitHub API 实测 2026-08-19,创建于 8-17 两天):browser-use 组织新作,「给 LLM 一整台 Mac」的最薄 harness--No framework, no recipes, no rails。六原语 see/key/type/click/ax/script 打穿全机:CGWindow 截后台窗口不前置+CGEvent 直发 PID 键鼠+AX/Apple Events 兜底+CDP 驱动真实已登录 Chrome,同一常驻 Python 进程里 browser/Path/subprocess 直接可用。哲学:没有 Spotify 工具没有 Slack 工具,缺什么逻辑模型任务中途自己写普通 Python。安装方式是一段粘给 Codex/Claude Code 的 prompt(uv+Python 3.12+skill 注册+doctor 权限自检)。doctor 报权限清单、遥测只记命令类别不记内容可一键关。与 browser-use(干净浏览器)、ego-lite(共享登录态浏览器)生态位三分。对照本周 OpenAI 失控事件:零护栏与缰绳的一体两面。Experimental 仅 macOS。

AI 也要拉群了:avante 作者新作 cumora,让 Claude Code 和 Codex 在同一个群里当同事(上线 1 天 1.4k 星)

yetone/cumora(1,460★/158 fork,MIT,TypeScript,API 实测 8-17 当日创建):avante.nvim 作者新作,给 AI Agent 造的团队群聊--Agent 是一等公民(人设+记忆+原子认领任务+收发真实邮件+共用看板日历)。双大脑路线:Cumora Cloud(per-agent K8s pod+OpenAI Responses 多跳工具循环)或 BYOA(npx cumora agent computer,本地 Claude Code/Codex 当大脑用自己订阅,服务器看不到 key)。防撞车三件套(seen-cursor 新鲜度门控/原子认领/小脑分诊)+llm_calls 成本台账+CI 大模型守卫。本地 5 分钟:Postgres+Redis+OPENAI_API_KEY。5 注意点含出生第一天/云版烧钱/工具权限边界。

埋水印的官方军开源了:Google SynthID-Text 参考实现拆解,Nature 论文级水印怎么长在文字里

google-deepmind/synthid-text(1,024★/96 fork,Apache-2.0,API 实测 8-17):SynthID 文本水印官方参考实现,对应 Nature 论文。水印织进采样分布(keys 配置+HF Transformers mix-in 挂 Gemma/GPT-2),双检测器(Weighted Mean 免训练/Bayesian 需训练),Colab 可跑(2B 需 T4/7B 需 A100)。官方明言非生产用途,生产版在 Hugging Face Transformers;accumulate_hash 无密码学保证。对抗/合规/工程三视角+5 注意点(密钥管理/误报标定/改写降检)。与 watermarks-remover Layer B 对位。

ai-manju:AI 漫剧短剧本地生产流水线,ComfyUI+MiniMax-H3 从中文草稿到带音轨成片

catiseyeqaq/ai-manju-shengcheng-xitong:写实 AI 电影/短剧本地生产流水线。ComfyUI 0.31.0 编排 + MiniMax-H3 音视频联合生成(BF16 权重约 129G,8 卡 PPU-ZW810E)+ Qwen3.6-35B-A3B 中文润色。33 套模板工作流,T2V/I2V/R2V,majicFlus+PuLID 跨镜脸锁+H3 首尾帧接戏+48k 音画对齐。漫剧全链解析+硬件门槛+5 FAQ。早期个人项目(4 星),成片在 Releases 验收。

GLM-5.3 深度解析:智谱开源编程第一,还会找漏洞,「开源的盾」启动

智谱 GLM-5.3(2026-08-14):基座未变,靠后训练 Scaling 大幅提升智能上界,成当前编程能力最强开源模型(Terminal Bench 3.0 等多项开源第一),并涌现网络安全能力(代码审查/漏洞发现),联合安全团队发现 2436 个漏洞,启动「开源的盾」计划。深度解析+5 避坑。仓库/星数以官方为准,非实测。