首页

开源项目

GitHub 实核数据 + 实战解读的开源 AI 项目盘点。

不造 Agent,借 Codex 出片:开源工作台 12078 星

krillinai/OpenCreator 是 krillinai 团队维护的开源 AI 创作工作台与 Skills 集合(前身 KrillinAI),Apache-2.0 宽松许可、可商用可自部署。截至 2026-09-22 的 GitHub 快照有 12,078 星、1,222 fork、主语言 TypeScript、创建 2024-12-17、最近 push 2026-09-21、31 个未关闭 issue(数字为当日快照,不代表以后水位)。核心设计取向是本地优先:项目数据、附件、日志默认留在本机(SQLite 与文件系统,Codex 会话与配置留在 CODEX_HOME),Daemon 只监听 127.0.0.1 且除健康检查外均需 Bearer 令牌,HTML 预览默认禁脚本与导航,桌面包启用 ASAR 完整性校验与 Cookie 加密。最关键的架构判断是不重造 Agent loop,直接把 Codex CLI 当执行引擎,外壳只加本地 Runtime、可视化工作台与桌面宿主三层,因此 Agent 循环、会话、推理、工具调用、Skills 与 MCP 全部来自 Codex;好处是不维护第二套引擎、能力跟着 Codex 走、Skills/MCP 走 Codex 原生配置,代价是强依赖 Codex 生态、能力上限受 Codex 约束、可用模型取决于本地 Codex 环境与 AI 服务设置。README 文字称十个创作工具而同文档表格列了十二行(十个可用、两个开发中:Auto Clips 与 Digital Avatar),另内置七个视频生产 Skill(KrillinAI CLI、Subtitle、TTS、Landscape 与 Portrait Render、Cover、Pipeline Plan)。须点明:仓库含某 Skill 不等于自动安装,也不等于外部服务已打包;它不是剪映的开源替代,核心是 Agent 加创作工具加 Skill 编排,不含多轨时间线剪辑器。

只会法语译英语:这个开源同传凭什么 1519 星?

Kyutai 的 kyutai-labs/hibiki 是流式语音同传开源模型(1,519 星、119 fork、主语言 Rust、创建 2025-02-04、最近 push 2026-09-09、11 个 open issues,截至 2026-09-21 GitHub API),复用 Moshi 的多流架构,decoder-only 联合建模源语音与目标语音,文本与音频 token 以恒定 12.5Hz 产出,2B 用 16 RVQ、1B 用 8 RVQ 适合端侧,训练序列最长 120 秒、推理上下文 40 秒,论文为 arXiv 2502.03382。最大亮点是训练方法:同说话人词级对齐数据在大规模上根本不存在,于是改用 contextual alignment 弱监督借现成 MADLAD 机器翻译系统做词级匹配,规则是"一个词只有在能从源句预测出来时才应出现在目标句",再靠插入静音或音色可控对齐感知的 TTS 合成来落地。推理只依赖简单温度采样因而兼容 batching,音色保真度由 CFG 系数调节(默认 1、经验值 3、过大伤翻译)。边界如实写死:当前仅支持法译英,权重是 CC-BY 4.0 需署名,代码才是 Python 与 web 端 MIT 加 Rust 后端 Apache-2.0 的分离许可,且核心实现与 Moshi 共用需同时读两个仓。

终端里的开源对手:MiniMax 摊开 mcode 底牌

MiniMax 把终端编码代理 mcode 开源:仓库 MiniMax-AI/minimax-code(1,443 星、159 fork、TypeScript、MIT、2026-06-01 创建、最近 push 2026-09-20,截至 2026-09-20 GitHub API),官方口径是"用出色的 harness 设计持续释放模型能力"。核心判断:编码代理的战场已从模型转到 harness,权限、沙箱与可审计性才是企业敢不敢用的门槛。三种入口(交互 TUI、无头 mcode exec、ACP),BYOK 打通 OpenAI 与 Anthropic 兼容接口,支持 MCP、skills、并行子代理与 AGENTS.md;厂商自报 FrontierHarness 76.7% 通过率、中位耗时 4 分 33 秒。冷思考:1,443 星仍是早期,插件生态深度待验证,但对受监管行业"可审计"往往比多几分通过率更值钱。

Qwen-MM-Plugins 深拆:让任意 agent 原生多模态

QwenLM/Qwen-MM-Plugins(2,908 星、Python、Apache-2.0、2026-07-29 创建、最近 push 2026-09-18,截至 2026-09-19 GitHub API)定位"让任意 agent harness 原生支持多模态":Skill 加 MCP 双层的按需感知插件集,接入 Claude Code、OpenClaw 等主流框架,补上 2026 年 coding agent 看不了音视频的短板。核心判断:它背靠 QwenLM 官方生态位,与 Qwen3.8-Omni-Flash 协同演进,是"模型加工具链"打法的具体落子;Apache-2.0 许可无商用红线,但插件深度绑定千问系模型,换底座时的迁移成本要心里有数。

context-mode 深拆:AI 编程代理的上下文窗口优化

mksglu/context-mode(23,324 星、TypeScript、Elastic License 2.0、2026-02-23 创建、最近 push 2026-09-16,数据截至 2026-09-18 GitHub API)定位"为 AI 编程代理做上下文窗口优化":以 MCP 层沙箱拦截与压缩上下文,配 SQLite/FTS5 知识库与会话连续性设计,覆盖 17 个客户端。核心判断:它切中了长会话膨胀、关键指令被稀释、token 成本随长度上涨三重痛点;但必须如实指出 ELv2 不是 OSI 认证开源,有"不得作托管服务、不得移除许可证声明"两条红线,个人使用无碍,公司引入前要过法务。

herdr 深拆:AI 时代的 tmux,编码 agent 的运行时

herdrdev/herdr(39,133 星、Rust、Apache-2.0、2026-03-27 创建、周榜 20260914 期第 8 名周增 2,458 星)定位"编码 agent 运行住的运行时":断开连接后台继续跑、多机一窗聚合 agent 列表、每个面板标记 working/blocked/idle、通过 CLI 与 socket API 实现 agent 互相调用与等待、单 Rust 二进制无 Electron。核心判断:它卡的是 tmux 在 AI 时代的继任位置,agent-native 的 socket API 才是它区别于"套壳 tmux"的关键;但项目不足半岁,API 与存储格式未固化,建议先管开发机与实验性 agent,勿当生产关键链路唯一支柱。

书生-S2 开源:397B 多模态底座与可插拔记忆

上海人工智能实验室 2026-09 完整开源多模态基础大模型书生-S2(Intern-S2,397B MoE):代码仓 github.com/InternLM/Intern-S1、权重 HuggingFace internlm/Intern-S2-397B、ModelScope 同步。核心架构 Memory Decoder 引入可插拔外部专业记忆,把知识存储与逻辑推理解耦,换领域不必重训基座;Mobius 架构让端到端推理效率提升近 4 倍。官方口径下通用能力居开源第一梯队,科学长程任务(Biology-Instructions、Mol-Instructions、MP20)领先、IMO-Proof 与 AdvancedMathBench 比肩 Gemini 3.1 Pro。本文如实标注:397B 本地部署极不友好,且评测多为官方自述、第三方独立复现有限。

diagram-design:把 AI 出图做成可交付文件

GitHub 仓库 cathrynlavery/diagram-design 在 OpenGithubs 2026-09-14 期周榜位列第二,当周增星 7,208;2026-09-15 实核 39,807 星、fork 2,528、主语言 HTML、MIT 许可、创建于 2026-04-16、最近推送 2026-09-10、未关闭 issue 仅 44。它是一套面向 Claude Code、Codex、Factory Droid、Pi、GitHub Copilot、Kiro、OpenCode 等 Agent Skills 兼容宿主的图表技能包,官方 README 口径为 39 种编辑级图表类型(周榜描述写 38,本文以 README 为准并点出差异)。产物是自包含的 HTML 加内联 SVG:没有构建步骤、没有 JavaScript、没有外部图片依赖,双击即可离线打开;每种类型分 minimal light、minimal dark、full-editorial 三种静态变体。设计系统是它反 AI 味的关键:只用 1 个强调色、每图保留 1 到 2 个焦点、1px 发丝边框、无阴影、圆角不超过 10px、所有坐标与间距必须能被 4 整除。它能把 draw.io、Mermaid、Excalidraw 源文件重绘成这套设计系统,带 Format、Size、Detail、Audience 四个旋钮并输出 fidelity ledger,明确不继承源坐标配色字体、只继承组件关系分组方向 —— 而它的宣传语又是 No Mermaid slop,这个既批评又兼容的张力值得点评。本文还拆了品牌 onboarding(读你的网站首页抽取主色调与字体栈、映射为 paper/ink/muted/accent 等语义 token、自动做 WCAG AA 对比度校验、输出保真回执)、多客户 profile 隔离、以及真正硬核的工程质感:CI 跨三平台,裁切检测用像素差分而非几何,另有 Sankey 守恒、waterfall 运行总额、treemap 面积误差、标签遮挡等一批专治图会说谎的门禁。

God's Eye View:浏览器里的公开数据地球

GitHub 仓库 bilawalsidhu/gods-eye-view 在 OpenGithubs 2026-09-13 期周榜位列第一(该期榜单记录总星 29,396、周增 11,455),2026-09-14 实核已涨到 32,399 星、fork 6,480、JavaScript、开放 issue 199,许可证 MIT(以仓库 LICENSE 文件实测为准,GitHub API 的 license 字段显示 NOASSERTION 并不准确)。它的定位是浏览器里的间谍卫星模拟器,而数据源全部公开且真实:照片级 3D 地球叠加实时飞机、船舶、卫星、地震、交通与公共摄像头,免手语音控制由实时 AI agent 驱动;前身名为 WorldView,源自 5M+ 播放的 YouTube 系列,2026 年 8 月登顶 GitHub Trending 日榜与周榜,Product Hunt 当日第 8。安装两条路:Pinokio 8.2 以上一键,或 Node 24.x/26.x 终端 npm ci、npm run doctor、npm run dev(localhost:4173),零密钥即可用(Esri 影像加无密钥地形,OSM 兜底)。本文拆能力图谱、隐私与合规边界,并强调它不是什么:交通是沿真实道路模拟、CCTV 位姿与火箭轨迹为粗估;同时以 MIT 对照同批 LingBot-World 2.0 的 CC BY-NC-SA 4.0(非商用)。

本地优先的开源语音工作站 VoiceStudio 深度解析

GitHub 仓库 debpalash/VoiceStudio 在 2026-09-07 那一周的周榜中单周 +5104 星、总计约 24.6k 星,是当周热度第一梯队的本地语音项目(AGPL-3.0,Python,9-11 当日活跃)。它的定位是一句话:开源、完全本地的 ElevenLabs 替代品——语音克隆、声音设计、视频配音、听写、转录、有声书创作,覆盖约 646 种语言,本地工作流无需账号、API key、订阅或用量计费。核心设计不是单一语音模型而是**引擎编排层**:整合 16 个 TTS 与 11 个 ASR 引擎,可热切换;跨 macOS/Windows/Linux/Docker,自带 OpenAI 兼容的本地语音 API 与 MCP server。本文拆能力图谱、本地优先的隐私/成本分野、与同日 GPT-Live-1 云端实时语音的分工(它偏批处理配音/转录,非实时对话),并点明五个真约束:AGPL-3.0 商用注意、beta 稳定性、Electron 重写风险、引擎质量参差、并非所有引擎都本地/免费。