首页

开源项目

GitHub 实核数据 + 实战解读的开源 AI 项目盘点。

DeepSelect:DeepSeek 为 DSA 打造的高性能 TopK 算子

DeepSeek 官方组织于 2026-09-10 开源 DeepSelect(GitHub 快照:152 星 / CUDA / 当日创建并活跃),这是 DeepSeek Sparse Attention(DSA)所用 TopK kernel 的高性能实现与配套 sampler;DSA 应用于 V3.2、V4、V4.1 三代模型,官方称相比原生 torch.topk 取得 2~20 倍加速,同日发布 v1.0.0 与中英双语算法深度解析文档。本文拆解为什么 TopK 会成为注意力瓶颈、RadixSelect 的「一遍扫描 + 随机块 + 阈值收敛」思路、「总处理元素数期望上界」意味着什么,以及为什么该用有效内存带宽而非 FLOP 来度量性能;重点写清它不做什么:仅支持 Lightning Indexer(bfloat16、topk 必须 ≤4096)与 Sampling(float32、vocab 约 128K)两类 workload,官方调参建议是关闭 sorted_index、不需要取值时设 return_value=False。冷思考:152 星说明项目极早期,对 DeepSeek 系模型直接有用,生态价值大于通用价值。

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

OpenMAIC周增八千星登顶,把文档变多智能体课堂

THU-MAIC/OpenMAIC 以周增 8,095 星登顶 GitHub 周榜(2026-09-08 快照 33,053 星 / 5,369 fork / TypeScript / MIT)。它把任意主题或文档变成多智能体互动课堂:AI 老师与 AI 同学实时讲课、讨论、白板板书、TTS 朗读,生成幻灯片、测验、交互式模拟与 PBL 项目制学习,可导出 .pptx 与交互 HTML。v1.0.0(2026-08-27)新增 Agent workbench 聊天式构建、持久化会话、20 个内置技能;技术栈 Next.js 16 / React 19 / LangGraph 1.1;v0.3.0 起由 AGPL-3.0 转 MIT,并内置 SKILL.md 标准技能包,可从 OpenClaw、Codex、WorkBuddy 等工作台直接生成课堂。

DeepSeek Harness 开源:万物皆插件的 Agent 框架

DeepSeek 官方开源 Agent 编排框架 DeepSeek Harness(命令行 dsh),GitHub MIT、TypeScript,基于 Cordis 运行时,以「万物皆插件」架构模块化拼装 AI 流水线。仓库 2026-08-13 创建,上线约三周 Star 突破 20 万;当前 0.1.3-alpha、开发者预览,官方声明会有破坏性变更、须先读 SAFETY.md。一键 `npx @deepseek-ai/dsh web` 启动 Web UI(http://127.0.0.1:3080)。

Qwen3.8-Flash-Next 开源:预览 Qwen4 架构的开放权重

阿里 2026-08-26 在 Hugging Face 与 ModelScope 开源 Qwen3.8-Flash-Next:125B MoE 总参数、每 token 激活 6B,是预览 Qwen4 架构的第一个开放权重模型。原生上下文 262K,YaRN 可外推到 1M;API 报价 \$0.16/\$0.47 每百万 token(约旗舰 Qwen3.8-Max 的十二分之一)。评测:DeepSWE 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5、MathVision 95.7,Agent Arena 开放第 7。采用 qwen-community-1.0 许可证(非 Apache 2.0),允许商用与自托管,商用前须以模型页原文核对条款。

DeepSeek-V4-Flash-Vision-Exp 开源发布

DeepSeek-V4-Flash-Vision-Exp 是 V4-Flash 的视觉实验版。核真更正:它不在 GitHub(api.github.com 该仓库返回 HTTP 404),开源地在 Hugging Face(deepseek-ai/DeepSeek-V4-Flash-Vision-Exp);IT之家实际报道于 2026/8/31 19:35,非 9/1。MIT 许可(可商用),支持 JPEG/PNG/GIF/WebP 图片输入,视觉能力接近 Claude Opus 4.8、纯文本与 V4-Flash 持平,均出自官方 API 文档与媒体。参数量约 305B、1M 上下文为媒体转述【未确认】。本文给落地指引:自部署走 HF 模型卡、轻量调用走官方 API,并提醒先拿真实业务图做冒烟测试。已确认与未确认项在文中分表呈现。

Harbor 与 Terminal-Bench:自建评测,验证厂商分数

2026-09-01 Anthropic 发布 Fable 5.1/Mythos 5.1,官方 Terminal-Bench 4.0 成绩为 Fable 5.1 55.8%、Mythos 5.1 60.9%、GPT-5.6 Sol 37.3%;同日 harbor 仓库有代码推送。本文讲怎么用开源工具链把这些分数从"只能引用"变成"可以复核"。GitHub API 实测:harbor-framework/harbor(4872★/1705 fork/Python/Apache-2.0/创建 2025-08-04/push 2026-09-01)是评估框架,harbor-framework/terminal-bench(594★/push 2026-09-01,最活跃)是任务与基准套件;原 laude-institute/terminal-bench 已 301 更名为 terminal-bench-1(2559★但停在 2026-07-11),勿混用。Terminal-Bench 4.0 重新标定配额、移除 8 任务修复 19,分数与旧版不可比。给出自建评测四步:先写私有任务集、harness 配置入版本库、重复跑报分布、成本与失败模式列为一等公民。

39k 星的开源"第二大脑",但许可证是 GPL-3.0:OpenHuman 深度拆解

tinyhumansai/openhuman(GitHub API 实测 2026-09-01:39,264 星 / 3,855 fork,Rust,GPL-3.0,创建 2026-02-18,382 个 open issue,未归档)是一个本地优先的"第二大脑"。三层架构: scored Markdown 树记忆(SQLite + Obsidian 镜像,可手编可 grep)、checkpointed 图调度(非循环,可暂停/重启续跑)、Signal 协议端到端加密的 agent 间通信("No server ever sees plaintext")。TokenJuice 压缩工具输出("最高 80%" 是自报上限非实测均值)。Privacy Mode 在 Rust core 强制 inference 不出本机。三处须知:Early Beta + 382 issue 不宜上生产 SLA;GPL-3.0 强 copyleft,嵌闭源产品前需法务;README 四家对比表过时(仍标 OpenClaw "Plugin-reliant / Single loop / 无 Auto-fetch",而 2.0 已引入 Shared Cloud Sessions 与 Active Memory),90k Skills / 5k MCP / 80% 压缩均为厂商自报未第三方核验。

Hugging Face 的 399 美元机器鸭 Microduck:双仓库 5100 星全开源,但硬件设计文件是否开源存在分歧

2026 年 8 月 27 日,Hugging Face 与旗下 Pollen Robotics 发布 Microduck:25 厘米高、不到 800 克的鸭形双足机器人,售价 399 美元,当天开放预订。硬件参数是 RK3566 主控、1GB 内存加 32GB 存储、15 个 XL330 舵机、8×8 ToF 激光雷达、2600mAh 电池(标称续航约一小时),控制策略以 ONNX 跑在板载芯片上、控制环 50Hz——这一条把它和「带 App 的玩具」区分开。真正值钱的是随硬件一起放出来的软件:运行时与 SDK、物理仿真环境、完整强化学习训练栈,两个 GitHub 仓库 `pollen-robotics/microduck` 与 `microduck_rl` 均以 Apache-2.0 发布,2026-08-31 经 API 实测分别为 4108★/485 fork 与 1037★/179 fork。训练侧用 MuJoCo Warp(mjlab)加 PPO,4096 个并行环境下 1 到 2 小时能出可部署步态,并用执行器模型、域随机化与 backlash 仿真解决 sim-to-real,观测归一化在导出 ONNX 时烘焙进图里。需要说清的是:硬件设计文件是否一并开源,来源之间存在分歧,本文单列一节拆成四层供读者自查,不替任何一方下结论。

架构创新要有人肯写内核:Qwen 开源 FlashQLA,GDN 前向提速 2-3 倍,门槛从 Hopper 起跳

QwenLM/FlashQLA(GitHub API 实测 2026-08-30:670 星 / 69 fork,Python,MIT,创建于 2026-04-24,最近 push 2026-08-26)是基于 TileLang 的高性能线性注意力 kernel 库,官方称在 NVIDIA Hopper 与 Blackwell 上,GDN Chunked Prefill 的前向比 FLA Triton kernel 快 2-3 倍、反向快 2 倍,收益在预训练与端侧 agentic 推理场景最明显。三条技术看点:门控驱动的自动卡内上下文并行(借 GDN 门的指数衰减,在 TP、长序列、小头数下自动开启)、硬件友好的代数重构(降 Tensor Core/CUDA Core/SFU 开销而不牺牲精度)、TileLang 融合 warp-specialized kernels(兼顾 CP 与反向需求手工做 warpgroup specialization)。v0.1.2 起成为 flash-linear-attention 的 GDN 后端,可经标准 FLA API 即插即用。它最值得琢磨的是时机:与 Qwen3.8-Flash-Next 同日更新,等于阿里一边交架构卷子一边交内核卷子。但入场券不便宜——要 SM90 及以上、CUDA 12.8+、PyTorch 2.8+,且 2-3 倍是官方自评而非第三方复现。