DeepSelect:DeepSeek 为 DSA 打造的高性能 TopK 算子
DeepSeek 官方组织于 2026-09-10 开源 DeepSelect(GitHub 快照:152 星 / CUDA / 当日创建并活跃),这是 DeepSeek Sparse Attention(DSA)所用 TopK kernel 的高性能实现与配套 sampler;DSA 应用于 V3.2、V4、V4.1 三代模型,官方称相比原生 torch.topk 取得 2~20 倍加速,同日发布 v1.0.0 与中英双语算法深度解析文档。本文拆解为什么 TopK 会成为注意力瓶颈、RadixSelect 的「一遍扫描 + 随机块 + 阈值收敛」思路、「总处理元素数期望上界」意味着什么,以及为什么该用有效内存带宽而非 FLOP 来度量性能;重点写清它不做什么:仅支持 Lightning Indexer(bfloat16、topk 必须 ≤4096)与 Sampling(float32、vocab 约 128K)两类 workload,官方调参建议是关闭 sorted_index、不需要取值时设 return_value=False。冷思考:152 星说明项目极早期,对 DeepSeek 系模型直接有用,生态价值大于通用价值。