RAG 系统调优时,大多数人盯着大模型换了一轮又一轮,却很少回头看检索的地基——嵌入模型。它是整条链路里最不起眼、却决定检索上限的一层:查询和文档被它压成向量,后面的召回、重排、生成全建立在这批向量的质量上。更麻烦的是它的「不可逆性」:一旦换模型,整个向量库必须全量重嵌,等于把入库那天做过的所有活重干一遍。所以这篇横评的目的不是告诉你谁分数高,而是帮你一次把决策做对。
我们把当前 RAG 场景里最主流的四款嵌入方案拉到同一张桌子上:Google DeepMind 的 EmbeddingGemma 2、阿里 Qwen 的 Qwen3-Embedding(0.6B/4B/8B 三档)、BAAI 的 BGE-M3、OpenAI 的 text-embedding-3-large,另加 gemini-embedding-001 作对照。先说清边界:本文为代表性对比(基于各官方仓库、模型卡与文档,截至 2026-10-09),非同一环境亲自压测;没有自己的压测就不做能力仲裁,各家基准分各引各的表,结论按需求场景给。
一、先立规矩:分数不能乱比
读任何嵌入模型横评之前,先记住一条纪律:MTEB 的 English、Multilingual、v2 等榜单是不同的表,任务集、语言覆盖、评测协议都不一样,不同表上的分数不可互相排名。你会在网上看到「A 模型的分碾压 B 模型」的说法——如果这两个数来自不同榜单,这个比较就没有意义。本文的做法是:各家自报分各引各的表并标明出处,绝不跨表排序。
第二,嵌入模型的选型权重和语言模型不同:多语言覆盖、上下文长度、向量维度(直接决定存储成本)、部署方式(本地还是 API)这些工程属性,往往比榜单上零点几分的差距更能影响你的实际体验。本文第二节先看总表,第三节单独算这笔工程账。
第三,RAG 检索效果不对,第一反应不该是换嵌入模型。加一个 reranker 是分钟级的改动,换嵌入模型是全库重嵌的工程,顺序搞反就是拿重嵌的代价去赌一个 reranker 本可以解决的问题。检索质量要整体评估,工具链见本站 RAG 评估 SOP;真到要换模型那一步,决策与重嵌实操照着嵌入模型升级 SOP 走。
二、四款主力总表
| 维度 | EmbeddingGemma 2 | Qwen3-Embedding | BGE-M3 | OpenAI text-embedding-3-large |
|---|---|---|---|---|
| 厂商 | Google DeepMind | 阿里 Qwen | BAAI | OpenAI |
| 参数规模 | 270M-740M 四档 | 0.6B/4B/8B 三档 | 约 568M | 未公开 |
| 上下文 | 8,192 | 32,768 | 8,192 | 8,191 |
| 向量维度 | 768(MRL 可裁至 128) | 1024/2560/4096(MRL) | 1024 | 3072(MRL 可裁至 256) |
| 许可 | apache-2.0(ungated) | apache-2.0(ungated) | mit(ungated) | 闭源 API |
| 价格 | 自部署免费 | 自部署免费 | 自部署免费 | $0.13/百万 token · 官方页快照口径(2026-10-09) |
| 多语言 | 100+ | 100+(强中文) | 100+ | 未公布总数 |
| 一句话特色 | 端侧 191MB、四模态一个向量空间 | 32K 长上下文、任务指令前缀 | 一模三吃:dense+sparse+multi-vector | 零运维、支持 MRL |
许可一列说明:三款开源模型的许可以 Hugging Face API 实核为准(2026-10-09)。EmbeddingGemma 2 权重在 huggingface.co/google/embeddinggemma-2,ungated 且 metadata 声明 Apache 2.0,相比一代的 Gemma 自定义许可加门控,是实打实放开;Qwen3 系列权重 HF 实核同为 Apache 2.0、ungated,8B 仓库下载量 244.6 万,开源地址 github.com/QwenLM/Qwen3;BGE-M3 为 MIT、ungated,仓库下载量 3369 万,开源地址 github.com/BAAI/FlagEmbedding。
再给一个对照锚点:谷歌自家的 gemini-embedding-001(3072 维、上下文 2048、API-only)在官方自报口径下拿下 MTEB 多语、英语、代码三榜第一,可以视为「闭源 API 的性能天花板」,而 EmbeddingGemma 2 相当于它的开源轻量版。闭源追上限还是开源求自主,正是这四款横评的核心张力。
三、工程账:三个容易被忽略的选型维度
维度是存储成本的第一杠杆。 向量维度直接乘在每一行存储上,也直接影响检索时的计算量:1024 维与 3072 维之间是三倍的库体积差距,库到千万级再乘上副本和索引结构,就不是小钱了。这也是 MRL 套娃表示的价值所在——EmbeddingGemma 2 可从 768 维裁到 128 维(向量存储最多省 6 倍),OpenAI text-embedding-3-large 可从 3072 维裁到 256 维,Qwen3 三档各自标注了 MRL 支持。选型时别只看默认维度,先按你的库规模算一遍裁维后还够不够用:裁维省的是真金白银,牺牲的是一点精度余量,这笔账要在入库前算,而不是向量库爆了之后再算。
上下文决定你的分块策略。 四款里三款在 8K 档(EmbeddingGemma 2 与 BGE-M3 为 8,192,text-embedding-3-large 为 8,191),只有 Qwen3-Embedding 到 32,768。上下文越长,单条向量能承载的语义越完整;但反过来说,长文本塞进一条向量也可能稀释细节召回——一段 500 字的精准描述和一整章文档压成同维向量,检索表现未必是后者好。所以上下文短不一定是硬伤,它只是逼你把分块做细;上下文长也不是免费午餐,它允许你偷懒,但偷懒的代价要靠评估来验证。
「免费」和「付费」各自的代价要想清楚。 三款开源模型的「自部署免费」免费的是许可与权重,不含 GPU 显存、推理延迟调优和版本升级的人力;text-embedding-3-large 的 $0.13/百万 token(官方页快照口径(2026-10-09))买的是零运维,但代价是数据出内网和供应商锁定。中间路线也存在:端侧定位的 EmbeddingGemma 2 量化后纯文本活动内存约 191MB(谷歌口径),普通服务器甚至本地开发机都跑得动,「既不花钱也不养机器」这个象限是它独有的。
四、逐款拆解:各自的最佳射程
EmbeddingGemma 2:端侧与跨模态的开源新选项。 它最独特的卖点是「一个 checkpoint 四档加载」:270M(纯文本)、440M(加视觉)、570M(加音频)、740M(全模态)共享同一个 768 维统一向量空间,文本可以搜图、搜音视频——对要做跨模态检索的 RAG,这是四款里的独家能力。上下文 8192,是一代 2048 的四倍;MRL 套娃表示支持把 768 维裁到 128 维,向量存储最多省 6 倍;端侧部署(谷歌口径)量化后纯文本活动内存约 191MB。基准分方面,谷歌官方博客自报的 MTEB Code 表从一代的 68.76 提升到 78.68(+9.92),提升显著;但多语言文本较一代仅 +0.21,英文反而略降。必须标注:这套数全部是官方自报口径,尚无独立评测、无论文,MTEB 官方提交也未获接受,只能当参考线看。生态上,sentence-transformers 6.1.0+ 与 transformers 5.19.0 发布当日即支持,MLX、Ollama、llama.cpp、vLLM 均可跑。判断:端侧、离线、跨模态、想把嵌入成本压到零的场景选它;纯拼多语言榜单分数则优势不明显。模型细节展开见本站 EmbeddingGemma 2 开源篇。
Qwen3-Embedding:长上下文与中文 RAG 的强兵。 0.6B/4B/8B 三档规模给了从笔记本到服务器的完整阶梯,32,768 的上下文是四款中最长——对整章文档、长合同这类切片不友好的内容,上下文长度直接决定你要不要在上游多做一层分块。任务指令前缀机制允许按 retrieval、QA 等任务类型定制查询格式,是它区别于其他三款的工程特性。分数方面只有一条可引:Qwen3-Embedding-8B 自报 MTEB 多语榜约 70.6(官方模型卡多语表口径,第三方转述)——注意它与 EG2、BGE-M3 各自的分数出自不同榜单,不可直接比大小。许可 HF 实核 Apache 2.0、ungated,商用落地没有门槛。判断:中文为主、文档偏长、有自部署能力的团队,优先看它。
BGE-M3:生产部署的存量之王。 约 568M 参数、上下文 8192、1024 维,最大的差异化是「一模三吃」:同一个模型同时产出 dense、sparse、multi-vector 三种表示,dense 走常规语义召回、sparse 补关键词精确匹配、multi-vector 支撑细粒度匹配,三种信号合起来喂给混合检索管线,这在四款里独一份——对专有名词多、缩写多的企业语料,稀疏表示那一路经常是救命稻草。社区存量是它的护城河:HF 仓库 3369 万下载,MIT 许可最干净;第三方生产部署流行度(presenc 转述 LangChain/LlamaIndex telemetry 口径)排名第一,领先 Qwen3、OpenAI text-embedding-3-large 和 Voyage。它没有新模型那种抢眼的官方分数营销,遇到问题搜一搜,前人踩过的坑和现成的答案都摆在那里,但「无数生产系统在用」本身就是一种久经验证。判断:要混合检索、要社区答案多、要稳,选它。
OpenAI text-embedding-3-large:零运维的省心选项。 闭源 API,3072 维(MRL 可裁至 256),上下文 8,191,价格 $0.13/百万 token(官方页快照口径 2026-10-09)。它的价值不在榜单而在工程账:不用管 GPU、不用管模型升级、不用操心向量维度与显存的匹配,一行 API 调用换企业级可用性。代价是不透明:参数规模未公开、多语言总数未公布,数据出境与供应商锁定也要提前想清楚。判断:没有运维团队、用量不大、或不想为嵌入单独养机器的团队,它是最快的那条路。
五、按场景选型
| 你的需求 | 推荐 | 理由 |
|---|---|---|
| 端侧或离线部署、跨模态检索 | EmbeddingGemma 2 | 端侧约 191MB、四模态统一 768 维空间、MRL 省存储 |
| 中文为主、长文档、自部署 | Qwen3-Embedding | 32K 上下文四款最长、强中文、Apache 2.0 |
| 混合检索、要社区成熟度 | BGE-M3 | 一模三吃、3369 万下载、MIT、生产流行度第一 |
| 不想运维、快速上线 | OpenAI text-embedding-3-large | 零运维、MRL 裁维、$0.13/百万 token |
| 只追性能上限且接受 API | gemini-embedding-001 | 官方口径 MTEB 三榜第一(对照项,API-only) |
最后重申立场:上表是场景匹配,不是能力排名。四款模型的基准分出自不同榜单、不同口径,本文没有做任何跨表比较,也没有自己的同环境压测——没有自己的压测就不做能力仲裁,在你自己的语料上跑一遍召回率,永远比任何榜单可靠。嵌入模型决定检索上限,但它只是 RAG 的第一层,分块、评估、平台搭建各环节本站都有专篇可查。
常见问题
Q1: 四款里哪个「最强」? A1:无法回答,也不该有答案。各家基准分出自 MTEB 不同榜单,口径不同不可互比,本站没有自己的同环境压测就不做能力仲裁。正确的问法是「哪个适合我的场景」:端侧与跨模态选 EmbeddingGemma 2,中文长文档选 Qwen3-Embedding,混合检索选 BGE-M3,零运维选 text-embedding-3-large。
Q2: 换嵌入模型的真实成本有多大? A2:换模型等于全库重嵌——向量库里每一条文档都要用新模型重新编码回填,文档量大时是一次实打实的全量工程,通常还要新旧双跑对比、灰度切流、一致性评估。所以决策要一次做对,重嵌流程见嵌入模型升级 SOP。
Q3: MTEB 分数高的模型,RAG 效果一定好吗? A3:不一定。MTEB 测的是通用检索与语义任务,你的私域语料、查询分布、分块策略都会改变实际表现;而且不同版本榜单的分数不能跨表比较。榜单当筛选用(排除明显落后的),最终决策用自己的语料跑评估,工具链见RAG 评估 SOP。
Q4: 三款开源模型的许可,商用各要注意什么? A4:以 Hugging Face API 实核(2026-10-09)为准:EmbeddingGemma 2 为 Apache 2.0 且 ungated(仓库根目录无独立 LICENSE 文件,模型卡保留一行遵守 Gemma Prohibited Use Policy 的声明);Qwen3-Embedding 为 Apache 2.0、ungated;BGE-M3 为 MIT。三者商用都没有许可硬门槛,但两类开源许可的宽松程度有差别,落地前建议法务过一遍各自的政策文件,细节以各仓库最新 metadata 为准。
Q5: 自部署和 API 该怎么选? A5:看三个变量:数据敏感度(出不了内网就自部署)、用量规模(大用量下自部署边际成本低,API 按量计费,如 text-embedding-3-large 为 $0.13/百万 token)、运维能力(没有 GPU 运维人力就别硬上)。混合方案也常见:核心敏感库自部署,公开语料走 API。还有一条务实的路径是从 API 起步验证需求,等用量和数据边界都清晰了,再把稳定的主力库迁到开源模型上——嵌入方案不是婚姻,重嵌虽贵,但远没有想象中不可承受,前提是你从一开始就把重嵌流程写成脚本。
参考来源
- Hugging Face API 实核(2026-10-09):google/embeddinggemma-2(apache-2.0,ungated);Qwen3-Embedding 系列(apache-2.0,ungated,8B 仓 244.6 万下载);BAAI/bge-m3(mit,ungated,3369 万下载)
- Google 官方博客:EmbeddingGemma 2 发布文(MTEB Code 68.76 升至 78.68 等自报分,官方口径)
- Qwen3-Embedding 官方模型卡(8B 多语约 70.6,第三方转述口径);Qwen3 开源仓库 github.com/QwenLM/Qwen3;BGE-M3 开源仓库 github.com/BAAI/FlagEmbedding
- OpenAI 官方定价页(text-embedding-3-large,官方页快照口径 2026-10-09)
- presenc:生产部署流行度(转述 LangChain/LlamaIndex telemetry 口径)
本文为代表性对比(2026-10-09),非亲自压测;分数与许可以各官方页面为准。相关阅读:EmbeddingGemma 2 开源篇 | 嵌入模型升级 SOP | RAG 评估 SOP