「这篇文章是人写的还是 AI 写的?」--这个问题在 2026 年已经有了专门的工具品类:AI 内容检测器。它一边被内容平台、教育机构、出版方当成质检关卡,一边被「去 AI 味」工具和水印抹除工具持续对抗。上一篇我们讲了 AI 水印军备竞赛:官方埋标、开源拆标;这一篇解决使用端的问题--如果你是收稿的编辑、审论文的老师、验外包的管理者,该用哪个检测工具,它们的判断值多少钱。
先说清边界:本文为代表性对比,非亲自压测;各工具准确率取自厂商宣称与第三方测试报道,定价随版本变动,一律「以官网为准」;AI 检测结果只能作为参考信号,不能作为处理依据(误报风险见第四节)。
一、先把品类分清:统计派与协议派
这个品类有一条常被混淆的分界线,先立框架:
| 流派 | 原理 | 代表 | 判什么 |
|---|---|---|---|
| 统计派 | 语言统计特征判断「像不像 AI 写的」 | GPTZero、Originality.ai、Copyleaks、Pangram | 任意来源文本(概率判断) |
| 协议派 | 读水印/元数据,验证「是否携带某来源凭证」 | SynthID Detector、C2PA 检查(c2patool) | 只验自家或带标内容(确定性) |
统计派回答「像不像」,会误报;协议派回答「有没有那个标」,不携带凭证就什么都说不出来。两者的结论法律与流程效力完全不同。本篇主评统计派五款主流工具,协议派作对照。
二、五款工具速览表
| 工具 | 定位 | 形态 | 免费额度 | 起步价(约) | 最适合 |
|---|---|---|---|---|---|
| GPTZero | 教育/大众文本检测 | Web + API | 有免费档 | 约 $8.33/月 | 教师、个人初筛 |
| Originality.ai | 内容团队/出版质检 | Web + API + 浏览器插件 | 按信用点付费 | 信用点制(以官网为准) | 内容团队、SEO 机构 |
| Copyleaks | 查重+AI 检测一体 | Web + API | 有限试用 | 订阅制(以官网为准) | 学校、企业合规 |
| Pangram Labs | 高精度检测 | Web + API | 有限试用 | 以官网为准 | 对误报零容忍的机构 |
| Hive Moderation | 多模态(图像/文本) | API 为主 | 有限试用 | 以官网为准 | 平台、UGC 审核 |
价格说明:GPTZero 起步价取自第三方对比报道;其余各工具计费方式差异大(信用点/按量 API/席位),动手前一律核官网。
三、能力维度对比
| 维度 | GPTZero | Originality.ai | Copyleaks | Pangram | Hive |
|---|---|---|---|---|---|
| 文本 AI 检测 | 核心能力 | 核心能力 | 核心能力 | 核心能力 | 有 |
| 图像 AI 检测 | 弱项 | 部分 | 部分 | 有 | 核心能力 |
| 第三方战绩 | 常居前列 | 14 款检测器横评中得分领先(Empirical Study 报道) | 第三方实测「顶级档」(2026 年 15 款横评报道) | 自家 30 款工具基准居前(注意利益相关) | 平台级部署为主 |
| 中文支持 | 一般 | 一般 | 较好 | 以官网为准 | 以官网为准 |
| API 集成 | 有 | 有 | 有 | 有 | 有(主打) |
| 最弱一环 | 误报争议 | 信用点成本 | 速度/价格 | 生态较新 | 文本非主打 |
注意 Pangram 的「30 款工具测试」出自其自家博客,利益相关,仅作参考;Originality 的「99% 准确率」也是厂商口径。第三方研究普遍结论是:没有任何检测器能在对抗性改写下保持宣称精度。
四、统计派是怎么「闻出 AI 味」的
理解原理才能理解误报。统计派检测器主要抓两类信号:
- 困惑度(perplexity)信号:语言模型对文本的「惊讶程度」。LLM 生成的内容往往选词是「高概率但平庸」的路径,困惑度异常均匀;人写的内容时不时蹦出低概率但精准的词,困惑度起伏大。检测器反着推:太「顺」的文本可疑。
- 突发性(burstiness)信号:句式与句长的变化节奏。人写东西节奏忽长忽短、句式跳脱;模型输出节奏均匀。节奏过于规整也是可疑信号。
新一代工具(Pangram 等)已转向更深的特征(句法结构指纹、n-gram 分布),这也是它们宣称对「去 AI 味」改写更鲁棒的底气。但攻防是对称的:改写工具也在针对这些特征做优化。理解了这一点,就理解了为什么检测分数必须配合证据链使用。
建议的自测流程(选型前花半小时):准备 10 篇样本--5 篇确定纯人写(自己旧稿)、5 篇确定 AI 生成(记下模型与提示词);用免费档逐篇过一遍候选工具,统计两个数:人稿误报率(人写被判 AI 的比例)和 AI 稿检出率。你自己的样本比任何厂商宣传页都诚实。中文内容务必用中文样本测--英文语料训练的工具在中文上经常翻车。
五、三条使用纪律(比选型更重要)
- **检测结果是信号,不是判决。**统计派全部基于概率,纯人写的稿子也会被标成「疑似 AI」。处理学生、作者、供应商之前,先看证据链(版本历史、创作过程、面谈),检测分数只是线索之一。
- 对抗工具在持续进化。「去 AI 味」改写工具、水印抹除工具(见本站 AI 水印军备竞赛热点)都在直接瞄准检测器。今天的高分不代表下个月还高。
- **高价值场景走协议派。**收重要稿件、验外包交付,优先查 C2PA 元数据(
c2patool -d一条命令,见本站 AI 内容标识合规 SOP),确定性凭证比统计猜测可靠一个量级。
选型一句话:个人初筛 GPTZero,内容团队 Originality.ai,机构查重 Copyleaks,平台多模态 Hive,误报敏感场景先试 Pangram 再用证据链兜底;关键决策永远叠加协议派验证。
常见问题
Q1:AI 检测工具的准确率可信吗? A1:打折听。厂商宣称的 90%+ 多为理想数据集上的成绩;第三方测试普遍显示,对抗性改写(去 AI 味工具、同义改写)会显著拉低精度。把检测结果当参考信号,配合证据链使用,不要单凭分数下结论。
Q2:中文内容检测哪个准? A2:整体弱于英文。主流工具以英文语料训练为主,中文误报率更高;中文场景建议多家交叉+人工复核,或直接走协议派(元数据/水印验证)。以实际测试为准。
Q3:检测器和水印有什么关系? A3:两套机制。检测器是「事后猜测」(统计派)或「验凭证」(协议派,如 SynthID Detector 只认 SynthID 水印、c2patool 验 C2PA 标)。厂商埋水印(如 Claude 隐形水印、OpenAI 接入 SynthID)本质是把「猜测」升级为「验凭证」。
Q4:免费的够用吗? A4:轻度用途够。GPTZero 有免费档,Copyleaks 等提供有限试用;但批量、API、团队协作都要付费。建议先用免费档跑自己的样本(含几篇确定人写的),观察误报率再决定付费。
Q5:被误判成 AI 写的怎么办? A5:留证据、走申诉。保存版本历史与创作过程记录(文档时间线、草稿),要求平台/机构复核;重要发布前主动加 C2PA 标识或声明创作来源,让「人类创作」也有凭证可验。
参考来源
- eesel.ai:I tested 7 AI writing detection tools in 2026(Empirical Study of AI-Generated Detection Tools 14 款横评,Originality.ai 领先)
- rankability.com:I Tested 15 AI Content Detectors(2026,Copyleaks/Originality 顶级档)
- pangram.com:Which AI Detector Is Most Accurate? 30 Tools Tested(利益相关,仅参考)
- ampifire.com:GPTZero vs Originality.ai(GPTZero 约 $8.33/月起、Originality 信用点制)
- jotform.com:The 7 best AI content detectors in 2026
- writehuman.ai:AI Image Detector Tools 2026(图像检测/Hive 类)
- GitHub:contentauth/c2pa-rs(c2patool 检查 C2PA 元数据);google-deepmind/synthid-text(SynthID 参考实现)
- 本站:AI 水印军备竞赛热点 | SynthID-Text 开源拆解
代表性对比非亲自压测(2026-08-17 整理);准确率与定价随版本变动,以官网为准。