← 查看文章

写作

chatgpt-comparison-detection:先有语料,再谈检测

拆一个早期 AI 文本检测仓库:它最值得看的是 HC3 这套人类和 ChatGPT 对比语料。

chatgpt-comparison-detection:先有语料,再谈检测

写 AI 味自查,很容易一上来就问:有没有一个工具,能直接告诉我这段是不是 AI 写的?我现在不太信这种问法。检测器再厉害,也得先知道它拿什么当“人写的”,拿什么当“AI 写的”。这个底子不清楚,后面的分数再精细,也只是一个看起来很正式的判断。

这篇先拆 chatgpt-comparison-detection

它不是一个标准的 Codex Skill。仓库里没有 SKILL.md。它更像一个研究项目:先收集人类和 ChatGPT 的回答,再基于这批语料做检测器。

1. 先把来源说清楚

仓库在这里:

https://github.com/Hello-SimpleAI/chatgpt-comparison-detection

项目对应论文是:

How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection

仓库里最核心的东西叫 HC3。

全称是 Human ChatGPT Comparison Corpus。简单说,就是同一个问题,一边放人类回答,一边放 ChatGPT 回答,然后拿来比较和训练检测器。

它支持英文,也支持中文。

很多检测器只在英文场景里成立,换到中文就容易飘。HC3 至少把中文放进了同一套问题里。

HC3 的核心思路:同一个问题下,对照人类回答和 ChatGPT 回答,再训练检测器

2. 它不是先猜味道,而是先做对照

我看这个仓库,最有价值的地方不是“它能不能一眼抓出 AI 文”。

我更想看它的起点。

它先承认一件事:要判断 AI 文本,得有对照样本。

比如一个金融问题,人类怎么答?ChatGPT 怎么答?

一个法律问题,人类怎么答?ChatGPT 怎么答?

一个医学问题,人类怎么答?ChatGPT 怎么答?

这些回答放在一起,检测器才有东西可学。

对公众号写作也是一样。

你不能只说“这句话 AI 味重”。你最好能拿出一组对照:

AI 式表达:这不仅提升了内容质量,也为后续创作提供了新的可能。

人话表达:这句话说了半天,其实没告诉读者下一步怎么写。

有了对照,问题就清楚多了。

3. 它提供了三类检测思路

README 里提到三种检测器。

第一种是 QA version。

它会把问题和答案放在一起判断。因为同一句话放在不同问题下面,味道可能不一样。

第二种是 single-text version。

它只看一段文本本身,判断是不是 ChatGPT 生成。

第三种是 linguistic version。

它也看一些语言学特征,不完全依赖大模型分类器。

这三个方向放在一起,说明它没有把检测想得太简单。

如果只看文本本身,容易误判。

如果只看问题和答案,又不适合普通文章。

如果只看语言特征,又会被改写绕过去。

检测 AI 文本本来就不是一个按钮能解决的事。

chatgpt-comparison-detection 的三类检测思路:QA 版、单文本版和语言学版,各自看不同信号

4. 代码里怎么做

仓库里有一个 detect/ 目录。

里面能看到两类训练方式。

一类是传统机器学习。

比如 ml_train.py 里会计算 PPL、GLTR 这类特征,再用分类器判断。

PPL 可以粗略理解成“模型觉得这段话有多顺”。太顺、太像模型预期,有时就是一个信号。

GLTR 看的是每个词在语言模型预测里排第几。AI 生成的文本,常常更爱选模型认为很可能出现的词。

另一类是深度学习分类器。

dl_train.py 里用的是 Hugging Face 的 AutoModelForSequenceClassification,英文模型基于 roberta-base,中文模型基于 hfl/chinese-roberta-wwm-ext

这就不是“规则表抓套话”了。

它是把人类文本和 ChatGPT 文本当成训练样本,让模型自己学差异。

chatgpt-comparison-detection 代码里的两条检测路线:传统机器学习特征和深度学习分类器

5. 普通写作者能学什么

普通公众号作者大概率不会去训练一个检测器。

也没必要。

但这个仓库有一个思路可以借:先建立自己的对照库。

比如你可以给自己存三类样本:

  • 自己觉得顺但很空的 AI 初稿。
  • 自己改完后的自然版本。
  • 读者反馈不错的旧文章段落。

后面让 AI 帮你改稿时,不要只说“去 AI 味”。你可以直接给它看对照:

左边是我不喜欢的 AI 腔。
右边是我想要的公众号表达。
请按右边的方式改。

这比让 AI 自己猜你的风格稳得多。

6. 我的判断

chatgpt-comparison-detection 现在不适合被当成一个即插即用的写作 Skill。

它是一份早期 AI 文本检测样本库和研究代码。

但它提醒了我一件事:判断 AI 味,不能只靠感觉。

感觉有用,但得慢慢沉淀成对照样本。

你越能说清楚“哪一句像 AI,改完为什么不像”,AI 越能帮你改到位。

我把它放在第一篇讲,就是因为它先把“参照物”摆出来了。