chatgpt-comparison-detection:先有语料,再谈检测
写 AI 味自查,很容易一上来就问:有没有一个工具,能直接告诉我这段是不是 AI 写的?我现在不太信这种问法。检测器再厉害,也得先知道它拿什么当“人写的”,拿什么当“AI 写的”。这个底子不清楚,后面的分数再精细,也只是一个看起来很正式的判断。
这篇先拆 chatgpt-comparison-detection。
它不是一个标准的 Codex Skill。仓库里没有 SKILL.md。它更像一个研究项目:先收集人类和 ChatGPT 的回答,再基于这批语料做检测器。
1. 先把来源说清楚
仓库在这里:
https://github.com/Hello-SimpleAI/chatgpt-comparison-detection
项目对应论文是:
How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection
仓库里最核心的东西叫 HC3。
全称是 Human ChatGPT Comparison Corpus。简单说,就是同一个问题,一边放人类回答,一边放 ChatGPT 回答,然后拿来比较和训练检测器。
它支持英文,也支持中文。
很多检测器只在英文场景里成立,换到中文就容易飘。HC3 至少把中文放进了同一套问题里。

2. 它不是先猜味道,而是先做对照
我看这个仓库,最有价值的地方不是“它能不能一眼抓出 AI 文”。
我更想看它的起点。
它先承认一件事:要判断 AI 文本,得有对照样本。
比如一个金融问题,人类怎么答?ChatGPT 怎么答?
一个法律问题,人类怎么答?ChatGPT 怎么答?
一个医学问题,人类怎么答?ChatGPT 怎么答?
这些回答放在一起,检测器才有东西可学。
对公众号写作也是一样。
你不能只说“这句话 AI 味重”。你最好能拿出一组对照:
AI 式表达:这不仅提升了内容质量,也为后续创作提供了新的可能。
人话表达:这句话说了半天,其实没告诉读者下一步怎么写。
有了对照,问题就清楚多了。
3. 它提供了三类检测思路
README 里提到三种检测器。
第一种是 QA version。
它会把问题和答案放在一起判断。因为同一句话放在不同问题下面,味道可能不一样。
第二种是 single-text version。
它只看一段文本本身,判断是不是 ChatGPT 生成。
第三种是 linguistic version。
它也看一些语言学特征,不完全依赖大模型分类器。
这三个方向放在一起,说明它没有把检测想得太简单。
如果只看文本本身,容易误判。
如果只看问题和答案,又不适合普通文章。
如果只看语言特征,又会被改写绕过去。
检测 AI 文本本来就不是一个按钮能解决的事。

4. 代码里怎么做
仓库里有一个 detect/ 目录。
里面能看到两类训练方式。
一类是传统机器学习。
比如 ml_train.py 里会计算 PPL、GLTR 这类特征,再用分类器判断。
PPL 可以粗略理解成“模型觉得这段话有多顺”。太顺、太像模型预期,有时就是一个信号。
GLTR 看的是每个词在语言模型预测里排第几。AI 生成的文本,常常更爱选模型认为很可能出现的词。
另一类是深度学习分类器。
dl_train.py 里用的是 Hugging Face 的 AutoModelForSequenceClassification,英文模型基于 roberta-base,中文模型基于 hfl/chinese-roberta-wwm-ext。
这就不是“规则表抓套话”了。
它是把人类文本和 ChatGPT 文本当成训练样本,让模型自己学差异。

5. 普通写作者能学什么
普通公众号作者大概率不会去训练一个检测器。
也没必要。
但这个仓库有一个思路可以借:先建立自己的对照库。
比如你可以给自己存三类样本:
- 自己觉得顺但很空的 AI 初稿。
- 自己改完后的自然版本。
- 读者反馈不错的旧文章段落。
后面让 AI 帮你改稿时,不要只说“去 AI 味”。你可以直接给它看对照:
左边是我不喜欢的 AI 腔。
右边是我想要的公众号表达。
请按右边的方式改。
这比让 AI 自己猜你的风格稳得多。
6. 我的判断
chatgpt-comparison-detection 现在不适合被当成一个即插即用的写作 Skill。
它是一份早期 AI 文本检测样本库和研究代码。
但它提醒了我一件事:判断 AI 味,不能只靠感觉。
感觉有用,但得慢慢沉淀成对照样本。
你越能说清楚“哪一句像 AI,改完为什么不像”,AI 越能帮你改到位。
我把它放在第一篇讲,就是因为它先把“参照物”摆出来了。


