评估99%准确率的测量意义
arXiv:2609.25006v1 Announce Type: new Abstract: 在 ISOT/Kaggle "Fake and Real News" 语料库上训练的文本分类器通常报告准确率和 F1 分数超过 0.98,这种性能水平与评估真实性的难度相比显得很不自然。
我们使用透明的 TF-IDF 和线性分类器流水线作为测量工具,沿三个泄漏通道和两个分布偏移协议对该语料库进行了审计,并公开了所有代码和衍生数据。首先,该基准测试在一定程度上是退化的:仅使用 subject 元数据字段(丢弃文章正文)的分类器即可达到 F1 = 1.000,因为两个类别的 subject 是不相交的。
其次,移除所有三个泄漏通道(元数据、存在于 99.2% 的真实文章中的通讯社来源标签,以及污染了朴素测试集 19.4% 的 6,251 个重复文档),仅使 F1 下降了 1.21 个百分点(从 0.9935 降至 0.9814);
残余信号是弥散的编辑风格,而不是少数泄露特征词,因为删除权重最高的前 1,000 个一元语法(unigrams)后,F1 仍然达到 0.926。第三,这种风格信号无法迁移:在主题不相交协议下,平均精确率从 0.9995 下降到 0.9475,部署的 F1 从 0.9905 下降到 0.8067,先验匹配分析证实了真实的鉴别力损失达 5.2 个百分点,而时间迁移则几乎没有损失。
微调后的 DistilBERT 在分布内表现更强(F1 = 0.9993),但在主题偏移下退化更为严重,其平均精确率损失了 12.9 个百分点,而线性模型仅损失 5.2 个百分点。
迁移到独立的 LIAR 基准测试时,所有三个模型的排名均降至接近随机水平(ROC-AUC 0.54-0.57),没有一个能超过多数类基准。我们得出结论,此处的语料库内分数定量评估的是来源和主题的可分性,而不是真实性;
增加模型容量会利用捷径而不是避免捷径;我们建议将仅含元数据、小样本和主题不相交的基准作为未来工作廉价的诊断方法。
内容聚合自第三方公开来源,AI 解读由「认知」生成,仅供参考。