看 benchmark 涨了 3 分,我反而更警惕
约 2 分钟0 阅读
新模型发布,营销话术里永远少不了一句:「在 XX benchmark 上提升 N 分。」
我以前看到这种话会高兴,觉得又强了。直到我做了一次对照。
一场不公平但真实的比赛
某次两个模型前后脚更新,A 在榜单上比 B 高 3 分,发布通稿铺天盖地。我正好手头有 20 个真实工作任务(不公开、不标准、就是我日常要处理的那种),顺手都跑了一遍。
结果:B 赢了 14 个。
这 20 个任务不是精心设计的对抗集,就是我的日常——抽取特定格式的数据、按业务规则改写文案、在长文档里定位某个条款。A 在这些任务上没输在能力,输在它对这些「非标准但常见」场景的适配不如 B。
benchmark 为什么会骗你
benchmark 涨分,意味着模型在榜单设计者认为重要的那些任务上变强了。问题是,那些任务不一定是你关心的任务。
榜单是公开的、标准化的、会被反复训练针对的。你的真实任务是私有的、模糊的、模型从没见过的。两者交集有多大,决定了榜单分数对你有多大参考价值。
我的体感是:榜单分数高的模型,是「擅长考试」的模型;真实任务强的模型,是「擅长你」的模型。这俩经常不是同一个。
我现在怎么看评测
那次之后,我养成了个习惯:看到一个模型说涨分,先问三个问题。
- 在哪涨的? 是数学、代码、还是通用对话?和我的场景搭不搭。
- 涨的代价是什么? 有没有可能在别的维度退步了(厂商不会主动说)。
- 我的 20 个任务跑得动吗? 这是唯一对我有用的分数。
第三个问题最重要,也是别人替代不了你的部分。榜单是公有的,你的任务集是私有的。只有你自己的任务集,才是对你有效的 benchmark。
所以下次看到「提升 3 分」,别急着上车。先想想这 3 分是不是加在了你真正需要的地方。加错地方,3 分不如不加。
