#模型评测
4 篇文章
看 benchmark 涨了 3 分,我反而更警惕
某模型发布说某榜单涨了 3 分,我把手头 20 个真实任务丢给它跑,它在榜单上的对手赢了我的 14 个。从那以后我看评测分数,第一反应不是「它变强了」,而是「它在什么上变强了」。
# 模型评测# benchmark# 真实任务· 约 2 分钟
推理模型不是更聪明,是更会想
同一道 debug 题给普通模型和推理模型,普通模型直接给答案,推理模型先说「我怀疑这里」。我后来才明白,推理模型真正的价值不在答得更对,在于它把怀疑写在了答案前面,让我有机会在它错之前把它拽回来。
# 推理模型# 思维链# 模型评测· 约 2 分钟
模型更新后,我做的第一件事是跑旧用例
某次小版本更新后,我那套原本好用的提示词集体翻车。回滚对比才定位到原因:不是模型变笨了,是它变「乖」了。从此我给每个主力模型都配了一套回归用例。
# 模型评测# 回归测试# 模型更新· 约 2 分钟
128K 上下文不是记忆:一次长文阅读实测
把一篇八万字的论文塞给模型,它背得出结论,却说不清论证过程。这次实测让我重新理解了「上下文窗口」这四个字。
# 长上下文# 模型评测# 实测· 约 2 分钟
