精选内容
在后台给文章勾选「精选」,就会出现在这里。
最新文章
给模型一个「草稿纸」
同一道数学题,直接要答案错一片;让它先分步想再答,正确率跳一档。给模型一张「草稿纸」让它把思考写出来,比逼它一步到位强。而且那张草稿纸你还能审计。
# 思维链# 提示词# 推理· 约 3 分钟
让模型说「我不知道」,比让它假装知道有用一万倍
给问答接口加了一句「不确定就明确说不确定」,错误率没降,但可信度大涨。因为它不再硬编。一个会认怂的模型,比一个嘴硬的模型有用得多。
# 提示词# 拒答# 幻觉· 约 3 分钟
上下文不是越长越好,是越靠前越好
把同一句关键指令从 prompt 中段挪到开头,遵循率明显上升。原来模型对上下文的注意力不是均匀的,而是前后强、中间弱。关键信息放对位置,比堆更多上下文管用。
# 提示词# 上下文# 注意力· 约 2 分钟
让模型自我检查,比让它一次写对更靠谱
同一批任务,一版要求一次写对,一版先写再自评改一遍。后者错率低了一截,且每处改动都有理由可查。我从此不再追求「一次成型」,开始追求「写完再审」。
# 提示词# 自我评审# 输出质量· 约 3 分钟
小模型 + 好提示,干掉大模型 + 懒提示
把摘要任务从大模型换成小模型加结构约束,质量没掉,成本降到十五分之一。这次实测让我不再默认「用最大的」,开始按任务配模型——大模型不是万能药,是贵药。
# 模型选型# 成本优化# 提示词· 约 2 分钟
我不再追模型的新功能,开始追它的旧 bug
我曾经每个新模型发布都追着试新功能,直到发现真正拖慢我的是那些我早就该记住的旧坑。整理了一份「某模型坑表」后,我的调用成功率反而升了。追新不如扫旧。
# 模型选型# 踩坑# 效率· 约 2 分钟
看 benchmark 涨了 3 分,我反而更警惕
某模型发布说某榜单涨了 3 分,我把手头 20 个真实任务丢给它跑,它在榜单上的对手赢了我的 14 个。从那以后我看评测分数,第一反应不是「它变强了」,而是「它在什么上变强了」。
# 模型评测# benchmark# 真实任务· 约 2 分钟
推理模型不是更聪明,是更会想
同一道 debug 题给普通模型和推理模型,普通模型直接给答案,推理模型先说「我怀疑这里」。我后来才明白,推理模型真正的价值不在答得更对,在于它把怀疑写在了答案前面,让我有机会在它错之前把它拽回来。
# 推理模型# 思维链# 模型评测· 约 2 分钟
