AI 手记AI 手记

128K 上下文不是记忆:一次长文阅读实测

2 分钟60 阅读

上周做了一次不太严谨但很诚实的实验:把一篇八万字的综述论文整篇塞给三个都宣称支持长上下文的模型,然后问它们问题。

实验设计很简单。论文是我自己读过的领域,我知道哪些结论是重点、哪些论证是关键环节。问题分三档:

第一档:结论复述

三个模型全过。摘要里的核心结论、作者的最后一段展望,复述得都挺准确,甚至能正确引用章节号。

第二档:论证过程

开始分化。论文第三章有一个「先立靶子再打」的论证结构——作者先综述了一个流行假设,然后用四组实验逐一削弱它。我问:作者为什么先讲那个假设?

两个模型把那个假设当成了作者自己的观点来总结。也就是说,它们「读到了」每一个字,但没有把篇章结构读出来。剩下那个模型答对了,但当我追问第四组实验的对照设置时,它开始编造细节,编得头头是道,连数字都像模像样——可惜是错的。

第三档:跨章节关联

全军覆没。论文第九章的一个表格其实是对第三章假设的回应,中间隔了六万字。没有一个模型主动建立这个关联,我提示之后,它们都能「哦对」上来,但主动阅读时,注意力就是过不去。

我的结论

上下文窗口是「能摊在桌上的纸」,不是「读进脑子里的书」。纸摊得开,不代表模型会翻到第 40 页去找一个伏笔。长上下文的正确用法,可能不是「整篇塞进去」,而是配合检索和定位,把相关的几页主动翻到模型面前。

这次实测样本量是一篇论文、三个模型,远够不上严谨。但有一个体感很确定:**窗口大小是厂商好宣传的数字,注意力质量才是用户真正买到的的东西。**下次看发布会,我会少看那个 K,多问一句:隔了六万字,它还记得第三章吗?

相关阅读