大海捞针测试模型上下文,这种方法是否存在严重的局限性?

用的grok-4.20和grok-4.30测试。
用于大海捞针的文本是codex生成的,实际大小4668kb,估算token量1.5m,上传到grok,测试大海捞针问题,都能准确的答对。
但是我上传一部百万字小说,3047kb ,openai的分词网站估算token是0.89m,问grok里面某个配角和主角的关系,要求不联网搜索,结果第一次直接瞎编了人物关系,后续强调禁止编造,试了两个模型,5次全都告诉我不存在这个配角。
从大海捞针的情况来看,上下文确实没被阉割,但从实际上来说,这个上下文并不能算有效上下文。

2 个赞

可能是因为 codex 生成的文本更符合 tokenizer 的分词吧,真实情况更复杂

可以使用mrcrv2来测试,这个测试不单单是大海捞针

这个文本是不是存在大量重复啊,有报道说这种大量重复会增加注意力

普通的大海捞针确实不能代表真实使用啊,
Gemini捞的很拉,但是实际挺强 ; DS则是相反,捞强,但实际差,
像你这种场景之下考的是语意搜寻强不强,而不是去找一根针

这里的强指的是模型能力还是上下文,我之前上传基本小说和模拟保单对比过,发现ds在读取细节方面要比gemini好很多。但是ds的模型能力就一言难尽了

都是类似这种内容,不过隔一段区域就换了主题

1 个赞

传一本小说,去问其中的细节,
我传了红楼梦,我手动改其中的文章,让AI去找到改后正确的答案,
只使用模糊的语意,而不是给他一个一模一样的关键字

gemini上下文注意力实际表现应该也…

2 个赞

Claude Code开发者:大海捞针测试不能正确反映模型上下文能力 - 前沿快讯 - LINUX DO

实践出真知啊,三月的时候测的,
DS只有在给他一模一样关键字的情况才能回答正确,
但凡把关键字换个说法去问就一问三不知了,

例如文章里写着"当下天有二鼓",若使用"当下天有二鼓"能成功找到,
但如果改成"时值二更"去问,DS就找不到了

DS是因为指令遵循的训练问题?

claude code 说的是 但这不是可以容许他们在MRCR v2 低分的理由 难道就不能让使用者拥有此等体验 广大消费者是真金白银付费订阅 不能只有A\说了算

2 个赞

大海捞针和代码开发有很大的差别
代码之间是有关联的
可以透过工具、测试来逼近目标,而不是纯靠猜
但文本不太行

那咋了,没用的测试多的是呢,IFBench Claude都能排垫底