话说在前:
我发帖的时候就标注过了,这里的30k只是在我测试环境里的30k,不能直接照搬。只能说,同样的环境下,同样的准确率,2.5p能支持到大概70-100k。3p大概30-40k,差不多是2-3倍的关系。
不知道怎么传着传着成了上下文只有30k了,我发帖就说过这里的上下文只表示测试时用的。
实际上应该这么理解,处理同一段文本,召回率(这里用的就是字面意思,从文本里提取出数字的能力,用“召回”很生动形象)上2.5p的效果是3p的2-3倍

另外,我必须要说明一下这个准确率是怎么得到的,简单来说,数字错位了,需要修改一次,那么就记录一次错误,增加数字/删除数字都记录一次错误
最后用(40-错误数)/40 就是准确率了
或许是算法不够好吧,测试数据全在github开源了,各位可以自己去写算法比较
直接上图吧,测试了一下3p的大海捞针曲线,可以发现基本上和lithiumflow还有o一串的曲线稳合,说明之前在lmarena竞技场的l和o一串模型就是3p的很新的一个检查点或者微调
实际用起来也一样,超过20-30k后,就很容易一直报diff失败了,召回率很烂
从曲线来看,只有2.5pro的1/3水平(图里的上下文只表示测试环境,不等于实际体验,但相对关系和曲线走势还是有意义的)
但是3pro在其有效上下文,也就是召回率为100%时的表现还是要比2.5pro高太多了
这也是为什么各种看各种推特的烂炒3p怎么怎么好,因为他们都是只发一句提示词,输入上下文可能连10k都没有,完全体现不出模型的注意力/召回率
但是吧,你召回率只有2.5p的1/3,那还怎么用啊,好能力被上下文拉了
总结:模型能力出色,但是注意力巨烂,完全是大退步。谷歌经典整数必炸
这里放一个新算法修正后的数据:
下面是用的旧算法,不太具有参考意义了,旧算法在统计上有点问题。不过几乎没什么差别就是了
Gemini系列全家桶测试曲线
下面是3p具体的:
测试仓库:







