Gemini 3 Pro召回率测评,召回率只有2.5Pro的1/3, 上下文注意力大退步,实际写代码或许堪忧?

话说在前:
我发帖的时候就标注过了,这里的30k只是在我测试环境里的30k,不能直接照搬。只能说,同样的环境下,同样的准确率,2.5p能支持到大概70-100k。3p大概30-40k,差不多是2-3倍的关系。
不知道怎么传着传着成了上下文只有30k了,我发帖就说过这里的上下文只表示测试时用的。
实际上应该这么理解,处理同一段文本,召回率(这里用的就是字面意思,从文本里提取出数字的能力,用“召回”很生动形象)上2.5p的效果是3p的2-3倍

image

另外,我必须要说明一下这个准确率是怎么得到的,简单来说,数字错位了,需要修改一次,那么就记录一次错误,增加数字/删除数字都记录一次错误
最后用(40-错误数)/40 就是准确率了

或许是算法不够好吧,测试数据全在github开源了,各位可以自己去写算法比较


直接上图吧,测试了一下3p的大海捞针曲线,可以发现基本上和lithiumflow还有o一串的曲线稳合,说明之前在lmarena竞技场的l和o一串模型就是3p的很新的一个检查点或者微调

实际用起来也一样,超过20-30k后,就很容易一直报diff失败了,召回率很烂

从曲线来看,只有2.5pro的1/3水平(图里的上下文只表示测试环境,不等于实际体验,但相对关系和曲线走势还是有意义的)

但是3pro在其有效上下文,也就是召回率为100%时的表现还是要比2.5pro高太多了

这也是为什么各种看各种推特的烂炒3p怎么怎么好,因为他们都是只发一句提示词,输入上下文可能连10k都没有,完全体现不出模型的注意力/召回率

但是吧,你召回率只有2.5p的1/3,那还怎么用啊,好能力被上下文拉了

总结:模型能力出色,但是注意力巨烂,完全是大退步。谷歌经典整数必炸

这里放一个新算法修正后的数据:


下面是用的旧算法,不太具有参考意义了,旧算法在统计上有点问题。不过几乎没什么差别就是了

Gemini系列全家桶测试曲线


下面是3p具体的:




测试仓库:

64 个赞

超级前排
太猛了楼主

谷歌就应该先发一个gemini 3 32k版 :rofl:

43 个赞

在哪可以调用(?

支持佬友测评!(那对比2.5 Pro是什么情况)

gemini你也不看看是谁家的,后面可是大厂啊

就是说有效上下文长度只有 25k 左右对嘛?

4 个赞

我不是说了吗,召回率只有1/3

2 个赞

现在长提示词召回率最高的旗舰模型是哪个

实际体验可能会有左右改变,我这里只是测试环境的文本里的召回率,但是趋势和相对关系不太会有大的变化

2.5pro

明白了佬

2 个赞

跟其它公司比呢,想看看 100k 以上各家模型的召回率

2 个赞

仓库里有其他一点模型的曲线,我没全测

1 个赞

好 窝看看

跟我感觉差不多,claude 的召回率好像不用 thinking 也比其它高

哪里来的模型啊?内部测试?

佬友太强了,3的这上下文也太拉了啊,用都用不了

模型来自哪里?

哈吉米还是搞搞role play吧

有没有可能内测模型的上下文就是不足的,导致无法正确反映趋势?

7 个赞

啊呜,听起来不是好事呀w

1 个赞