Gemini 3.1 Pro Preview疑似被Livebench排行榜除名

这怎么测试到的

Arena指定模型为3.1 Pro,那是真的3.1 Pro,只有battlemode里面的才是2026.3

难道真的有内部交易 :distorted_face:

之前的发力点不对

Google一直想做世界模型

没做agentic的训练

事实上抛开agentic来看,Gemini并不落后

2 个赞

那边测试和识别这些模型挺有一套的 :rofl:


1 个赞

还听说那边还说Claude网页版的Sonnet4.6有变化,说Sonnet5要来了

:distorted_face:

是的

这个月应该会发

听说不咋地

1 个赞

那完了,没地可去了(我指的是日用模型)

哈基米3.5 Pro是last hope了

GPT不喜欢用

Claude自断双腿(Mythos/Fable)

然后现在的Opus也不适合日用了

1 个赞

?为什么你运气这么好能刷出来,我刷半天还是3.1

1 个赞

认真?我3.5 Flash做的都比这个要好。

好吧仔细一看好像还可以,就是这个白的让我以为这个眼镜悬空着……:bili_052:

最近 Gemini 确实不争气啊

Gemini终于更新基模了吗 古董知识库有救了 :zany_face:

2 个赞

上面也有佬测出来了,那看来应该是不会假了

现在剩下的问题就是

哈基米团队 像狗一样工作 的成果究竟怎么样

具体好不好用还是要看到时候的个人体验

先端上来吧 :melting_face:
吊的越久期待就越高,Google就越容易让我失望

太对了,这也是我期待哈基米的原因。感觉他和DS V4有点像,都是补全coding短板后就可以成为六边形战士了

2 个赞

我个人觉得是我见过并且记得的最好的鹈鹕骑车了, NB.

2 个赞

可能还有一点幻觉的问题吧

不过据我所感,网页端的Opus也是幻觉,都快成魔幻菇了 :melting_face:

幻觉这个事LLM之间谁也别笑谁


然后就是coding了

coding还是挺重要的,现在的3.5 Flash是会调用工具了,也会写代码了

但是在架构上缺点insight,不知道是参数不够还是啥

1 个赞

错怪人家了

这个白色让我以为这个眼镜是浮空的

哈哈哈

1 个赞

很不错了,我记得之前测v4的时候总会有一些细节问题,比如脖子、嘴巴那一块

所以我条件反射的认为那个眼镜是浮空的

我仔细检查了一下没发现啥瑕疵

1 个赞

类脑那边的评价是和以前 “雪球” 一样,没啥长进:rofl:

这下变成G除了吗?
是除名的除哦

1 个赞