这怎么测试到的
Arena指定模型为3.1 Pro,那是真的3.1 Pro,只有battlemode里面的才是2026.3
难道真的有内部交易 ![]()
之前的发力点不对
Google一直想做世界模型
没做agentic的训练
事实上抛开agentic来看,Gemini并不落后
还听说那边还说Claude网页版的Sonnet4.6有变化,说Sonnet5要来了
![]()
是的
这个月应该会发
听说不咋地
那完了,没地可去了(我指的是日用模型)
哈基米3.5 Pro是last hope了
GPT不喜欢用
Claude自断双腿(Mythos/Fable)
然后现在的Opus也不适合日用了
?为什么你运气这么好能刷出来,我刷半天还是3.1
认真?我3.5 Flash做的都比这个要好。
好吧仔细一看好像还可以,就是这个白的让我以为这个眼镜悬空着……![]()
最近 Gemini 确实不争气啊
Gemini终于更新基模了吗 古董知识库有救了 ![]()
上面也有佬测出来了,那看来应该是不会假了
现在剩下的问题就是
哈基米团队 像狗一样工作 的成果究竟怎么样
了
具体好不好用还是要看到时候的个人体验
先端上来吧 ![]()
吊的越久期待就越高,Google就越容易让我失望
太对了,这也是我期待哈基米的原因。感觉他和DS V4有点像,都是补全coding短板后就可以成为六边形战士了
我个人觉得是我见过并且记得的最好的鹈鹕骑车了, NB.
可能还有一点幻觉的问题吧
不过据我所感,网页端的Opus也是幻觉,都快成魔幻菇了 ![]()
幻觉这个事LLM之间谁也别笑谁
然后就是coding了
coding还是挺重要的,现在的3.5 Flash是会调用工具了,也会写代码了
但是在架构上缺点insight,不知道是参数不够还是啥
错怪人家了
这个白色让我以为这个眼镜是浮空的
哈哈哈
很不错了,我记得之前测v4的时候总会有一些细节问题,比如脖子、嘴巴那一块
所以我条件反射的认为那个眼镜是浮空的
我仔细检查了一下没发现啥瑕疵
类脑那边的评价是和以前 “雪球” 一样,没啥长进![]()
这下变成G除了吗?
是除名的除哦