(假的,画的贼丑)疑似gemini4.1flash测试



这个便利店小场景有点拉了

似乎是随机灰度的,登另外一个号就是3.8flash

假的,画的一坨

1 个赞

前端看不出来感觉,可以新开会话直接问你是什么模型,不要说什么是不是4点几这种话

spark复现成功

2 个赞

我也在Spark里测试,最开始我直接问他是什么模型,说是3.8Flash,我说不是4?他改口说是4.1Flash,然后解释了一堆,我提问他知识库的问题,还是旧的知识库,甚至完全不知道4Argon
我感觉直接问是什么模型,没有太大可信度

直接问是有点用的的,但是不要说别的,因为我没记错谷歌从有个版本开始是加了模型的自我认知的

但哪怕他说自己是4.1Flash,但提问后发现知识库依然落后

spark 里面说是4.1, 然后结果和lz的差不多

但是貌似 id 是models/gemini-v4p1s-rev25-skimaki-remy 这个好像之前就有了说是 3.8f


不懂了,我去试试不在Spark问看看会不会说是4.1

我知道我的意思是你可以直接在chat里问,不要加什么是不是啥模型这种会稍微准一点。现在说的这些基本都是有上下文的感觉直接问模型的基本没看到4的

反正最近速度明显变慢,而且网页版聊天经常处ab测试

还真是

id这个我也不清楚诶,可能是有在灰度?但是没看到很新的知识库,或者很厉害的效果,前端鹈鹕这个Gemini一直很强。真要实际测试还是知识库以及实际体验准一点吧,三点八灰度的时候是直接问就可以给出具体模型的

关键是今天的Gemini网页端和App直接出故障了,3.1Pro直接不可用,问什么问题都是被分类器拦截,然后直接拒绝回答 :rofl:
如果在网页端灰测的话,我感觉以3.8Flash为入口不太合理,因为Flash模型主打速度,如果塞入4Argon的灰测,其实在用户体验上是不合理的。但3.1Pro模型又出了问题,不过基于这一点来看,我倒是更怀疑出问题就是因为Google在上4Argon :rofl:

gemini的自问自答建议不要信,它的幻觉很严重,很多时候你说啥就是啥

这个题目对gemini来说还是太难了…

但是很奇怪的是看思考总结有切模型的情况 而且说自己是 3.8 的时候问不出来 id



但是skimaki好像是 3.8f 的代号 前面的 v4p1 早就有了跟版本应该关系不大

现在这个说的是4.1flash吧,这个argon我感觉还是不会直接chat给出来灰度的吧,这好事感觉轮不到咱了 :innocent:

这是Gemini 3.什么
并非4.1

哈哈这样吗,我觉得切换模型应该不是在思考链里切换吧 :rofl:,这样切换还蛮可爱的哈哈。我确认我的身份是彭于晏哈哈哈