卧槽!Deepseek这是多模态吗

deepseek的图片识别在图片文档这种上效果不错,生活图片误差有点大。是不是拿以前OCR数据训练的 :rofl:

1 个赞

Gemini,多模态的神,虽然现在3.1在国外御三家垫底,但多模态还是无敌啊



1 个赞

Gemini 识别地理场景也是一绝,不愧是Google maps街景多年积累

看上去很强,代码能力如果有那么强 价格再压一压 能进T0梯队不

是原生多模态吗?如果是的话就真的惊喜了 但感觉不会这么快端上来 估计是视觉encoder+project+V4 Backbone(希望能打我脸)

确实 :thinking:gemini多模态太恐怖了,第一次见是有人用gemini开视频找地铁出口

应该不太行,我昨天看到有其他佬分享带视觉对话的,没有灰度到的账号发消息会提示视觉模型咱不可用。油猴估计只能把前端显示出来