deepseek的图片识别在图片文档这种上效果不错,生活图片误差有点大。是不是拿以前OCR数据训练的 ![]()
1 个赞
Gemini 识别地理场景也是一绝,不愧是Google maps街景多年积累
看上去很强,代码能力如果有那么强 价格再压一压 能进T0梯队不
是原生多模态吗?如果是的话就真的惊喜了 但感觉不会这么快端上来 估计是视觉encoder+project+V4 Backbone(希望能打我脸)
确实
gemini多模态太恐怖了,第一次见是有人用gemini开视频找地铁出口
应该不太行,我昨天看到有其他佬分享带视觉对话的,没有灰度到的账号发消息会提示视觉模型咱不可用。油猴估计只能把前端显示出来


