刚看到ds的识图说明,于是测试了一下,好想颠覆物理学啊

在API 服务中,图片会转换成token后按token计费,一张图片最多占384tokens

这是deepseek说的,好像一般模型都是1000token吧?

好像平均一般一个token大概2-3个汉字吧

那我多放点字,是不是

于是我有了邪恶的想法…… 这个50x50个汉字 384个token 肯定不行吧(逃

让AI跑了张很多随机文字的图片

问:看看这张图片,倒数第三行 第三个字是什么

于是,DeepSeek 寄了

Qwen 寄了,

牛来不了。

真神来了!恭喜 我们的Gemini 3.7 Flash !

不知道GPT和Claude行不行,有没有大佬测测,我没有订阅喵

4 Likes

考虑是服务端压缩导致的图像模糊无法识别。

我的gpt(5.6 xhigh)做对了,但是他偷偷用了工具呜呜呜

1 Like

Gemini的原生多模态依然保持领先的,虽然推理和编程落后

那说明他聪明,小时候书上教,人和动物最大的差别就是擅长使用工具:bili_040:

8 Likes

gemjni的多模态是真的好,可惜了,现在流口水

也有可能的,不过这个模型好像没有开源的打算吗

在opencode用还是比较贵的

1 Like

前几天刚知道这个只是,给gemini上传pdf,gemini的处理方式是转化为图片,然后每页pdf的token消耗就是384token,比把pdf转化为文本要节省很多token和时间

2 Likes

试了牛来ox-alpha也不能识别

感觉3.7 Flash还是可以的,但是也不强就是了

3.6 Flash就不太行了

之前我试过 上传了一张 长图片 给 Gemini,上传之后就被压缩得非常模糊 也是在猜字 猜内容,猜测准确率大概在 40%:laughing:

gpt和claude都轻松拿下,grok 4.5不行、4.6成功

1 Like