【已更新】一招分辨新旧DeepSeek R1

和幻觉增不增加没啥关系,本质上这种问题就是目前LLM的短板,因为LLM的汉字是按照一个汉字一组token来的,除非使用特别的分词方式。以前能答对有偶然性亦或是通过推理解决的。你多换几个字问一样会答错


那这算啥?

1 个赞


官方的api,花了77秒

抽卡出金了 :tieba_025:

是有小概率回答对的

学习啦ww

我也是这个感觉

歪个楼,qwen3:0.6b的回复是我目前见的最有道理的回复 :rofl:

1 个赞

不行啊这个欧派云掺水了啊 哈哈哈哈

跟楼上的佬有异曲同工之妙 :tieba_025:

可以试试楼上佬的方法,问编程问题,如果是嗯起手的就是旧版

哦哦,没注意楼上也有相同反馈 :laughing:

官网的也是一样是这个“杚“


”

claude sonnet 和 opus 也是错误答案,不论是否启用思考。

gemini-2.5-flash 更是 emoji 大师。

doubao-1.5-thinking-pro 能答对,Qwen3、GLM 答错。

幻觉又重了啊


更完蛋了

1 个赞

蹦出来一个emoji没绷住

可能是的,但是没有量化测试,只是猜测


离谱,新答案

逐渐离谱起来 :bili_052: