deepseek现在似乎存在背题嫌疑


在问deepseek一些推理题时,deepseek经常会从记忆中的题库找答案,如果答案错误就懒得继续推理,不知道是不是之前模型更新的原因。感觉这样可能会让他在一些常见的benchmark评分虚高。

@neo 元芳怎么看

居然诚实的说出来了是题库看的hhhh

小米那模型API刚开始也答不对洗车走路问题,网上传开没多久就答得对了。题库肯定专门给各种需要证明自己专业性的场景准备的

大模型的训练不就是背题吗

背题学习泛化

有啥奇怪的

像发现新大陆一样

大模型好多benchmark都不开源都拿不到题目怎么背

好诚实啊。。

洗车问题一开始deepseek也答不对,现在都能答对了,而且好多推理题他是直接从答案反推的。感觉现在的版本也是一个长时间自我迭代的版本,不知道是利是弊


我当时还有截图记录,现在已经能稳定答对了

大模型的本质不就是背题吗?这不是最基础的吗?凭空创造的话这个应该是属于幻觉吧。

不是前两个月才发论文吗?“知识”与“推理”分离 :distorted_face:
https://arxiv.org/pdf/2601.07372v1

但是对于一些复杂问题直接记住答案反推感觉有点作弊了,如果出现变体的题目岂不是就答错了?简单的问题我感觉直接记答案没问题

其实如果是大家都知道的问题,直接给答案给思路也挺好,省去一个搜索整合的过程就是了

我看了一下上面佬友发的论文,感觉就是这个意思。有些常识性的问题这样确实能提高效率。

我上面问的问题就因为模型记住了错误的答案,他从答案反推验证是错的,然后直接开摆结束回答了。。

感觉这样有点太吃知识库的准确性了,模型本身好像一直在偷懒

训练的过程就是在拟合数据分布的过程。所以无论哪个模型,只要喂给他相关的数据,都可以算作是背题。
脑筋急转弯、弱智吧的题目,都已经成为固定的训练语料,而且随着语料库不断的更新,模型记住的题也越来越多。评测的 benchmark 或者题目也应该按照周期更新,才能比较好分辨出模型能力;或者 benchmark 私有不开源也可以。