在问deepseek一些推理题时,deepseek经常会从记忆中的题库找答案,如果答案错误就懒得继续推理,不知道是不是之前模型更新的原因。感觉这样可能会让他在一些常见的benchmark评分虚高。
@neo 元芳怎么看
居然诚实的说出来了是题库看的hhhh
小米那模型API刚开始也答不对洗车走路问题,网上传开没多久就答得对了。题库肯定专门给各种需要证明自己专业性的场景准备的
大模型的训练不就是背题吗
背题学习泛化
有啥奇怪的
像发现新大陆一样
大模型好多benchmark都不开源都拿不到题目怎么背
好诚实啊。。
洗车问题一开始deepseek也答不对,现在都能答对了,而且好多推理题他是直接从答案反推的。感觉现在的版本也是一个长时间自我迭代的版本,不知道是利是弊
大模型的本质不就是背题吗?这不是最基础的吗?凭空创造的话这个应该是属于幻觉吧。
但是对于一些复杂问题直接记住答案反推感觉有点作弊了,如果出现变体的题目岂不是就答错了?简单的问题我感觉直接记答案没问题
其实如果是大家都知道的问题,直接给答案给思路也挺好,省去一个搜索整合的过程就是了
我看了一下上面佬友发的论文,感觉就是这个意思。有些常识性的问题这样确实能提高效率。
我上面问的问题就因为模型记住了错误的答案,他从答案反推验证是错的,然后直接开摆结束回答了。。
感觉这样有点太吃知识库的准确性了,模型本身好像一直在偷懒
训练的过程就是在拟合数据分布的过程。所以无论哪个模型,只要喂给他相关的数据,都可以算作是背题。
脑筋急转弯、弱智吧的题目,都已经成为固定的训练语料,而且随着语料库不断的更新,模型记住的题也越来越多。评测的 benchmark 或者题目也应该按照周期更新,才能比较好分辨出模型能力;或者 benchmark 私有不开源也可以。



