Deepseek-Prover-V2 丘成桐开测

XHS@karminski 大佬发现,Deepseek-prover-v2模型不一定需要用Lean4语言描述问题,latex公式描述结合自然语言也行。
于是开测丘成桐。来源感谢: 2025年4月20日丘成桐数学水平考试题目与参考答案,来测AI啦 - 搞七捻三 - LINUX DO 帖子里佬友也贴上了其他模型的成绩。
参数:openrouter免费模型默认参数。测试方法为逐题测试,测完一道开一个新话题。
免责声明:1.未采用官方输入格式,不代表模型真实性能。
2.模型是prover,理论上证明才是强项,丘成桐这样的求解题并不是官方应用场景。
因此本测试仅供娱乐。
目前第一轮已测完。
目前进展:第一题正确,第二题正确,第三题错误(答案341,回答594)第四题错误(答案2,回答34)第五题正确,第六题错误(答案1066,回答1231)第七题正确 第八题正确 第九题错误(答案378,回答126)第十题正确 第十一题错误(答案733,回答261) 第十二题正确 第十三题正确 第十四题错误(答案1551,回答1552,差一个好可惜)第十五题正确。

错误题目:3,4,6,9,11,14

现在开始重测一遍错题。
第三题仍然错误(答案341,回答405)
第四题做对了!
第六题错误并陷入死循环(答案1066,回答428,但知道不对,然后陷入死循环)
第九题做对了!评论区佬友也一次做对,说明做对概率高一点。
第十一题做对了!
第十四题做对了!评论区佬友也一次做对,说明做对概率高一点。
第二轮总结:还剩3,6做不对。

现在开始第三轮。
第三题仍然错误(答案341,回答405)
第六题做对了!
第三轮结束,还剩3做不对。
对于3,将其转换为纯自然语言,在 {1, 2, …, 2025} 中有多少自然数 x 使得存在某个整数 y 满足 x ≡ y² mod 2025
还是没做对,给出回答810
看来3用自然语言很难做对了。

10 个赞

前排围观

最烦证明题

我就做对5题 2,5,6,7,8,估计进不了一试 :face_with_spiral_eyes:

蹲一波 :tieba_087:

感谢分享测试

证明题一般人真是看不懂 数学大佬的游戏

我测试的第九题正确 但是他怀疑自己的答案

1 个赞

同时14题我测试的也似乎对了?

均为我第一次询问这个题目 没有返回尝试

1 个赞

这么厉害?

经典 :laughing:

感谢佬友测试

建议搞个表格

Gemini 2.5 Pro 是能全部对的 在自然语言描述的题目上Deepseek-prover-v2应该是没啥用优势了

可能lean4会好点(?)

还以为丘成桐本人开测了hh,感觉这种适合陶哲轩来测

1 个赞

它应该是拿lean训练的

此话题已在最后回复的 30 天后被自动关闭。不再允许新回复。