XHS@karminski 大佬发现,Deepseek-prover-v2模型不一定需要用Lean4语言描述问题,latex公式描述结合自然语言也行。
于是开测丘成桐。来源感谢: 2025年4月20日丘成桐数学水平考试题目与参考答案,来测AI啦 - 搞七捻三 - LINUX DO 帖子里佬友也贴上了其他模型的成绩。
参数:openrouter免费模型默认参数。测试方法为逐题测试,测完一道开一个新话题。
免责声明:1.未采用官方输入格式,不代表模型真实性能。
2.模型是prover,理论上证明才是强项,丘成桐这样的求解题并不是官方应用场景。
因此本测试仅供娱乐。
目前第一轮已测完。
目前进展:第一题正确,第二题正确,第三题错误(答案341,回答594)第四题错误(答案2,回答34)第五题正确,第六题错误(答案1066,回答1231)第七题正确 第八题正确 第九题错误(答案378,回答126)第十题正确 第十一题错误(答案733,回答261) 第十二题正确 第十三题正确 第十四题错误(答案1551,回答1552,差一个好可惜)第十五题正确。
错误题目:3,4,6,9,11,14
现在开始重测一遍错题。
第三题仍然错误(答案341,回答405)
第四题做对了!
第六题错误并陷入死循环(答案1066,回答428,但知道不对,然后陷入死循环)
第九题做对了!评论区佬友也一次做对,说明做对概率高一点。
第十一题做对了!
第十四题做对了!评论区佬友也一次做对,说明做对概率高一点。
第二轮总结:还剩3,6做不对。
现在开始第三轮。
第三题仍然错误(答案341,回答405)
第六题做对了!
第三轮结束,还剩3做不对。
对于3,将其转换为纯自然语言,在 {1, 2, …, 2025} 中有多少自然数 x 使得存在某个整数 y 满足 x ≡ y² mod 2025
还是没做对,给出回答810
看来3用自然语言很难做对了。

