额,其实看一下 SimpleQA 的数据集,我觉得。。。干嘛要让模型背下这些东西?
这里从SimpleQA的数据集随便摘取的几个问题:
- 卡尔·波兰尼在哪一年成为国民公民激进党的创始成员?
- 在2019年5月12日举行的印度超级板球联赛(IPL)决赛中,德韦恩·布拉沃(Dwayne Bravo)打了多少个球?
- 马西亚·巴图西克(Marcia Bartusiak)将“黑洞”这一术语追溯到哪位物理学家(名、中间首字母和姓氏)?这位物理学家在20世纪60年代初曾将这种现象比作“加尔各答黑洞”,一个臭名昭著的监狱,人们进去后就再也无法活着出来。
- 戴维·希贝特(David Hibbett)是从哪所大学获得文学学士学位的?
- 《鲜活的颜色》(In Living Color)节目中1990年的Fly Girls成员中,谁待了五个赛季?
- 小行星224 Oceana是根据哪个具体的大洋命名的?
- 非营利组织Prayas Nepal是在哪一年成立的?
这里面四千多个问题都是openai研究员编写的,这确实是事实性问答,但我认为不如说这些是西方社会的冷门历史问题,都是那些细枝末节,对于普罗大众根本没啥人去关心的问题(尤其是对西方文化并不关心的中国人来说)。
这些事实记住有啥用呢,徒占空间罢了。与其说不联网测试模型知识量,我认为这个QA集更适合联网RAG问答系统的性能测试,既测试RAG机制,又测试模型利用联网搜索的能力。
大模型的训练过程类似一个压缩的过程,那些多少多少B的参数就像是存储空间。
你把这些事实性的东西压缩到一个参数量有限的模型里,占用的空间多了,能放其他东西的空间就少了。
设想一个场景:如果一个中国的模型训练团队选择在训练的过程中,(通过训练语料选择等方法)让模型更多地记住关于华人/华语文化圈的历史细节(例如邓丽君的淡淡幽情专辑发行于哪一年),而减少记住关于上述西方的历史细节。那么训练出来的模型在SimpleQA上翻车,但是受到华人的喜爱(认为这个模型更懂华语文化)是很自然的事情。
如果Qwen团队确实没有针对上述问题进行特别优化,而是让模型的参数空间更多地放在了更适合生产场景的任务上,我认为也没必要认为是模型在事实问答上翻车,因为这些事实,不仅能借助联网搜索更好解决,还因为地缘等因素没那么多人关心,或者至少在生产任务上,没啥人关心。
只需要记住,SimpleQA是事实问答数据集,而不是知识问答数据集,就能对这个Benchmark祛魅了。事实和知识还是有很大区别的。