我在想,既然国模benchmark这么厉害,那如果把所有的编程任务都用benchmark的格式格式化会怎么样?

国产模型的 benchmark分都那么老高,然而实际一到工作中往往不大令人满意。
那假如是对bm有过优化的话,如果我们直接把bm的题拿出来,然后提取那些题集的特征,之后编程的时候都用那些题的特征来分解任务,那是不是真的就能吊打opus了? :distorted_face:

3 个赞

不一定,也可能是直接就把答案背下来了,找再多特征也不一定有用

3 个赞

佬可以好好去看看国模发布的benchmark列表 并不是都厉害
只是某几个bench亮眼 但是大多数还是御三家更强(或者他们排名靠前)

宣传某个benchmark厉害 → 公众号自媒体吹 → 变成了跑分厉害
但其实大部分benchmark比不过御三家的 所谓的跑分没输过 跑分都没跑赢过(指总体benchmark来看)

3 个赞

感觉Bridge bench还比较靠谱,https://www.bridgebench.ai/

1 个赞