国产模型的 benchmark分都那么老高,然而实际一到工作中往往不大令人满意。
那假如是对bm有过优化的话,如果我们直接把bm的题拿出来,然后提取那些题集的特征,之后编程的时候都用那些题的特征来分解任务,那是不是真的就能吊打opus了? ![]()
3 个赞
不一定,也可能是直接就把答案背下来了,找再多特征也不一定有用
3 个赞
佬可以好好去看看国模发布的benchmark列表 并不是都厉害
只是某几个bench亮眼 但是大多数还是御三家更强(或者他们排名靠前)
宣传某个benchmark厉害 → 公众号自媒体吹 → 变成了跑分厉害
但其实大部分benchmark比不过御三家的 所谓的跑分没输过 跑分都没跑赢过(指总体benchmark来看)
3 个赞
感觉Bridge bench还比较靠谱,https://www.bridgebench.ai/
1 个赞
