这个3B的模型,只提升可定量打分的能力,应该说是超级做题家吗?难道本地coding agent的时代来了?



是模型真的强,还是bench失效了?好像是两方面都有?

https://mp.weixin.qq.com/s/9KVW_zZynu5xXyUOCmsqYQ

三个臭皮匠顶一个诸葛亮, 三个不够就三十个, 三十个不够就三百个.
说不定可以依靠不差的做题能力 + 幻觉爆种取胜.

希望不是做题家吧
我多少得去看看是怎么个事

通识方面小模型是最难的,但是编程方面说实话应该是没有这么难的,逻辑清晰,奖励可以验证。如果编程语言再限制在这几个benchmark收集的语言上进行训练,肯定不难的。重要的是编程可以很容易的获得验证的奖励,而通识或者人类的指令跟随是需要大量的人类数据的。

开放权重了吗?有第三方实测看看效果如何吗

感觉像是偏科加RL filter,能力确实很吓人,不知道成绩可不可信。

确实,他说的这几个场景应该做RL毕竟好做,有明确verifier

理论上这种专用模型做算子优化之类的,很窄的任务,是不是有戏?

一般来讲,要么是一道高中数学题要思考几十万token,要么就是直接把测试集丢进训练集里面

肯定是有戏,但是如果要一个通用模型,分两层独立的模型去优化的话,这个问题会很复杂,因为奖励分配的问题,你不知道是上层模型选择专用模型选的有问题,还是专用模型解问题解得有问题,所以目前合并在一起优化是比较简单的做法。

模型能力期待一手第三方测评. 看了一眼文章来源,出自机器之心 :face_with_raised_eyebrow:

我发现在训练集里加入少量测试集可以显著提高模型表现
:index_pointing_up::nerd_face:

3B 模型都能干碎我,那还说啥了兄弟,我跳了

基于 Qwen2.5-Coder-3B
这么旧的架构,我更倾向于背题了

在新的周赛好像成绩也不低,,难道这种做题本质上背题就行了?可能也差不多

嗯,我也觉得可能有相当的原因是这些bench失去了意义,唉,做题家的悲哀)

看标题猜到了是vibe thinker。挺多ai博主在做这个内容 :smiling_face_with_tear:

因为确实有点核弹级别欸,,如果小模型能在专用任务上面做好,那搞两三个小模型,至少笔电男大的8G显存可能能帮我们解决大作业了 :smiling_face_with_three_hearts:

刚才大概看了一下huggingface,这模型只能用于普通对话,因为没有训练agent能力,没法用到cc/codex/各类claw上面

bench失效和盯着榜刷还是两个性质. 机器之心+国内大厂团队买头条刷榜的概率也会大大提高