Hy3评测:DS别找了,我怕Hy误会

先放野帮


之前某知乎测评博主在小群里说hy3是小核弹,结果测出来是一坨。这个正式版一看这么突飞猛进啊。
尤其是这个模型只有300B的情况下。速度还快,基本完全平替v4f,甚至能挑战一下v4p

放一些还行的案例



hy的突飞猛进,感觉和腾讯codebuddy的数据飞轮高度相关。期待后续scaling能带来怎样的惊喜。

梁子你动一下啊

10 个赞

能不能打4.6 sonnet,看这样子不错啊

要真有这么厉害,结合 glm-5.2 的参数和性能比,我越来越觉得堆模型参数的 scaling law 可能不是正路了。也许接下来会有越来越多的“小参数量”模型杀出重围。

1 个赞

野榜之前还说 Qwen Max 3.7 Thinking 很强呢
出来再说,等其他人测试

1 个赞

但是缓存价格比v4f贵多了 这个价格还能一战

腾讯这次是真牛逼,姚顺雨证明了自己,希望下个大模脚踢deepseek

2 个赞

楼主有没有记录 token 用量啊?这个是不是比 Preview 多了好几倍

腾讯那个小的翻译模型挺好的,大模型还没试过

不过其实我感觉DS一直主要在做架构,后训练不是很很强势

1 个赞

这个minicraft是测试啥的啊,我看好多测试都有

梁子在给国家淌一下鲲鹏的测试呢,好像结果被美团先完成了

1 个赞

稳扎稳打,scaling law还是王道。
不过不能光caling up, 后训练啥的也要跟上


人家直接入职HY了 :rofl:

5 个赞

利益相关方,那没什么看的价值了,很有可能是过拟合了 :sweat_smile:

Workbuddy今天限免,一顿爽蹬,不得不说腾子的基建就是猛,这么多人用居然也没那么卡……

什么?野榜已经被收编了吗?那么是时候成为新的野榜了。:smiling_face_with_horns:

2 个赞

6666,直接针对测评训练了吧,感觉没有参考价值了

到底是小核弹还是垃圾, 时间会证明一切
耄老板反正信誉能不能扫共享单车都是问题

但是好像没有coding plan套餐 只有token 的

如果不是 benchmaxing 的话, 那就很强了, kimi 2.7 参数过 T 了吧, 被 hy3 摁在地上

:melting_face:
看标题还以为是 Hy 更新了呢 :melting_face: