先放野帮
之前某知乎测评博主在小群里说hy3是小核弹,结果测出来是一坨。这个正式版一看这么突飞猛进啊。
尤其是这个模型只有300B的情况下。速度还快,基本完全平替v4f,甚至能挑战一下v4p
放一些还行的案例
hy的突飞猛进,感觉和腾讯codebuddy的数据飞轮高度相关。期待后续scaling能带来怎样的惊喜。
梁子你动一下啊
先放野帮
放一些还行的案例
hy的突飞猛进,感觉和腾讯codebuddy的数据飞轮高度相关。期待后续scaling能带来怎样的惊喜。
梁子你动一下啊
能不能打4.6 sonnet,看这样子不错啊
要真有这么厉害,结合 glm-5.2 的参数和性能比,我越来越觉得堆模型参数的 scaling law 可能不是正路了。也许接下来会有越来越多的“小参数量”模型杀出重围。
野榜之前还说 Qwen Max 3.7 Thinking 很强呢
出来再说,等其他人测试
但是缓存价格比v4f贵多了 这个价格还能一战
腾讯这次是真牛逼,姚顺雨证明了自己,希望下个大模脚踢deepseek
楼主有没有记录 token 用量啊?这个是不是比 Preview 多了好几倍
腾讯那个小的翻译模型挺好的,大模型还没试过
不过其实我感觉DS一直主要在做架构,后训练不是很很强势
这个minicraft是测试啥的啊,我看好多测试都有
梁子在给国家淌一下鲲鹏的测试呢,好像结果被美团先完成了
稳扎稳打,scaling law还是王道。
不过不能光caling up, 后训练啥的也要跟上
利益相关方,那没什么看的价值了,很有可能是过拟合了 ![]()
Workbuddy今天限免,一顿爽蹬,不得不说腾子的基建就是猛,这么多人用居然也没那么卡……
什么?野榜已经被收编了吗?那么是时候成为新的野榜了。![]()
6666,直接针对测评训练了吧,感觉没有参考价值了
到底是小核弹还是垃圾, 时间会证明一切
耄老板反正信誉能不能扫共享单车都是问题
但是好像没有coding plan套餐 只有token 的
如果不是 benchmaxing 的话, 那就很强了, kimi 2.7 参数过 T 了吧, 被 hy3 摁在地上
![]()
看标题还以为是 Hy 更新了呢 ![]()