今天英伟达开源了一款名为 Llama-3.1-Nemotron-Ultra-253B-v1 的新模型,性能逼近拥有 6710 亿参数的 DeepSeek R1,但只用了不到一半的参数量。
基于Llama-3.1-405B-Instruct,老黄不讲武德自己玩啦
今天英伟达开源了一款名为 Llama-3.1-Nemotron-Ultra-253B-v1 的新模型,性能逼近拥有 6710 亿参数的 DeepSeek R1,但只用了不到一半的参数量。
基于Llama-3.1-405B-Instruct,老黄不讲武德自己玩啦
大家对对标r1已经没感觉了。。对标个o3啥的还有点意思
我们能玩再说吧
以后名字里带
可能会有debuff吧
这个是微调模型,也许加了一点题库,不用太在意的。
如果是NVIDIA自己从头训练的模型,那还挺有意思的。
r1马上都成"过时"模型了,w对标点别的吧w
我的乖乖 梦回魂斗罗的即视感
等一手Livebench评分
直逼r1意义不大了 如果是这个水平我不如用qwen72b
老黄的官网模型感觉降智
这是自动发帖吗(
逼近…太委婉了
真是古早风格
自逼 ![]()
居然还有这种东西?![]()
佬可以关注一下他过去回复,有点像关键词匹配w
蛤?不是,我没搞懂这是说的什么啊
自动发帖?工具?
你可以看一下这位佬友过去回帖记录w
牛啊,这模型有点东西