NVIDIA发布新模型 性能直逼 DeepSeek-R1

今天英伟达开源了一款名为 Llama-3.1-Nemotron-Ultra-253B-v1 的新模型,性能逼近拥有 6710 亿参数的 DeepSeek R1,但只用了不到一半的参数量。

基于Llama-3.1-405B-Instruct,老黄不讲武德自己玩啦

12 个赞

大家对对标r1已经没感觉了。。对标个o3啥的还有点意思

12 个赞

我们能玩再说吧

常规问题还可以,速度也快,但是代码这品味 :laughing:

11 个赞

以后名字里带:llama:可能会有debuff吧

这个是微调模型,也许加了一点题库,不用太在意的。
如果是NVIDIA自己从头训练的模型,那还挺有意思的。

r1马上都成"过时"模型了,w对标点别的吧w

我的乖乖 梦回魂斗罗的即视感

等一手Livebench评分

直逼r1意义不大了 如果是这个水平我不如用qwen72b

老黄的官网模型感觉降智

这是自动发帖吗(

逼近…太委婉了

真是古早风格

自逼 :sweat_smile:

居然还有这种东西?:flushed_face:

佬可以关注一下他过去回复,有点像关键词匹配w

蛤?不是,我没搞懂这是说的什么啊 :joy: 自动发帖?工具?

你可以看一下这位佬友过去回帖记录w

牛啊,这模型有点东西