英伟达 NIM 免费模型推荐指南

英伟达 NIM API 中有很多模型,但是很多是几乎不可用,或者是使用体验很差的,做了一份可用模型列表
还有发布时间表,用于给佬友们对照

筛选标准,首先是 API 稳定调用,还有输出速度和首字延迟。第二考虑的是发布的时间尽量要新。综合这些标准,长期自用,测试出下面这些模型

调用稳定,速度有保障

模型 ID 发布日期 首字延迟 TTFT (ms) 输出速度 (tok/s)
google/diffusiongemma-26b-a4b-it 2026-06-10 1501 ±507 182.4 ±44.2
nvidia/nemotron-3-ultra-550b-a55b 2026-06-04 1120 ±11 144.7 ±67.5
stepfun-ai/step-3.7-flash 2026-05-28 1149 ±206 68.0 ±16.1
stepfun-ai/step-3.5-flash 2026-02-12 937 ±21 117.3 ±65.7
google/gemma-4-31b-it 2026-04-02 2515 ±839 20.6 ±7.4

不够稳定,可以尝试

模型 ID 发布日期 首字延迟 TTFT (ms) 输出速度 (tok/s) 备注
deepseek-ai/deepseek-v4-pro 2026-04-24 4266 ±3271 18.4 ±7.9 5/5 成功;TTFT 波动大
deepseek-ai/deepseek-v4-flash 2026-04-24 1125 12.8 仅 1/5 成功
minimaxai/minimax-m2.7 2026-03-18 2078 ±614 37.4 ±16.3 5/5 成功
minimaxai/minimax-m3 2026-06-01 5756 ±8622 3.7 ±1.1 5/5 成功;极慢
z-ai/glm-5.1 2026-04-07 0/5;HTTP 410,已于 2026-07-02 EOL
z-ai/glm-5.2 2026-06-16 2568 ±932 17.3 ±4.7 5/5 成功

如有错误,欢迎佬友指正

48 个赞

ds v4 之前有段时间飞快,不过也是偶尔能用偶尔不能用的状态

2 个赞

最知名、最热门的模型,基本上都不会稳定

2 个赞

这个主要还是有点慢,调用起来首字母返回都好久,是不是得挂:ladder:加速?

1 个赞

评测辛苦了,感觉现在ai发展飞速,日常对话,后期翻译和文本修改,用不到御三家等主流模型,反而这些冷门模型在速度和使用上能够满足。

1 个赞

只能说dsv4flash最快的时候是限制每小时10次请求的时候,估计是一开始挤爆了加了这样的限制,加上过了几天可能发现没负载了又关掉了,现在都经常空回复了

不同区域、不同服务器和网络环境,调用模型成功率都不一样的。。。

glm-5.2 有这么快吗? 我本地测试都要200多秒呀 才能有输出

之前qwen3.5-397b-a17b 也挺好用的翻译响应快 甚至够养虾,可惜现在拉了直接无响应

1 个赞

英文达的模型是不是都不返回思考内容 :thinking:

推荐的 11 个模型中,只有两个模型没有思考内容

1 个赞

一直用的v4 flash 昨天一看炸了,但是换glm5.2倒是跑得飞快

这些模型稳定吗?会不会总断或等待呢

的确NV上的模型就是太不稳定了。以前gemma-4-31B-it挺快的,现在慢的要死,还经常不成功

感谢评测,这个结果和我的感受基本一致,知名的、调用量大的模型就会很慢,不稳定。小众的模型就很快了

deepseek-v4-flash-0731 有望出现在 NIM API 里面吗?