公司有16张H200,主要做智能体,会有复杂的工具调用,也会用于部分代码生成,目前主力模型的 qwen3-coder-480B,想咨询下各位佬,目前有没有开源的其他更强模型,GLM4.6 和 kimi 能力怎么样啊? ![]()
这两目前应该是编程特化的吧?应该不适用你们的场景
真有钱…
我们测试的qwen3-235B和qwen3-coder,反而coder效果更好诶,我们场景工具调用贼多,有时候还需要工具里面生成代码运行来执行某些任务
glm4.6,minimax m2写代码都不错,kimi更大,agentic不错,但代码能力比前面的差点,但调用工具应该有专门训练
lmarena Coding排名来看,kimi不错 ![]()
kimi不是力大砖飞型么 可以试试看 反正不差钱呢
反正这么多卡,AB 测试走你。
Kimi-k2、GLM-4.6、minimax-M2、Qwen-coder 等模型一起飞,万一哪个的数据集跟你们的场景更搭呢?搞个api 网关,出口都是一样的
ahh 有道理唉!
我何德何能,能对价值四千万的显卡使用方式提供建议![]()
看这里
没那么贵啦,我们俩服务器总包好像600多万
感觉还是根据业务需求调整
我要是是王思聪,也想整几张H200玩玩。可惜呀,现在就是送给我,电费都交不起。
兄弟,你们部署的 Qwen3-Coder-480B-A35B-Instruct 需要多少显存G,是多少上下文
8张卡,1.1TB左右,而且还不稳定 上下文是 262144
目前我们换到GML-4.6了,感觉比千问好点,显存用了1T左右
其实理论上这个模型最多占用600G显存左右吧 这个应该和你设置的gpu_memory_utilization这个类参数挂钩。
这个可以分享一下是什么场景吗? 有哪些工具使用 是在离线环境下的MCP吗?
我们并发要求比较高,还有输出速度,所以给的显存比较大
一些自定义的工具,目前还没封装mcp,例如rag,还有我们业务场景例如合同审核,批注,CRM,BPM系统的自动化操作和表单填写等等
这个并发还是output-token大概是多少? 用了什么推理框架:vllm 还是 sglang?