本地部署个人体验48g显存才开始有能用的体验

4090 部署了Qwen3.8 27b Q4量化+kvcache也Q4_0的情况下都不能拉满256k上下文,这100多k的上下文配合上雷霆大思考对话个1-2轮就要压缩了,感觉几乎完全没有体验啊。 48g的话应该能拉到7-800k上下文,感觉应该能有很不错的体验了

4 个赞

佬,小米准备要出的那个 AI盒子,不知道能不能流畅地用呢

1 个赞

感觉大概率不能的,能跑吐字估计也就10左右,本地跑qwn3.8这种感觉4090级别的性能应该是下限了差不多每秒80k ,我另一张卡9070xt跑这模型差点没给我整哭

1 个赞