4090 部署了Qwen3.8 27b Q4量化+kvcache也Q4_0的情况下都不能拉满256k上下文,这100多k的上下文配合上雷霆大思考对话个1-2轮就要压缩了,感觉几乎完全没有体验啊。 48g的话应该能拉到7-800k上下文,感觉应该能有很不错的体验了
4 个赞
佬,小米准备要出的那个 AI盒子,不知道能不能流畅地用呢
1 个赞
感觉大概率不能的,能跑吐字估计也就10左右,本地跑qwn3.8这种感觉4090级别的性能应该是下限了差不多每秒80k ,我另一张卡9070xt跑这模型差点没给我整哭
1 个赞