私有部署:升级4090-48G单卡 qwen3.8:27b已拉闸,后期会产出几个文档给佬们参考

配置

key
YmM0Y2JmODQyNWFlYTlhN2E1NzhkMDZkZThjNjk5MjM=
费用


性能监控 实测数据

部署命令

vllm serve /hy-tmp/models/Qwen3.8-27B-FP8 \
  --tensor-parallel-size 1 \
  --max-model-len 192000 \
  --kv-cache-dtype fp8 \
  --gpu-memory-utilization 0.95 \
  --max-num-seqs 2 \
  --reasoning-parser qwen3 \
  --enable-prefix-caching \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
  --host 0.0.0.0 \
  --port 8000 \
  --served-model-name qwen3.8-27b-fp8 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder
52 个赞

fp8版本吗?我今天上午还在调5090跑qwen3.8-27b,32gb跑nvfp4量化,最大context只有20k不到 :smiling_face_with_tear:

我试过32G 能到128K呀

4090+24G+mtp+视觉+Qwen3.8-27B-NVFP4-Q5K-mtp.gguf 这个模型,开了 256k 上下文,基本上把 24G 内存占满了。首字时延 860 ms | 每秒 89 tokens。

思考了 500+秒以后的鹈鹕,图形动画都还不错,我觉得可以了。

2 个赞

256 咋才 24G ,有点离谱呀我得试试你的模型,我64K都21G了

我用了4张3090 部署的 qwen3.8 27b 支持256k上下文 朋友们都不用 有需求的可以私我 可以给个key 私有化部署的

9 个赞

有这种好事,咋还不用,我私信下 :heart_eyes:

我草,这都没人用,佬友给我用用,小模型里面非常能打的了

佬,可以换成Qwen3.8 Flash Next了,能力提升不少,速度也快不少

Qwen3.8 Flash Next 4张卡不够吧

1 个赞

够的,这模型的51B Embed说是可以放在内存的,实在不行跑个IQ3 好像能力也比Qwen3.8 27B强

而且快很多

1 个赞

拿4090跑的256k fp4只能1并发 :smiling_face_with_tear:

这是啥面板啊佬,有点意思,我也想去装一个

我试试把 我看看能不能装0.0 主要是 kv池太少了 做了加速就只有500多k 这个模型好像是 1g 能多装3万多k

哥 好像没了,我这获取不到模型了

Qwen/Qwen3.8-Flash-Next 好像现在没有无审查版?

3.8有无审。但你这个类型好像没有

还在就是慢,正准备优化下现在64K有点慢。 :grinning_face:

有吧,我找了下huggingface, 搜一下 uncensored 或者 abliterated

24G 跑不了256,那玩意会跑到CPU,慢到离谱