求助一下为什么我这omxl部署本地模型那么慢,一直卡在37%那里, 设备是 macmini M4 24G, 模型 Qwen3.5-9B-unsloth-mlx,有没有大佬指点一下该怎么设置
上下文大么,如果上下文太长的话 prefill 阶段会很慢
自己电脑跑 claude code、openclow 这种长上下文都很吃力的
你可以去跑这个测试
然后看TTFT (ms) 指标 例如我这里就是
1024 上下文 prefill需要 1.58s
4096 上下文 prefill需要 5.81s
8192 上下文 prefill需要 14.2s




