9小时 Qwen3.8-27B-Q5-K_M 服务

Base URL:
http://oracle-sg-arm1.youguess.site:18000/v1
API Key:
随便写,我没设置

祝大家国庆快乐!

3 个赞

佬友,为什么不能做核弹啊 :drooling_face:

1 个赞

什么核弹?不好意思,我没理解这是啥梗?

自部署的不应该是无审查版吗

呃,我直接用的 unsloth 的量化版,就写写代码,无审查版的我不知道该选哪个好,huggingface 上太多了,没比较过。

有什么注意事项吗,在Cherry中看不到模型。

哈哈哈哈哈这是佬嫖的tpu吗

你让 cherry 自动获取模型,应该可以,我这里没问题。
要么就是并发数量太多了,你的链接超时了。

嫖的 GPU ,TPU 排不上队啊,自从我分享了我在 GitHub 上的源代码,我发现 TPU 的排队时间显著增加了 :sweat_smile:

最开始我的 TPU 两个小时就能排上,后来 4 个小时,现在要 24 个小时以上 :smiling_face_with_tear:

但是,我用其他的 TPU 脚本又可以 8 个小时排上队,Kaggle 针对 TPU 部署大模型应该是有了防白嫖机制了 :face_with_crossed_out_eyes:

欸 俩T4我之前测试的时候上下文长一点首字就非常非常慢
佬这个大概什么速度呀

你说的对,确实可以,就是超时了,多试几次。

:sweat_smile:我没测试,因为 GPU 只有 32G 显存,Q5 量化大概就占了 20G,所以我的优化方向主要是长上下文,而不是并发和速度