请教一下,4070s显存12G,内存32G,适合何种开源大模型部署

rt,本地日常使用,能写代码更好,不过这个显存应该难度很大,每天跑些新闻收集应该还可以

1 Like

qwen 3.8最近好像有小模型不错
27B可以了解一下

1 Like

可以去这个地址看看,填写你相应的配置,就能看到你可以跑什么模型
www.canirun.ai

7 Likes

也就跑9B的了吧,再大够呛了,9B的开128K上下文?256估计开不到

1 Like

语言生成模型没啥能用的,我5080 16G,48G内存,把qwen3.6和gemma4各种量化都试过了,没眼看.唯一有用的就是部署向量模型给知识库用和hy-mt2的本地翻译


让ai帮我装了一些,基本都试过,我感觉完全没啥可用的,还不如用一些免费的小模型都比自己部署舒服,也可能是我还没上道,有的是占用内存的,基本上都满了,就做不了别的事情,有的放显存的,实际上下文和速度还有效果其实都一般,不如opencode free
ps:我也是个外行,纯玩的

1 Like

前面几个说的 27B 不太可能放得下,12G 先别想着玩了,可以玩玩 sd 生图,8B 或者更小不推荐

1 Like

qwen的35B可以试试,27B不用试,跑不了。

1 Like

只能用35B-A3B这种MoE模型了,稠密模型跑起来也很慢。我个人也是12G+32G的组合,尝试过用Qwen 3.6 35B A3B Q4_K_M,配合LM Studio的GPU卸载等设置勉强跑起来了,速度大概50-70 Token/s,但是显存和内存使用量非常极限,经常用着用着就OOM了

正在用 3060 显存 12G 内存 32G 跑 Qwen3.8-27B-Q4_K_M,实测 5 token/s :joy:

聊天可以,coding就别想了哈哈哈哈,我今天用opencode+5080(16GB)+64GB来试了试qwen3.8 27B,非常慢(只有0.5-0.3tokens/s),根本不具备任何工程上的使用意义 :rofl:

我去 这么慢的吗 那还玩个der 老实充值了

qwen最小的模型,好像是9B吧。反正你这个配置我觉得本地部署比较够呛。

同显卡,64g内存,本地部署根本不敢想,没啥折腾的,我都是用于comfyui

这个显存和内存还想玩本地部署写代码

日常够呛

部署Steam是最实在的,大模型折腾不了

3 Likes

生图还有折腾空间 写代码就算了 8B,9B的写一个排序算法都不一定能跑

倒不是打击佬,我之前也折腾过本地生图生视频啥的,简单来说就是这玩意主要看你的显存和内存,显存基本得48G,内存96G左右才能起步,达到能搞点东西的程度,在这之下的,还不如薅点站内的公益站或者opencode的免费key了,大部分低配置的本地模型真的流口水。

Qwen3.8-27B可以跑起来,社区微调的模型unsloth/Qwen3.8-27B-GGUF比较不错,值得一试。