Deepseek是否打破部署定式?摆脱GPU?

私人家用部署性能要求不会特别高,没有多用户并发要求,最多也就三五个人用,也没有训练的需求。

装大模型就得要大容量,大显存的显卡都太贵了,而且似乎不能/很难扩容?
架构上CPU和内存则是分开,内存扩容比较方便,只需要解决带宽达到一定的 算力带宽比,就会有较好的效果,算下来应该会更划算?

并且我注意到,视频里看到似乎它都没有把这个 EPYC 9B14 CPU 的算力发挥出来,因为内存带宽原因线程开不高,然而 4 线程和 32 个线程跑只有一两倍的差别,并行多核带来的收益不如想象中那么大,这个合适的 算力带宽比 可能并没有那么高。

视频里给出的测试结论是

  • single thread: 0.73 tokens/s
  • 4 threads: 2.07 tokens/s
  • 32 threads: 3.77 tokens/s

我还看到一些测试

  • Apple mac studio 192G: 15 tokens/s
    • Bandwidth: 800 G/s
    • FP64: 2.5 TFLOPS
      • 3.125
    • FP32: 26.98 TFLOPS
      • 33.725
  • 8 * A800: 14 tokens/s
    • Bandwidth: 3.1 TB/s
    • FP64: 9.7 TFLOPS
      • 3.13
    • FP32: 19.5 TFLOPS
      • 6.29

FP64的算力带宽比分别是 3.125 和 3.13,看上去的确是算力带宽比决定了速度,而运行的不论是 CPU 还是 GPU 其实没那么大影响?(为什么这个 8*A800 会这么慢。。。。他这测试真的能用来参考么。。。

百度感觉纯纯垫脚石:sweat_smile::sweat_smile::sweat_smile:

佬能说几个CPU架构的加速卡国产的吗,最近在搜这种,感觉好像都做的不怎么样,而且他的生产很多还卡在光刻机吧

此N非彼N

我用纯cpu跑过了,1token/s,当然我是ddr4内存比那个B站播主差一些。还有就是ollama默认671b的r1也不是满血,是4bit量化版本。要是1.4t的满血671b模型,纯cpu推理会更慢

2 Likes

不管它怎么分,都是按用户需求来阿.
除了游戏卡和专业卡,那AI卡也是一大需求.
问题是老黄现在垄断赚饱饱了企业的,才懒得鸟小众人群.

哪有什么必要不必要,按阶梯来就是了.
你说游戏卡,还有专业卡,现在为什么没有AI卡?
很明显就是垄断之后的傲慢.
现在8000 9000还要抢,卖你个4080 16G就必要了?
iPhoneX年代的60阶GTX960才1399,现在5060得卖你3599了,
说到底就是垄断

嘿嘿,硬切割用户需求,同样的芯片,不同的驱动调度,指令的开放有区别 :bili_017:

按照视频里测试的结果看,不同的量化版本只会影响大小不会影响速度

有不少历史遗留问题导致的,用户受众并非给个人主机。 例如一些国内超算平台上部署的Many-Core Architecture的CPU。商业化产品的话,流片生产的大多是GPU-like的吧。

但是我也在同样环境跑了70b的4bit量化版r1,的确是比671b的4bit量化版稍微快一点

EPYC 9B14 CPU 我不太熟悉其性能和架构。但是下面的对比有点奇怪,首先FP64就不看了,一般不会用FP64推理。 应该关注FP32和FP16/BF16的性能(这里不考虑INT8量化以后的模型推理,而至于FP8得H系才支持)。

Apple mac studio 192G,芯片是M2 Ultra,cpu-money上给出的性能是 27TFLOPS的FP32,54TFLOPS的FP16,带宽按满血800GB/s来算。

A800 单卡来看,推理用的也应该是Tensor Core占主,而非CUDA Core吧。
我用一组官网的A800-datasheet上的性能参数:


156TFLOPS的FP32性能,312TFLOPS的BF16/FP16性能,接近2TB/s左右的内存带宽。 可以看到的是 虽然计算性能是Ultra的

更别说是8块A800 做并行推理,这个速度真的只是和M2 Ultra一样吗?有点奇怪啊,按成本推算,一块A800价格(PCIE版)便宜点算个12W,8块也得96W,Apple mac studio 192G一台价格4w5 (就选1T硬盘吧 真的太贵了)。虽然A100/A800做推理不如L系划算,但也应该没到这个程度吧 )。

综合来看,单卡A800,带宽是M2 Ultra的2-3倍,FP32/FP16性能是5-6倍,成本大概是3倍。更不用说对比的还是8块卡,属实有点匪夷所思。

模型推理这块,硬件层面要衡量算力带宽比,实际任务层面要衡量任务计算访存比。但硬件衡量这块有一个前提,当任务相同且硬件性能差距并不是特别明显时,算力带宽比可以有效评估硬件的算存均衡性。 当某硬件属于 算力较低、带宽也较低的情况,虽然均衡,但整体性能显然是差于另一个算力和带宽都高于它的硬件的。只不过在这个场景下,双方访存带宽都是瓶颈,二者的访问存带宽上的性能差距 要小于算力差距,缩小了在任务负载上的差异性表现。

另外,访存速度确实也是目前业界非常关注的问题,目前实践的方案中,HBM内存封装能达到当前最好的访存速度,但内存容量有限;而CPU靠DDR想拉平访存性能,不太可能。 目前成熟的方案 还是GPU芯片+HBM作为MainMemory + DDR作为off-load补充扩容。

1 Like

量化最直接影响的是显存占用,在计算速度提升方面 得看硬件的低精度支持(是否包含特定的低精度计算部件)、是否支持拼接指令来使用更长的指令部件(比如 多个8bits 计算拼接成一条16/32bits指令)等。 比如你量化到了8bits,但是实际硬件不支持直接进行8bits计算、也不会做指令拼接,那么大概率8bits计算仍然是放在16位/32位的指令部件上计算的,这就会出现 8bits和16bits、32bits的计算性能上差异不明显。
当然量化后,对于访存的压力显著降低,访存速度的提升应该还是有的。

1 Like

哪里没有ai专业卡

那国产显卡,比英伟达还贵怎么办(我说的是性价比)
AMD和intel的显卡也不见得有多便宜
还有以前的购买力和现在的购买力能一样吗

英伟达垄断你就不买了吗,那你买摩尔线程打游戏呗

1 Like

单纯了解一下tieba_026

买不买跟我骂不骂两回事.
产品和企业/品牌产品,我作为消费者,它是服务我的,不是我的 idol,好就夸,不好就骂,没必要捧臭脚硬给找合理性吧?
购买力?我都说了iPhoneX的年代,iPhone现在卖3万了?
只有AMD和Intel,欧美传统艺能,几大公司架起来一起垄断,就跟之前closeAI 和 Claude 还有 gemini一起一样.

那你认为是按照性价比定价还是按照购买力定价,如果英伟达卖1000多,那马上就会被告垄断。别的企业竞争不了原地倒闭

所以就回归题主的标题了,打破垄断或者打破部署定式.
到时候它5060 6060卖1500RMB,也没人告它垄断.
deepseek-R1免费开源之后,api也是十分之一价格,
closeAI喊了一年的o3,突然R1一来,它几天就出个o3-mini,还抠抠的免费给几个试用.
难道这跟ds一点关系都没有? :joy:
你刚才说的摩尔线程,MTT S80才3060的水平,给的可是16G显存阿,
实话实说,有段时间卖1299,我觉得真的未来可期吧.现在只是驱动不行.
还是那个道理,哪怕我买外国产品,我也想国产越来越好,这样才能买更便宜的外国产品.

你想骂就骂,想买就买。

市场规律又不听你的,恶意降价会垄断行业,这就是规律