北京大学、清华大学与DeepSeek-AI的联合研究团队发布了一项针对大语言模型推理架构优化的最新研究成果。该团队成功研发了名为DualPath的全新推理系统,专门解决智能体工作负载下KV-Cache存储I/O带宽受限的技术难题。
依然27B小模型
北京大学、清华大学与DeepSeek-AI的联合研究团队发布了一项针对大语言模型推理架构优化的最新研究成果。该团队成功研发了名为DualPath的全新推理系统,专门解决智能体工作负载下KV-Cache存储I/O带宽受限的技术难题。
依然27B小模型
啥时候的事呀?
这是用那个卡通提示词给大香蕉要生成的吗?
文字生成的真好啊,我上次用大香蕉生成流程图文字惨不忍睹
2月25日发布的,新鲜的,难道说……
没看懂是干啥的哈哈哈
缓解 IO 性能导致的推理速度慢。
总感觉真的要来了 ![]()
这一天天的,一点点的漏消息,不像deepseek以前的作风呐
诶,GPU高速互联?
官方啥都没说,各路无良媒体疯狂蹭来蹭去 ![]()
没看论文,这个和PD分离哪个更高效?
还是PD分离,只是传统PD分离里Prefill处理prompt的时候Decode基本闲着,现在不让它摸鱼了,两边一起IO,算是架构优化压榨性能了
嗯嗯,在上下文比较长但输出很短的情况下确实会存在PE很忙但DE很闲的情况,一开始只想到PE和DE都在拼命干活的情况