GPT6luna 和 GPT6sol 的缓存能不能共享

有 pro PLUS 自己反代的佬友有没有测试过这个问题,我用几家中转站发现都是共享缓存
我利用ai分析原理,还是有可能部分共享kvcache的 (我在此只是探讨技术上的可能性,不是商业可能性)
我觉得这个话题还挺有价值的,如果是正确则可以省钱,如果是错误可以用来鉴别中转站掺水问题
(两个结果都不亏)

之前使用中转站的时候,切换模型缓存会重新创建,这个应该是模型厂商那边的能力

我之前也是切换缓存失效,但是 GPT6sol 和 GPT6luna 的缓存技术可能不太一样

从技术层面上来讲, 不同模型的缓存是不能通用的

不同权重的模型kv缓存算的肯定不一样

不然输入都可以用便宜模型来了

我觉着技术上还是能实现高速缓存共享的,还是希望大家真实测一下,看看是不是我的几个中转站的问题还是 GPT 缓存机制变了

从LLM原理上就没有可能, 权重不一样, prefill出来的键值对没有可能一样的

至少之前5.6和6是不行的,完全重建缓存

Claude切换模型的时候也会提示,会重新把上下文读取进去,消耗会更大

原理上没有任何可能性,不同模型权重不一样,kv根本cache不了一点。被中转站掺水了吧

显然不能啊,缓存本质是复用之前计算的kvcache,不同的模型kvcache也不一样

不共享吧 你中转还能共享?牛逼啊?

怎么可能共享的啊 模型权重都不一样的 佬要检查一下中转是不是全接的luna了 :rofl:

建议去深入学习了解一下KV缓存机制

讲道理是不行的,或者说只在模型之间满足一定关系的时候严格可行(比如模型A是模型B在深度上的拓展,共享前L层,当然这里的要求应该都比较强,实际上可行性受限)。

不过据说也有 奇技淫巧 奇妙的方法做跨模型的kv复用 [2608.03893] Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

不可能在,如果显示缓存没变,那只能说明给你掺水到一个模型上了:rofl:

我也好奇了,如果只是单纯切换思考强度会不会破坏缓存 :face_with_monocle:

还是有可能部分共享kvcache的

  1. 不成立,luna和sol不可能是同一个基座
  2. luna和sol明显不是草稿模型和目标模型的关系
  3. 没有工业应用

(帖子已被作者删除)

怎么证明sol和luna没有相同权重的早期层

我这里测试 luna切sol会重建缓存