胡思乱想:可变参数是否会是大模型的下一个形态?

完全不懂技术的小白,突然胡思乱想到:未来,可变参数的大模型,是否会是下一个形态?或许可变参数是解决模型记忆和学习能力的关键?
纯技术小白的纯胡思乱想,可喷可批,但不用太认真。 :smiley:

2 个赞

我记得Hinton接受采访时就说过,llm架构下一个突破点就是实时改变模型权重,记忆就内化为权重了 。这个想法很好,以后如果突破了,什么上下文工程统统都可以摘掉了 :face_savoring_food:

1 个赞

现在自进化有很多条路线,在线模型权重是其中一种,还有改harness,还有接在线lora

2 个赞

好像有一些相关论文讨论过这个方向,比如doc to lora(arXiv:2602.15902v1),就是把上下文不是作为【上下文】存放,而是把上下文中遮住,通过一个超网络把信息转移到【参数】之中

初衷是因为计算的开销是随上下文长度呈平方增长的,就是10k上下文的计算开销,是1k的100倍而不是10倍

只不过现在这个东西效果还不是很好就是了,而且只是停留在论文层面(

1 个赞

认真要说的话MoE也是可变权重的一种,佬友的大体思路是对的
上面的佬友说的也很对,像agent-框架共同进化,在线Lora等等都有人在探索。
据说astra就是在codex开源的那个harness上特别rl过的,所以对框架本身的适配特别优秀, 最明显的就是computer use能力大幅提升

1 个赞

很早就有的思路了,快速权重好像是上个世纪的论文。主要问题在于表征,如果模型本身没有这个表征能力,一般来说从架构上塞偏置进去结果也不会好,因此后期主要转变到了元学习与上下文学习方向。另外动态图始终令人讨厌,各家也更偏向于现在这种更简单的结构(Kimi和Deepseek那种已经算是很复杂了)

2 个赞