GPT 6不一定是AGI时代的开始,但是一定是蒸馏时代的结束

根据《The Information》的独家爆料,GPT 6采用了一种新的技术“循环深度”。

这个技术是什么呢?目前大家可以见到的模型,包括claude fable都是依赖显式思维链(CoT),必须将每一步推理都生成为人类可读的文本token。而GPT 6在模型的连续隐藏状态中直接执行多步推理,无需生成任何中间token。

这次GPT 6更强的智能涌现也来源于此,但是今天我们的主题不是这个,而是另一个话题:仅仅预训练一个模型然后用国际旗舰模型的输出数据进行后训练然后sota的时代是不是结束了?

首先,我并不批判这种行为,因为这种“蒸馏”行为很多情况是不得不而为之,因为模型公司会因为各种各样的原因导致算力紧缺以及高质量人工标注数据的紧缺,而一个好的后训练能将模型优秀的架构设计所产生的能力释放出来,那么无疑用已经经过市场验证的国际旗舰所输出的数据再结合自身优秀的后训练算法进行sft以及rl等,就可以实现快速的模型能力追赶。

但是GPT 6的出现可能会打破这一追赶平衡,作为新的经过验证的技术范式,就和GPT 4的moe专家路由,GPT o1的CoT RL后训练等技术一样,顶级模型厂商都会尝试并追赶,因此目前模型最重要的思考过程的输出将很可能成为历史,这种从源头导致的思维链输出缺失也不能像现在这样通过特殊的技术手段劫持出完整思维链输出。

因此原先只研究模型架构,训练技术的公司如果再不调整方向,很可能会落后于未来的时代,现在的模型竞争越来越考验模型公司的技术是否水桶化,在越来越白热化的ai基础设施市场,很微小的差距就可能直接被踢出用户使用的模型清单,不具备端到端的全栈自研与前沿预训练能力,在未来的代际竞争中将被迅速甩开。

GPT 6确实是一个时代开启的标志,不一定是AGI,但无疑是大模型工业格局重组的一声信号,面对未来各个模型公司的将是各个方面能力比拼的硬碰硬。

刚才莫名其妙被举报下架了 :joy:,之前让ai组织了一下markdown,并且拆分了一下长句,优化了一下语序,现在直接初稿放上来算了,纯小米笔记手敲的,不知道为什么会举报以后被管理认为是纯ai生成

我又删了点文青病犯了写的一些干话还有对初稿一些口语化内容重写的修饰,这次总不能是ai生成的吧 :smiley:

在撰写本文时我还没有看到a/的这篇推,可以看到前沿实验室们对于思维链蒸馏还是挺多的,不过很多佬友的信息比我灵通的多,很多新的蒸馏手段可能已经在应用了,只是没有被披露,但是根据最新的公开信息以及a/的相关披露,我个人认为思维链还是在蒸馏工作中占据重要位置,这也是我写这篇文章的立意,也欢迎各位讨论,少点阴阳怪气,多些真诚的交流

27 个赞

The Information 这个报道有点问题

@wo_zu_long OpenAI首席科学家出来稍微澄清了一下

4 个赞

然而并不会是蒸馏时代的结束,你太小看蒸馏技术了 :melting_face:(

1 个赞

不是每家公司都有自己的数据飞轮会产生训练数据么?

1 个赞

蒸馏也不一定要依靠思维链,其实长对话(多轮对话)都可以。

7 个赞

很多人把蒸馏给扭曲负面化了,实际上每家都在蒸。我拿模型做各种优秀的案例数据,把案例用来作为材料训练,也算是蒸馏。闭源模型本来就很多东西都不给你看

7 个赞

严格意义上来说,现在后训练用旗舰模型输出的数据并不算蒸馏,蒸馏定义上是大模型指导小模型,但是现在只是为了后训练释放基座潜力而已,毕竟高质量交互数据太难收集了

如果真是这样子就不会出现那么多输出风格神似Claude的模型了

什么时候大善人关站了,才是真正的结束。fable 5.1 、gpt 6都号称反蒸馏,但大善人每天都开足马力供货。。

26 个赞

可以详细讨论一下,毕竟本文是我一家之言,厂家具体怎么用这些做后训练我还真不太清楚

不会的,依然可以蒸,GPT 在训练过程中也不会对循环深度的中间输出做监督,它也只能训练 Cot 模型和普通的模型,没有区别

1 个赞

我知道的不止有思维链蒸馏,还有用户轨迹蒸馏,现在第一种并不一定封死了,而第二种还一切正常,而且还可能有我不了解的第三种、第四种方法。 :innocent:

1 个赞

any牌路由器有gpt6 你细想 :saluting_face:

1 个赞

很简单的一个判断,如果不能蒸,那么any不会放gpt6了

3 个赞

any绝对是收集输出信息的,谁家好人拿官api做公益:joy:,但是具体效果怎么样还得看后面用这些数据的新模型

1 个赞

推理过程构建黑箱的世界模型,更加黑箱了,只要需要吃蒸馏数据的模型本身没有改成一样的架构,不确定性应该不会被拉的过大

1 个赞

确实,用户轨迹等等其他的人机交互数据非常宝贵,能有效提升agent能力,尤其是采集到的模型如何进行harness流程,但是获取不到思维链感觉还是会有影响,毕竟模型只知道结果真的能很有效的泛化出过程吗?

any还能用吗,为什么我一直用不起

2 个赞

还在蒸馏思维链是什么年代的落后思路了……

为什感觉利好蒸馏呢 :rofl: 这几个frontier lab大价钱买的都是长任务的原始数据,买回来还要自己再洗再把关一遍(让 asta computer use做一个长任务,四舍五入不就等于买来了原始训练数据了