疑问:模型智商跟使用人数的关系

在回看经验分享贴时觉得一个观点挺反直觉的:

很好奇这个观点。
个人此前的认知,激活的参数量该是对于单个调用来说的,并且算力调配应该是一种分配策略,很难影响到推理逻辑。
但我并非是专业人员,也未做过相关科研,因此询问了一下AI:


Sol对此见解不同,认为这种情况只有“特殊的’按负载切换模型/分配推理预算’机制”下才可能发生。

不知道佬友是否有专业的,觉得这种反直觉的观点要是能够成立,那背后的逻辑一定很有意思,很好奇

——————
目前来看,该观点很可能是失当的,混淆了一种认识。
本文持续编辑,将相应的技术回复引用如下:

如佬友跟我一样理解困难,这里的AI转译(图片)可为借花献佛

2 个赞

我反对,moe模型激活参数不是固定的吗?就算是动态的,也取决于提示词和任务复杂度。

感觉不太现实,Moe使用的人多批量推理好处是计算集群的使用率上升,单位成本平摊下来更加低吧,moe路由和参数都是冻结的,不存在说同一个模型在不同负载下会出现大幅度的智商波动,除非供应商切换模型量化程度。不过有一种情况像你说的就是供应商在业务高负载私自下注入提示词降低思维链长度导致智商下降的可能,比如google之前爆出疑似api和订阅思维链长度削减出现这样的情况,这样就会。你要研究得控制变量自部署控制采样提示词这些都一致才好。

2 个赞

你现在是混淆了推理过程中的专家并行和大模型设计中的激活专家数。大模型设计中激活的专家数越多,那么大体可以认为越聪明。专家并行中,对于 MoE 模型,是每张卡存储部分专家。推理时,因为同一时刻单路的推理流只激活一部分参数,所以如果你不做专家并行的话,本轮对话没有激活的专家,对应的GPU卡的时间片就是完全浪费掉了,所以会有专家并行这个概念,把很多人的对话同时批处理,进行推理,基于统计规律或者什么样的分散算法,让所有的卡的专家都尽量满载。

2 个赞

不知道,我完全无法理解,也无法猜测这个背后到底表达了什么东西能被人理解成这样。

我看到这段话有种san check的感觉。

感觉很专业的答复,个人知识所限(不了解“专家并行”和“激活专家数”的区别),因此将话语转述AI进行理解——希望这不会让你感到冒犯:




这里的GPT是在说明你的阐述,个人理解上,“激活专家数”是指用户单次发言触发的模型参数以及参数关键值“专家”;而“专家并行”指的是大量用户批量调用时,所有的发言会混合起来,分割“总token”,以其对应的专家进行划分统一处理——即提高了推理效率。——但在GPT的阐述中,这对于个人用户来说,应当没有推理质量的提升


GPT对此的最终结论是解释“多人使用为何更省算力”的方面。
——确实很专业,谢谢你的细致答复。
然后GPT说明这并不会导致个人用户的“激活专家数”的提升。
请问这个说明,是否符合你想表述的意思呢?

1 个赞

细细一想,差点就被忽悠了, 这个就不是一回事吧

emmm,确实是我没抓住你要问的问题。如果你主要是想问,是不是用的人越多越聪明,那肯定不是的,没有这种说法的。

1 个赞

嗯嗯。看来这种说法并不切实。——不过也还好佬友不是一开始就回答这个说法,因为分享的这种技术面对个人来说挺有价值的,原来“专家”是分布在GPU里的,以前会感觉是一个很大很大的参数里衍生的什么东西

感觉豆包都胡诌不出这种暴论,对大模型毫无认知