经常蒸馏强模型的模型,会不会特别擅长“指挥”强模型?

可以用经常蒸馏其他模型的模型,去指挥高智商模型吗?

因为之前一段时间不是在使用pi作者公布的方式蒸馏,而用这种方法蒸馏的时候,通常也需要写一份很详细的prompts,这个会不会直接内化到模型的能力里面呢?这样的话,会不会反而让这种模型比其他模型更擅长“指挥”高智商模型?

现在的agentic蒸馏都是在目标任务轨迹上sft或者合成rl奖励(无法获得教师模型权重情况下)

而且我也看不出来写一份很详细的prompt去蒸馏为什么能提高模型「指挥」其他模型的能力… 似乎没有直接联系