如图,明明ultra是多agent的MAX
那为为什么在IQ测试上,ultra却会显著低于MAX
实际使用中,不同思考强度的体验感是怎样的
low和ultra一个级别,何意味,真不是瞎测吗
没毛病啊,ultra的思考强度就是和max一样,只不过是多agent并行处理。问题在于,什么样的任务真的需要并行?不适合并行的项目,ultra和max拉不开差距太正常了。
因为ultra实质上是一堆xhigh()
max是可以理解为推理深度的最高级,ultra可以理解为多Agent并行,更为广度,但是没有明确每个agent的具体推理深度,所以单论IQ,max是最高的
ultra和max思考强度一样,我猜是开的子代理太多,形成了调度污染(每开一个都要写大段提示词,完成后返回大段高显著性的结果,分散注意力)
astra刚出来,数据不完整,失真很正常,过段时间看就合理了
但是Sol 也出现了这种现象,在众测智力中,ultra思考强度的IQ,也显著低于MAX的
但是按理来说,Sol应该是一个久经考验的老模型了,评分已经稳定下来了