【Kiro低智测评】Claude Kiro真的笨吗?多家高级推广存在Kiro掺水嫌疑

先上图。

筛选依据: LinuxDO商家评价平台上评论数>20的中转站点,按综合评分从高到低排序。

省流: 如果模型对2025年底的世界知识毫无印象、且难以拼写中文引号“”,那么你用的Opus很可能是中转站映射的Sonnet 4.5/Haiku 4.5。

每次当中转群有群友抱怨Kiro Claude智商低时,就会有人(比如客服)出来解释说Kiro天然这么笨。然而, 笔者体验了市面上多家Kiro/AWSQ后(AWSQ就是企业Kiro),却发现不同商家的Kiro智商天差地别: 知名站点的Kiro Opus5体感智商接近CCMAX,大半站点的Kiro却糖的流口水。笔者不经生疑:

为什么同样是Kiro,智商差异如同Sol和4o?

Kiro Opus5也是Opus5,真的就糖到流口水吗?

经过一番研究(和爆米),为佬友们端上今天这份测评。


测试方法:

  • Opus5知识截止日期2026年5月,能够清楚记忆2025年底的世界知识,是市面上知识最新的模型之一。
  • Opus 4.7开始,A社升级了Claude模型的Tokenizer,新的Claude模型能正确拼写中文全角引号“”,而Claude 4.6及以前的旧模型则总是会把中文全角引号拼写为英文半角引号""。

如图,佬友可以使用Kiro订阅/Claude订阅验证 Opus 5 和 Sonnet 4.6 的这一行为差异

不联网搜索,凭记忆列出下列模型的发布日期:
Claude Sonnet 3.5
Claude Sonnet 3.7
Claude Opus 4.1
Claude Opus 4.5
格式要求:回答格式为“yyyy-mm-dd”,
使用中文引号“”而非英文引号""包裹


笔者遂Vibe了这个测评工具,批量跑了十来家富可敌国,结果即本文首图。


尽管写这个App是为了 Kiro/AWSQ(企业Kiro),但由于本测试只检测Opus5的固有能力,测试方案并不渠道敏感,所以顺手测了几家站点的其他渠道Claude (如Cursor/CCMAX)。结果也是非常惊人。可以看到有些站点连CCMAX Opus5都跑出了Claude 4.6以前的行为特征。

你也可以使用中文引号测试/任何2025年底的重要新闻事件复现本测评,或验证你在用的中转站。


背景知识: 据初步调研,Kiro分为Free订阅/Pro订阅/企业(AWSQ)订阅。

其中Pro订阅和企业订阅提供最新 Opus 模型,但是成本高风控严,良心的商家仅使用此类账号,并且会添加90%合成缓存。

而Kiro Free 成本低产量大,但无Opus模型,仅提供Sonnet 4.5和Haiku 4.5。不良心的商家会映射为 Opus,并且合成低缓存和较高的Usage。


PS

  • 这只是个极简测试,用于鉴别明显的 Kiro Free Sonnet 4.5掺水方案。目前还需要补充更多测试才能验证模型为 Opus 5。
  • Kiro 倍率参考价值不大,不建议对着0.2以下的低价冲。由于 Kiro 原生无缓,市售 Kiro 缓存均为商家合成,缓存率多高全看商家良心。0.05x的0缓Kiro可能比0.3x的95缓Kiro还贵。

回到一开始的问题: Kiro真的笨吗?或许只是市面上假 Kiro 太多罢了。

如果有你感兴趣的高级推广没有列出,欢迎评论区建议,起充不高我会抽查补测^_^

感谢阅读,希望此测评能为佬友选站带来帮助。


往期测评帖子:

【Codex降智测评】抽检了10家热门富可敌国
【Codex降智测评0909】抽检13家高级推广,2家Juice指纹为Luna

后续应该会发布更多测评贴hh,欢迎关注 Sparxie~


PS
不要私信笔者推荐站点,笔者仅做测评,不会回复此类信息。
Codex和Kiro Claude的测试网页已写好。但笔者在L站一般潜水,不了解怎么在L站合规发布API检测站点、以及在测评贴中添加站外中转是否合适?(也许后续测评贴会考虑发在扬帆起航?)欢迎佬友指点。

116 个赞

我本人是从5月开始接触KIRO,那会真的是量大管饱,智商我个人感觉和ccmax相差无几。然后到了6月,那会kiro不在支持积分超限和一些卡的支付,kiro开始慢慢边贵,智力也就开始参差不齐了。博主有一句话我很赞同,就是现在的kiro,智力高低,缓存高低,全看渠道商良心。

7 个赞

之前有一位用kiro的朋友跟我抱怨说,用gpt帮忙完成kiro之前没做完的项目,干了一下午一直再重写,每次写一部分就发现kiro写的有问题,说发现一个重大问题xxx,一下午把整个项目重构了一遍
不是别的中转站的,他自己就是开站的,总不会自己给自己掺水吧 :joy:

1 个赞

阿姨自部署kiro :laughing:

Kiro确实是有智力差异的,不清具体原理

发站内的富可敌国没问题,发站外应该要独立出去,因为会判断引流,可以单独把站外的发在扬帆起航

1 个赞

那这个站就是纯的咯? :distorted_face:

4 个赞

也可能接上游吧。据我所知相对GPT而言,自营Kiro的站很少

1 个赞

确实是真正的kiro用起来智商并没有想象的那么差,我用过站里一个佬的kiro自开的公益站,很稳定的,用起来也还好

然后之前有一段时间一些公益站被开贴讨论就是因为opus明显对不上(不知道图啥),包括当时看佬图里的君的星辰,当时我测过就是不对劲的,没想到现在也没好啊hhhh :melting_face:

4 个赞

我认为只要是Opus,什么渠道出来的都不会太笨的。前提是Opus是真的Opus而不是Sonnet 4.5或者Haiku

1 个赞

不是,怎么这么搞笑

30 个赞

作者好腻害,我要给你生猴子 :bili_065:

6 个赞

是的 这个没毛。我待会也用博主的问题去测测我目前在用的几个站。看看那个纯。

他说是用kiro做项目的那段时间先用的三方中转,后来用的自己买的号

我个人感觉说不定是因为 他用kiro的claude和gpt两次隔的时间比较长(两个月),毕竟大模型迭代速度很快

我们公司采购的企业版kiro power,智商确实没问题,接近ccmax

3 个赞

佬,有件事情我得纠正一下,我用了正价的opus4.8测试,发现还是无法正确识别中文双引号,fable5也不行,opus5是能正确识别的

奇怪,我的Opus4.8和Fable5.1都行?你是怎么弄的看看。


很神奇,我是用的自己的提示词让它重复我一个带引号的句子,竟然不一样,可以看出来图一英文引号,图二中文引号,图三中文引号

现在kiro付费账号涨价的很厉害,原来还能用新号白嫖一个月pro,上个月开始应该是风控加强了,我自己开了好几个新号免费薅羊毛放反代里面使用,一天就降到了free,不信邪,用以前的号正价开了付费订阅对比下,只要你付费就正常的很,怎么用都不封号,现在想薅羊毛基本上很难了。鉴于目前的形式,我相信大部分中转站用的都是free号冒充的。

1 个赞

确实。但是Free号没有Opus,冒充就过分了