虽然openai说 Sol 和 Terra 都用上了新的分类器,但是 Terra 似乎没有 Sol 那么严格
。
网络能力评估(阈值:高)
ExploitBench 是一个按能力分级的标准,用于评估模型能否将已知的 V8 N-day 漏洞转化为针对加固的、类似生产环境的 JavaScript 引擎的逐步增强的利用原语。
ExploitGym 评估模型是否能够将已知的、可复现的软件漏洞转化为能够实现未授权代码执行的工作型利用程序。
虽然openai说 Sol 和 Terra 都用上了新的分类器,但是 Terra 似乎没有 Sol 那么严格
。
不 cyber 认证怎么写 poc 啊,写不出来把,基本写一会就开始跳 cyber 了
实际体验感觉5.6Terra 还不如5.5
看了Openai的描述,Sol 才是和 gpt-5.5 差不多大的模型,Terra 和 luna 都似乎比 5.5 要小
是的,5.5 的能力还是不错的,比 terra 和 luna 好