基于 CLIProxyAPI 降智测试插件实现定时巡检

CLIProxyAPI 降智测试插件 cpa-codex-candy-eval 可以对多个凭证执行糖果测试、ModelTrace 等,用于判断 CPA 中管理的 GPT 账号是否降智十分有效。

基于该插件提供的 API 接口,可以实现定时巡检功能。具体而言,可以编写一个巡检脚本,定时测试凭证(crontab),发现降智后调低该号的 priority,让 CPA 优先使用正常的号,也可以通过 ntfy 或 Bark 通知。

可以补全下面的提示词,发给 Codex、Claude Code 等 Agent,让它帮你部署:

请按照 https://raw.githubusercontent.com/haowang02/cpa-plugin-codex-candy-eval/main/docs/inspection.md 中的教程,在这台机器上部署 Codex 降智测试插件的定时巡检。

我的配置(没写的项保持脚本默认值):
- CPA 地址:
- CPA 管理密钥:
- 巡检频率:(例如每 30 分钟)
- 巡检测试和模型:(例如 ModelTrace、gpt-6-luna)
- 巡检范围:(例如所有 codex- 开头的认证文件)
- 发现降智后是否调整 priority:(是或否,可指定降智和恢复正常时的 priority)
- 通知方式:(ntfy 的服务器地址、主题和账号密码,Bark 的推送地址,或不通知)

部署后先手动运行一次,确认巡检能正常完成,再配置 crontab,最后告诉我日志的位置。缺少必要信息时先问我。

推荐使用 gpt-6.1-sol(low) 执行单次糖果测试进行巡检,如果巡检间隔设置为 2 小时,单个账号巡检一周所消耗的 Token 大概价值 $1.09。不过这个配置有有误报的可能,因为 gpt-6.1-sol(low) 有一定的几率答不对糖果问题。如果不在乎消耗,可以使用更高的推理等级,或者使用 gpt-6-astra。

重要提醒:虽然使用 ModelTrace 巡检则几乎不会误报,而且可以采用 gpt-6-luna 这种低价模型进行测试。但实际测试发现,ModelTrace 的提示词,有一定的几率触发 OpenAI 上游报错如下:

{
  "error": {
    "message": "Invalid prompt: your prompt was flagged as potentially violating our usage policy. Please try again with a different prompt: https://platform.openai.com/docs/guides/reasoning#advice-on-prompting",
    "type": "invalid_request_error",
    "param": null,
    "code": "invalid_prompt"
  },
  "sequence_number":174
}

违反使用政策还是有点恐怖,容易导致封号,所以不推荐用 ModelTrace 进行巡检。

4 个赞

我问一下,这个是降智检测,如果检测出来降智那不只能证明降智了么?还是不能修复降智啊

降智就是被标记了,修复不了,只能踢