GPT-Load 接入 Jev:模型及思考强度的自动挡功能

开源推广发帖模板

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:

  • 我的帖子已经打上 开源推广 标签:
  • 我的开源项目完整开源,无未开源部分:
  • 我的开源项目已链接认可 LINUX DO 社区:
  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:
  • 以上选择我承诺是永久有效的,接受社区和佬友监督:

以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出


项目主贴: 🔥 GPT-Load 2.0 发布!!!轻量易用的自托管 AI 网关
项目地址: GitHub - tbphp/gpt-load: Self-hosted AI gateway for multi-channel, multi-credential setups — API keys and subscription accounts, scheduling, failover, request logs and usage. 自托管 AI 网关:多渠道多凭据统一接入,含密钥与订阅账号、调度容错、日志与用量。 · GitHub

最近折腾了一下 Jev,感觉没有 X 上吹得那么神,准确度还有待提高,不过确实有很多有意思的玩法,特别是针对我在做的 GPT-Load 项目,马上就能想到一个场景:Auto Model 。

目前 GPT-Load 新版加了个 自动模型 功能:让 Jev 判断这次任务适合哪一档,自动调度,省掉本地手动切换模型、思考的操作。
Jev 负责选档,真正思考和输出的还是配置好的预设模型。

目前已经支持 typesafe.ai 官方和 OpenRouter 的 Jev 渠道。


怎么用

  1. 新建 Jev 官方或 OpenRouter 分组填好密钥,配置好 jev 模型。
  2. 在全局设置里找到「实验性功能 → 自动模型」,开启并选择前面配置的 jev 模型。
  3. 可以先用默认的4档预设,再调整每档的目标模型、思考强度,以及档位的描述提示词。
  4. 客户端把模型设为 auto,正常发请求即可。(auto 模型可自定义)

auto 路由、决策、命中哪一档、判断花了多久、决策费用是多少,都能在日志里看到。

一起来实验

当然,调用 Jev 是会增加判断耗时和费用(目前观察费用极低,不过耗时要看任务输入和网络链路延迟),选档精准度还需要调教。不过有回退兜底机制,不会阻塞整个请求。
佬友们有好用的预设,或者遇到选档不合理的情况,欢迎讨论。对功能设计、判断机制有建议,也请不吝指教。
希望能让 Auto 做到真的好用的自动挡,从而从实验变成正式功能。


关于模型切换与缓存的讨论

切换模型会导致缓存失效,所以这个实验性功能是有一定代价的。
目前做了一些优化,保证同一个指令(不是会话)会保证沿用,不会每次请求都进行判断。这样保证一个任务只进行判断一次,也避免模型切换。

但是会话中多个指令会根据预设的提示词进行判断。

比如场景:在一个会话中进行方案设计、架构沟通期间会用高档位。方案确定后开始实施会切普通档。损失一次缓存,也能保证质量和成本。

而且预设是用户自己填写的,切换时机通过预设提示词来控制。
比如以上场景,可以在预设中明确方案沟通设计使用高档,编码实施等任务使用普通档位。

自动挡肯定没有手动挡精准,这是不可避免的。就比如我们开始也有自动和手动的选择,根据自己需要选择对应的模式即可。

如果不想切模型,那也可以用来自动切思考。(某些思考仍然会破坏缓存的不适用)

71 个赞

openai 的降智方案是你做的吧?

171 个赞

原来是你搞砸了一切!

3 个赞

其实一出也有这种想法,有点马后炮的感觉。。哈哈

1 个赞

其实, 我在想,

多专家模型。 本身应该就内置了这玩意。只是没通用化开放出来。

4 个赞

嚯,这都被你发现了 :laughing:

5 个赞

价格是多少?在哪里可以用?不是幻觉嘛?

1 个赞

cdk的bug怎么还没修

1 个赞

得到了始皇的辣评

1 个赞

这样搞不是缓存也没了?

1 个赞

哈哈哈哈,冤枉啊。
我这是自动挡,openai 那只有降档。

3 个赞

同一个任务(不是会话),会自动沿用。但是一个会话多次任务是会触发判定。

1 个赞

就是啊,要是被判定换了模型,这不是缓存就无了

1 个赞

同一个会话里面不同任务也会手动切啊,所以这就是自动挡和手动挡的区别和选择。
也要根据自己的场景调整预设提示词。

就跟开车一样,自动挡肯定没法像手动挡那样精准,但好在方便。

1 个赞

这次是t佬搞砸了一切,我还有证据,t佬有openai给的20x pro,他一定是内部人员 :rofl:

2 个赞

我这个降智的pro20怎么恢复呢?

3 个赞

额,这超出了当前项目的范畴了。。。

提个建议啊,不要覆盖user-agent,客户端的ua应该透传,现在被改成GPT-Load/v2.0.0

1 个赞

哈哈哈,自动降挡。 :rofl:

2 个赞

但是session中途切模型/thinking effort 不会导致cache miss吗(

1 个赞