【opencode,退钱!】opencode正使用仅有262.1K上下文的digitalocean作为glm-5.2的provider

这两天这条ollama cloud 接入 axonhub 遇到了各种各样小问题,最后还是算圆满驾驭了。

1、首先是域名:只有 ollama.com 是正确的。api.ollama.com 的 /v1/chat/completions 返回 405,api.ollama.cloud 不存在。

2、然后它有三个端点,第一次我用的是/api/chat,发现会空回复就弃用了,
第二次我用的是 /v1/chat/completions,effort支持范围是 high/medium/low/max/none,xhigh 报 400错误。(要么你改成high,要么你改max但会被xhigh在OpenAI格式请求的情况下强行转成xhigh了…所以得写个请求体覆盖配置将xhigh → max)
然后这个端点我也不知道为啥会导致我在ccline看到上下文是0.0% 2 tokens (浅浅分析一下好像是什么 第一 chunk 无 usage,然后 axonhub OpenAI 转换会有一个硬编码的占位 1/1,而ccline是读取到了transcript文件中的input=1,output=1,stop=None,types=[thinking/text]就这样了)
第三次用/v1/messages,但它的认证是非标,必须 Bearer,x-api-key 会 401。这在axonhub里的话能符合这个要求的Anthropic接口格式就是那个 **LongCat Anthropic 端点(/v1/messages)**了。Anthropic 端点没有effort的报错,不过思维强度xhigh和max是一样的…而我实测多测,ollama对effort好像不太敏感,high/medium/low三档几乎一样。也就只有openai端点设置的max才明显思维多上一点。
(我顺便查看了一下智谱 GLM 档位:max/xhigh→max,high→high,medium/low→high,none→none。)

综上所述要正常用就选择axonhub的 LongCat Anthropic 端点(/v1/messages) 配置供应商渠道!

3、不显示读缓存tokens,这个用的时候都知道了吧。只能靠响应速度、时间、输入tokens来猜用量消耗。


用量分析


我估摸的话,5h纯输入有个40M,周限相当于五倍5H吧有个大约200M​:thinking:
如果用量怕5h消耗太快不够用,可能要两三个号轮换着用了。

这么看8刀左右的ollama pro还是很值的可能,我是目前能找到可能性价比高、速度飞快的glm5.2渠道了(至于GLM官方的根本抢不到,然后昨晚看了群友share的才真的祛魅了原来用量并不多!而且还喜欢封号风控、经常429等;而opencode go看似性价比很高两三$一个号,但由于质量残次不齐,随机路由抽奖特质+缓存极差,额度会一下子蒸发掉了,如果缓存高效一点的话兴许能耐用点)

速度飞快,我用过的渠道里最快的。

如果真比的话,豪横消费firework的绝对又稳又快,它家好像还有个GLM-5.2-Fast


4 个赞