我这边最近在排查 Codex / CPA 的模型路由问题,之前已经抓到过不少
gpt-6-astra -> gpt-5.6-luna的情况,所以这次专门拿 Sol High 做了对照。我现在不是只看 CPA / Keeper 里的请求模型,而是额外解析上游原始 Responses SSE,读取终止事件里的
response.completed.response.model。这次两笔测试的结果是:
- 请求:
gpt-5.6-sol - reasoning:
high - 最终上游
response.completed.response.model:gpt-5.6-sol - 两次都没有变成 Luna
- 两次请求都正常成功完成
具体两笔:
- input 约 24,615 tokens,reasoning 约 1,015 tokens
- input 约 19,076 tokens,reasoning 约 856 tokens
上下文已经比之前 20 万 token 那种情况干净很多,但固定的糖果题两次还是都没过。这个题正确答案是 21。
所以现在有点疑惑:
请求 Sol High -> CPA 发 Sol -> 上游最终 response.model 仍是 Sol -> 但糖果题连续失败这和之前 Astra 直接被路由到 Luna 不一样,这次模型字段看起来完全正常。
想问问大家最近有没有测过 Sol High:
- 正常状态下 Sol High 现在糖果题通过率大概怎么样?
- 有没有出现终态明确是 Sol,但能力明显比之前差的情况?
response.completed.response.model只能证明模型名,是否可能还有服务端的其他质量档位 / 推理策略 / fallback 不会体现在 model 字段里?- 还是说这个糖果题现在本身就不适合当单次判断依据,Sol High 连错两次也可能只是正常波动?
- 19k~25k input tokens 对这种测试来说算不算仍然太脏?
我知道糖果题本身已经传播很广,所以 “做对” 未必能证明模型没降级;但现在反过来是 Sol High 连续两次做错,而且终态 model 又明确匹配,感觉挺奇怪的。
有近期同样环境的朋友可以帮忙报一下:模型、reasoning 档位、连续测几次、通过几次。最好如果能看到原始 SSE,也一起确认一下终态
response.model。- 请求:
- 收藏支持反对打赏

不懂 bd
BD