烧饼论坛 LZ.SB
登录

Sol High 明确没被路由到 Luna,为什么还是连续过不了糖果题?

352
  • xushuo
    UID 7664Lv.3 初识社区

    我这边最近在排查 Codex / CPA 的模型路由问题,之前已经抓到过不少 gpt-6-astra -> gpt-5.6-luna 的情况,所以这次专门拿 Sol High 做了对照。

    我现在不是只看 CPA / Keeper 里的请求模型,而是额外解析上游原始 Responses SSE,读取终止事件里的 response.completed.response.model

    这次两笔测试的结果是:

    • 请求:gpt-5.6-sol
    • reasoning:high
    • 最终上游 response.completed.response.modelgpt-5.6-sol
    • 两次都没有变成 Luna
    • 两次请求都正常成功完成

    具体两笔:

    1. input 约 24,615 tokens,reasoning 约 1,015 tokens
    2. input 约 19,076 tokens,reasoning 约 856 tokens

    上下文已经比之前 20 万 token 那种情况干净很多,但固定的糖果题两次还是都没过。这个题正确答案是 21。

    所以现在有点疑惑:

    请求 Sol High -> CPA 发 Sol -> 上游最终 response.model 仍是 Sol -> 但糖果题连续失败

    这和之前 Astra 直接被路由到 Luna 不一样,这次模型字段看起来完全正常。

    想问问大家最近有没有测过 Sol High:

    • 正常状态下 Sol High 现在糖果题通过率大概怎么样?
    • 有没有出现终态明确是 Sol,但能力明显比之前差的情况?
    • response.completed.response.model 只能证明模型名,是否可能还有服务端的其他质量档位 / 推理策略 / fallback 不会体现在 model 字段里?
    • 还是说这个糖果题现在本身就不适合当单次判断依据,Sol High 连错两次也可能只是正常波动?
    • 19k~25k input tokens 对这种测试来说算不算仍然太脏?

    我知道糖果题本身已经传播很广,所以 “做对” 未必能证明模型没降级;但现在反过来是 Sol High 连续两次做错,而且终态 model 又明确匹配,感觉挺奇怪的。

    有近期同样环境的朋友可以帮忙报一下:模型、reasoning 档位、连续测几次、通过几次。最好如果能看到原始 SSE,也一起确认一下终态 response.model

  • 收藏支持反对打赏

2 条回复

  • mubdao
    UID 1206Lv.15 交流能手
    #1

    不懂 bd

  • 触手怪
    UID 7049Lv.13 进阶成员
    #2

    BD

发表回复