最近在用 Astra,观察响应里的 reasoning(reasoning_tokens / 对应统计值),发现一个挺稳定的现象:
大多数请求基本只有 0~几十,偶尔到两三百,很少再往上。不是单次偶发,连续一段时间都差不多;有些题明显需要多步推理,数值也还是很低。
想问下大家:
- 这是现在 Astra 的正常表现,还是 reasoning 的统计口径本来就只记了一部分?
- 会不会是服务端动态调低了 reasoning effort,或者实际发生了路由 / 降档?
- 你们同类请求里 reasoning 大概都在什么范围?有没有稳定上千的?
- 同一个问题重复跑、不同时间段,reasoning 数值会明显变化吗?
我最近还碰到过模型路由表现异常,所以现在有点怀疑这两个现象可能有关。但也不确定是不是纯粹统计字段不能代表真实推理量。
有同样现象的朋友麻烦说下你们看到的大致范围就行,不用贴账号之类的敏感信息。
- 收藏支持反对打赏

不知道
