最近经常看到有人说 GPT / ChatGPT 某个时间段 “降智” 了,但很多时候又很难分清到底是真有能力变化,还是随机性、路由、系统提示词、上下文、限流之类造成的体感波动。

想问问现在有没有比较靠谱、可长期重复的测试方法?最好不是只靠 “问几个熟悉的问题看看感觉”。

我目前想到的是:

  1. 固定一套 prompt,模型、参数、上下文尽量保持一致,每题重复跑多次;
  2. 分开测数学 / 推理、代码、指令遵循、长上下文、工具调用等能力,不混成一个总分;
  3. 和历史输出做盲评或 pairwise 对比,避免自己知道日期之后产生主观偏差;
  4. 除正确率外,再记录格式遵循率、工具调用成功率、拒答 / 跑偏率、首 token 延迟等;
  5. 连续多天测,看趋势和置信区间,不因为一两道题翻车就下结论。

但 ChatGPT 这类产品还有服务端路由、隐藏 system prompt、模型 alias 更新、不同账号 / 套餐可能走不同后端等变量,感觉很难完全控制。

现在社区里有没有比较成熟的测试集、脚本、开源 benchmark,或者你们自己长期在用的一套 “测降智” 方法?

尤其想知道:哪些指标对真实能力变化最敏感,哪些其实最容易被随机波动误导?如果同时测 ChatGPT 网页端和 API,又应该怎么设计才比较公平?