最近经常看到有人说 GPT / ChatGPT 某个时间段 “降智” 了,但很多时候又很难分清到底是真有能力变化,还是随机性、路由、系统提示词、上下文、限流之类造成的体感波动。
想问问现在有没有比较靠谱、可长期重复的测试方法?最好不是只靠 “问几个熟悉的问题看看感觉”。
我目前想到的是:
- 固定一套 prompt,模型、参数、上下文尽量保持一致,每题重复跑多次;
- 分开测数学 / 推理、代码、指令遵循、长上下文、工具调用等能力,不混成一个总分;
- 和历史输出做盲评或 pairwise 对比,避免自己知道日期之后产生主观偏差;
- 除正确率外,再记录格式遵循率、工具调用成功率、拒答 / 跑偏率、首 token 延迟等;
- 连续多天测,看趋势和置信区间,不因为一两道题翻车就下结论。
但 ChatGPT 这类产品还有服务端路由、隐藏 system prompt、模型 alias 更新、不同账号 / 套餐可能走不同后端等变量,感觉很难完全控制。
现在社区里有没有比较成熟的测试集、脚本、开源 benchmark,或者你们自己长期在用的一套 “测降智” 方法?
尤其想知道:哪些指标对真实能力变化最敏感,哪些其实最容易被随机波动误导?如果同时测 ChatGPT 网页端和 API,又应该怎么设计才比较公平?
- 收藏支持反对打赏
- 暂无回复