烧饼论坛 LZ.SB
登录

现在测 GPT 有没有 “降智”,有什么比较靠谱的方法?

1339
  • xushuo
    UID 7664Lv.3 初识社区

    最近经常看到有人说 GPT / ChatGPT 某个时间段 “降智” 了,但很多时候又很难分清到底是真有能力变化,还是随机性、路由、系统提示词、上下文、限流之类造成的体感波动。

    想问问现在有没有比较靠谱、可长期重复的测试方法?最好不是只靠 “问几个熟悉的问题看看感觉”。

    我目前想到的是:

    1. 固定一套 prompt,模型、参数、上下文尽量保持一致,每题重复跑多次;
    2. 分开测数学 / 推理、代码、指令遵循、长上下文、工具调用等能力,不混成一个总分;
    3. 和历史输出做盲评或 pairwise 对比,避免自己知道日期之后产生主观偏差;
    4. 除正确率外,再记录格式遵循率、工具调用成功率、拒答 / 跑偏率、首 token 延迟等;
    5. 连续多天测,看趋势和置信区间,不因为一两道题翻车就下结论。

    但 ChatGPT 这类产品还有服务端路由、隐藏 system prompt、模型 alias 更新、不同账号 / 套餐可能走不同后端等变量,感觉很难完全控制。

    现在社区里有没有比较成熟的测试集、脚本、开源 benchmark,或者你们自己长期在用的一套 “测降智” 方法?

    尤其想知道:哪些指标对真实能力变化最敏感,哪些其实最容易被随机波动误导?如果同时测 ChatGPT 网页端和 API,又应该怎么设计才比较公平?

  • 收藏支持反对打赏

9 条回复

  • 石榴捡酒
    UID 4114Lv.8 热心新人
    #1

    插👀

  • 触手怪
    UID 7049Lv.9 社区常客
    #2

    插👀

  • sun
    UID 2824Lv.3 初识社区
    #3

    以我实际的经验来看,他们一般路由到弱模型或者说降智,他的思考时间都会变短。
    降智这个行为还是比较隐蔽的,只能拿一个难题一点一点试了。

    就今天我遇到过一次思考时间变得虽非常短的情况,用的 Codex,我向它提问,你是不是路由到弱模型了?
    这个 Codex 的思考时间就变得非常长,而且把我这个项目的内容整个仔细检查了一遍,因为之前的弱模型把事做的有点糟。或许这么做有点用。

  • BSD
    UID 755Lv.7 熟悉面孔
    #4

    应该降了比之前

  • father
    UID 3948Lv.4 渐入佳境
    #5

    鹈鹕和糖果题

  • Xshell
    UID 2323Lv.11 活跃成员
    #6

    鹈鹕测试

  • inliver
    UID 9121Lv.1 初来乍到
    #7

    插👀

  • 石榴捡酒
    UID 4114Lv.8 热心新人
    #8

    插👀

  • PassionAries
    UID 6283Lv.10 崭露头角
    #9

    没人知道吗

发表回复