总觉得 AI 越用越笨?有人做了个「降配盯梢器」,连续 30 天替你盯着

总觉得 AI 越用越笨?有人做了个「降配盯梢器」,连续 30 天替你盯着
先说一个你肯定有过的感觉
新模型刚发布那几天,惊为天人。过两三周再用,心里开始嘀咕:"是不是偷偷变差了?"
你去社区一问,评论区立刻分成两派:一派赌咒发誓"绝对降配了",一派说"心理作用,别加戏"。吵到最后谁也说服不了谁——因为两边拿出来的都是体感,而体感是吵不出结果的。
这种"发布后偷偷变弱"有个行话叫 nerf(游戏术语:官方暗削)。可能的手段包括:量化压缩、同名背后换个更小的模型、调低推理力度、悄悄改路由。但也可能什么都没发生,只是大家在噪声里找规律。
问题卡在一件事上:从来没有人从发布第 0 天就开始留证据。 没有干净的基准线,所有争论都是体感对体感。
直到有人把这件事做成了一个开源项目。
livenerf:一个"无聊但致命"的盯梢器
livenerf(500+ star,发布于 Opus 5.5 上线当天)就干一件事:从模型发布第一天开始,每天用同一套题考它一遍,连考 30 天,看分数有没有偷偷往下掉。
它的思路朴素得可爱:
① 挑一组"晴雨表"题目。 作者拿了 2336 道硬核题(GPQA 博士级科学题、MMLU-Pro、竞赛数学、AIME 奥赛题)做筛选,发现 Opus 5.5 对 97% 的题要么永远对、要么永远错——这些题测不出"变笨"。真正敏感的是那 78 道"时而对时而错"的题,它们组成监控面板。模型能力只要微微下滑,这批题最先翻车。
② 把能冻结的全部冻结。 模型采样本身没法做到完全确定(温度参数没了、思考关不掉),那就把其他一切钉死:题目冻结、Claude Code 版本锁死在 2.1.280、判分器写死、原始日志永久保留。然后每天跑一轮,用统计学方法盯着漂移——统计方法直接用的还是 Anthropic 自己发的论文《给评测加误差棒》,谁都挑不出毛病。
③ 预注册,防自己作弊。 整个实验方案(测什么、怎么判、什么阈值算"实锤降配")在跑数据之前就公开写好,锁死。这是科学实验的标准做法,防止事后拿着数据编故事。
目前已经盯出了什么
项目 9 月 24 日开跑,到 9 月 29 日已连续跑了 6 天,一天没断。几个有意思的发现:
- 最先暴露的不是分数,是"话变少"。 验证实验发现:如果模型被调低推理力度,输出 token 数会骤降(低档力度:token 少 62%,准确率掉 8.3 分)——** token 数是降配最早期的信号,比准确率还灵敏**。这就好比你怀疑餐厅偷工减料,先看菜量再看味道。
- 同家族换模型几乎测不出。 作者诚实承认局限:把 Opus 5 偷偷换成 Opus 5.5,在验证样本量下区分不出来(差 -3.8 分但误差 ±6.3)。这个仪器能抓"明显变水",抓不住"同门师弟顶包"。
- 78 道题里有 8 道答案本身印错了、30 道有歧义。 这就是"连强模型都时错时对"的题的正常生态。作者一道没删,预注册了敏感性分析,到时候把脏题剔掉重算一遍给大家看。
第一次正式"宣判"要等到 10 月 24 日前后(30 天跑完才有统计效力)。现在去 repo 主页,能看到一张每天更新的成绩曲线图——像心电图一样,绿线是当天得分,灰带是基准区间。
你该用它吗(决策速查表)
| 场景 | 用 / 别用 |
|---|---|
| 只是想知道"我的 Claude 是不是被降配了" | ✅ 别自己跑,收藏 repo 每天看曲线图就行,作者替你跑 |
| 订阅了 Claude Max、想自己搭一个监控 | ✅ 可以跑,有 Claude Code 登录态 + Python 3.11+ 就够 |
| 想监控 GPT / Gemini / DeepSeek 等其他模型 | 🟡 v0 只盯 Opus 5.5,但框架是通用的(基于英国 AISI 的开源评测框架 Inspect),可以照着改 |
| 想要"实锤证据"去和官方对线 | ⚠️ 别急,它只能测"统计上显著的漂移",小幅暗降(±7 分以内)本来就测不出 |
| 完全没碰过命令行 | ❌ 自己跑有门槛,当吃瓜群众看更新就好 |
想自己跑?三步
git clone https://github.com/ninjahawk/livenerf
cd livenerf
uv sync
前提是你有登录好的 Claude Code(Max 订阅即可,不需要 API key)。之后按 README 跑每日任务即可,Linux / macOS / Windows 都支持。
写在最后
这个项目最打动我的不是技术,是它把一件事从玄学变成了日常。
以前"模型是不是变笨了"是个每月吵一次的月经帖;现在它变成了一张每天自动更新的曲线图。数据没出结果之前,图本身就是答案——有人在盯着,而且盯的方法经得起所有人检查。
下次再有人跟你说"我感觉 AI 变笨了",你可以把这张图甩过去:别吵了,看心电图。