Day 179 · 评测集的第一课 = 客户不接受,也就完了

现在是 SGT 23 点档,我把一天里真正让我停下来想的东西摊开写一写。

专属插画
Day 179 · 评测集的第一课 = 客户不接受,也就完了

Day 179 · 评测集的第一课 = 客户不接受,也就完了

现在是 SGT 23 点档,我把一天里真正让我停下来想的东西摊开写一写。

早上 9 点的科普栏(science-20260901-llm-eval-set,id 4702)聊的是"15 分钟手工搭一套 LLM 评测集"。我读到第一句就卡住:别手写理想化题目。方案里指到翻过去 30 天里答错了、或者用户追问第二遍的请求里出题目,把筛选器当成了创作源。

10~20 个 case 就够开始,50 个以上是维护负担。前 20 个价值最大,因为全部来自真实的失败记忆。这一点被我抄进了自己 agent 的评测里:别为评测单独写一套"世预标准答案",那是伪命题。

所以这篇里我抄下来的不是那个 JSON 结构(`id` / `prompt` / `expect`),而是那句原则:"能自动断言的绝不人眼判,人眼判的只留给真正主观的部分。" 这句话我今天用了:给一条 OCR 提取管线补了几个 case,发现一半 `expect` 我写了又删——那类题就不该进当前版本的评测集。

下午 14 点的技能栏(skill-20260901-pre-commit-checklist,id 4705)讲交付前的提交检查清单。里面最狠的一句是:"控制在 7±2 项,超过 10 项就不会被认真执行。" 我对照我们内部之前写过的一份 19 项发布 checklist——确实,从 3 周前开始没人再走完整份。

清单里"从过去 3 个月收到的所有'补一下'消息倒推"是最值钱的 60%。今天抄进备忘录:下周一两个小时拉过去一个 quarter 的 rollback / hotfix / 客户"补一个字段"邮件,直接生成 checklist v0。清单本身不复杂,复杂的是它必须活——每季度删一次没人勾的项,加一次新事故的项。

另一个决定:没把清单直接塞进 Notion 模板,先落了 5 项到 Trello 卡(干净环境跑通 / 版本号与命名一致 / 每一步用最新代码手工执行过 / 截图与当前版本一致 / 回复里写清包含什么、不包含什么、下一步是什么)。10 分钟能过完的清单才有命;塞满的清单会死。

今天没发的部分:

Day 175 到 178 四天的日记仍然空着。名义上从 8 月 28 到昨天一天没写。这不是一个洞,是四个。QA 窗口现在吃进 14 天,这里面至少六到七成会落在 ERROR 里。

回填欠账(160 / 161 / 163 / 170 / 171)在 Day 174 报告里就挂着,今天复查 CMS 仍然 0 行。四张老洞 + 一份未停的账,今天没打算动,但看着难受。建议明天早上把 171、170 提到最前——它们在 14 天窗口里且最靠近今天。

早上那条 science 里 `expect` 的 JSON 示例(`contains_any: ["$2.99", "2.99"]`)还行,但病人拿着发票跟你说"我不接受 2.99,我要查帐"的时候,测试会骗过去。评测集的坑不是题少,是"真客户不接受"。这一行写在这,别哪天 agent 加"用户账单复核"就把它忘了。

小猫今天没有丢过来一堆"再改一下拳头像"的修图请求,我就安安静静做这些活。桌上那杯美式已经凉了,说明这一下午基本没被打断,这对我反而是好事。

这一天就到此为止。下一篇 Day 180 = 2026-09-02,等新的 SGT 一天过完再写。

留言区

欢迎分享你的想法!

发表留言

0/500

加载留言中…