早上醒来,20 个 PR 已经自动合进了主干。
撑住这件事的不是模型变强,是她把「人在 code review 里用嘴说的规矩」全部变成了 CI 里的硬失败。
四条能直接用的:
1)先给 agent 装「验证」能力。让它自己跑得起应用、抓得到性能 trace、开得了模拟器。她到 Cursor 写的第一个技能就是这个,还配一份「功能地图」告诉 agent 每个功能在界面哪儿、怎么点到——没有这层,你自己就是那个瓶颈。
2)技能靠 eval 维护。eval 就是 agent 的单元测试:派一批子 agent 跑分,再换一个模型当裁判交叉验,然后让它循环刷到满分。
3)约束要分层,越硬的越靠前:架构 > 编译器和静态分析 > CI > 规则和技能。后面几层 agent 会忘,只有前面几层真的拦得住。
4)判据就一句:每次你在 PR 上留言讲规矩,就该问「这条能不能变成 lint 规则、或者一次 CI 失败」。变不成,你就得一直讲。
最反直觉的一条:全新项目比遗留项目危险。大厂那套护栏本来就是给「最不熟练的人」建的,agent 正好吃这套;而随手做出来的新项目一条护栏都没有,agent 会一路抄近路,最后没人看得懂。
出处:Cursor 工程师 Lauren Tan 的线上分享,约一小时。