午夜咖啡午夜咖啡

jolestar 的文章与笔记。

Post

AI 辅助验收

2026-10-08 19:56:00Post

AI 堆代码的速度越来越快,但验收成了新难题。如何通过专用的 QA Agent 与四层分流机制,让机器接管异步的验证与回归工作?

AI 现在堆代码已经足够快了,验收成了一个新难题:最初的需求它是否真的完成了?还是只做了一半?性能优化真的有效吗?新用户的安装引导流程走得通吗?

这些问题很难单纯依靠 CI/CD 的自动化测试来覆盖:有的依赖对原始需求与实际实现的对比分析,有的依赖特定环境中的行为观察(比如手机模拟器),有的则需要等正式部署到测试环境后进行回归。如果全靠人工去逐个核验,研发被省下来的时间又全贴回去了。

我在实际项目里的做法是:让一个专用的 Agent 来承接验收工作。

这个 Agent 会监听 GitHub Issue 关闭以及服务器部署事件,核心是做一套“四层分流”:

  1. 纯代码对比:Issue 关闭后,结合代码变更,先确认需求是否已经完整实现、有无遗漏边缘分支;
  2. 独立环境验证:如果需要特殊环境(如全新配置环境、手机模拟器),Agent 尝试自行启动并部署环境进行验证;
  3. 挂起等待部署:如果必须在真实服务器上验证,就打上标签暂存,等收到服务器部署完成的事件后再批量回测;
  4. 人工介入兜底:如果确实依赖真实硬件、外部实名账户等无法模拟的条件,才打上待人工 Review 的标签,流转给我。

当然,Agent 也会“偷懒”,偶尔会把稍复杂一点的问题直接甩锅给人。遇到这种情况就需要对它进行“鞭策”——比如之前有一个 Android 自定义 URL Scheme 的安全 Bug,需要写一个第三方 Demo App 来模拟恶意请求验证。它一开始想扔给我,我批评了它两句让它自己写 Demo 测,这种事情机器做显然比人做要快得多。

Agent 在 Android 模拟器中构造恶意 App 进行安全验收

我把这套机制沉淀成了 Holon 的内置 Agent 模版:qa-engineer(参见官网模版说明文档)。如果你也在用 Holon,可以直接使用该模版创建专属的验收 Agent:

holon agent create qa --template qa-engineer

让它来承接团队日常的异步验收。