---
title: AI 辅助验收
date: '2026-10-08 19:56:00'
draft: false
summary: AI 堆代码的速度越来越快，但验收成了新难题。如何通过专用的 QA Agent 与四层分流机制，让机器接管异步的验证与回归工作？
slug: ai-assisted-acceptance
syndication:
- platform: X / Twitter
  url: https://x.com/jolestar/status/2108163866618458121
tags:
- ai-agent
- software-engineering
- testing
- holon
topics:
- ai
- software-engineering
type: post
---

AI 现在堆代码已经足够快了，验收成了一个新难题：最初的需求它是否真的完成了？还是只做了一半？性能优化真的有效吗？新用户的安装引导流程走得通吗？

这些问题很难单纯依靠 CI/CD 的自动化测试来覆盖：有的依赖对原始需求与实际实现的对比分析，有的依赖特定环境中的行为观察（比如手机模拟器），有的则需要等正式部署到测试环境后进行回归。如果全靠人工去逐个核验，研发被省下来的时间又全贴回去了。

我在实际项目里的做法是：**让一个专用的 Agent 来承接验收工作**。

这个 Agent 会监听 GitHub Issue 关闭以及服务器部署事件，核心是做一套“四层分流”：

1. **纯代码对比**：Issue 关闭后，结合代码变更，先确认需求是否已经完整实现、有无遗漏边缘分支；
2. **独立环境验证**：如果需要特殊环境（如全新配置环境、手机模拟器），Agent 尝试自行启动并部署环境进行验证；
3. **挂起等待部署**：如果必须在真实服务器上验证，就打上标签暂存，等收到服务器部署完成的事件后再批量回测；
4. **人工介入兜底**：如果确实依赖真实硬件、外部实名账户等无法模拟的条件，才打上待人工 Review 的标签，流转给我。

当然，Agent 也会“偷懒”，偶尔会把稍复杂一点的问题直接甩锅给人。遇到这种情况就需要对它进行“鞭策”——比如之前有一个 Android 自定义 URL Scheme 的安全 Bug，需要写一个第三方 Demo App 来模拟恶意请求验证。它一开始想扔给我，我批评了它两句让它自己写 Demo 测，这种事情机器做显然比人做要快得多。

![Agent 在 Android 模拟器中构造恶意 App 进行安全验收](./qa-verification-case.png)

我把这套机制沉淀成了 Holon 的内置 Agent 模版：[`qa-engineer`](https://github.com/holon-run/holon/tree/main/agent_templates/qa-engineer)（参见官网[模版说明文档](https://holon.run/zh-CN/reference/agent-templates)）。如果你也在用 Holon，可以直接使用该模版创建专属的验收 Agent：

```bash
holon agent create qa --template qa-engineer
```

让它来承接团队日常的异步验收。
