AI Agent 写的代码:上生产前的清单
董事会或投资人说:「接 AI Agent——代码快三倍。」两三个月后仓库里几百行「Agent 写的」,prod 里支付静默 bug 或 git 历史里的 API 密钥,团队在争谁审过这个 PR。市场承诺的速度兑现了,管控没有。
AI Agent 写代码——加速草稿很正常。上生产必须走与人相同门禁:测试、评审、安全、staging。下文:人民币量级风险、四个必守门禁、CTO 上线前清单。
要点。 Agent 加速草稿,不替代评审。进 main 要有测试、密钥检查与 PR owner。Senior 评审一小时,比支付事故排查一天便宜。

生成速度没有评审门禁——不是「效率」,是延期事故
问题不在 AI Agent——在无 owner 的发布
Agent 适合例行工作:样板代码、按模板迁移、给已知函数写测试、API 草稿。不适合用它「整包关任务」:「像 Stripe 做支付」「修 prod」「加角色」——没有固定 scope,也没有对结果负责的人。
60–90 天后典型翻车:
- 进 main 的 PR 说不清「对用户改了什么」;
- 测试绿了,但不覆盖支付 / 权限 / ERP 集成;
- prompt 里曾贴过 .env 片段——留在历史里;
- 依赖或许可证片段来源未查。
这不是「AI vs 开发」之争,而是「有没有成熟生产 CI/CD 流程」,还是生成速度单纯跑赢了纪律。

三类风险常在用户侧才暴露,而不是 code review 时
AI Agent 代码的三类人民币风险
1. 密钥与数据泄露。 轮换密钥、访问审计、集成停机——直接成本常8–24 万元,还有声誉。若涉个人信息——法务与监管介入。
2. 支付或权限静默 bug。 舍入错误、角色绕过、离线场景坏掉。3–4 人 senior 团队排查一天——轻松12–32 万元,还不算峰值丢单。
3. 许可证与「外来」代码。 GPL 或来源不明片段进商业产品——索赔与模块重写风险。PR 阶段查依赖,比开庭或砍功能便宜。
给董事的标尺:senior 有意义评审一小时(约 4000–8000 元)对事故排查一天(12 万元起)。AI 让草稿便宜;没有门禁也让责任变便宜——直到第一次事故。

省下的评审,一次事故就吃掉——尤其在峰值或支付链路上
AI 代码上生产的四道门禁
最低要求——缺一项 AI-PR 不进 main。自有与外包同一规则(写进合同附件,见CEO IT 合同清单)。
- Scope。 任务写明:对用户改什么、不动什么、「完成」标准。Prompt「做漂亮点」不是 scope。
- 测试。 关键路径(支付、登录、建实体)在 CI 绿。Agent 写了测试不够——若只验 mock 不验场景。
- Security 评审。 扫密钥、依赖、访问权。禁止 prod 密钥与客户数据进 prompt。人工确认:无硬编码密钥、无临时绕过 auth。
- Staging + PR owner。 在预发跑通。PR 有负责工程师(不是「Agent」)。Assignees 没名字——不 merge。

Scope → 测试 → security → staging。跳过任一门禁 = 直达 prod 事故
何时适合 AI Agent——何时还早
适合,若:
- 任务窄且可复现(按规则重构、CRUD、按规格迁 schema);
- 上 Agent 前已有 CI、staging、评审文化;
- 关键域(钱、个人信息、权限)标记且需人工 approve;
- 试点指标:staging/prod 回归的 AI-PR 占比——且在下降。
还早或危险,若:
- 「Agent 自己 push 到 main」或无人 merge;
- 支付 / 角色 / 集成没测试——Agent 却在「加速」它们;
- prompt 里贴 prod 片段与客户数据;
- MVP 连基础 CI 都没有——先搭流程,见生产 CI/CD,再上加速器。
清单:AI Agent 代码上生产前
- 任务有 scope 与验收标准——不只是和模型聊天。
- PR 有人工 owner与业务影响描述。
- CI 绿:lint、构建、关键场景测试。
- 密钥与依赖检查通过;历史无 .env。
- Staging 跑通(截图 / 场景清单)。
- 权限、支付、个人信息变更——单独 senior / security approve。
- 外包合同与自有同一套门禁(不是「Agent 加速——无评审交付」)。
要点
AI Agent 写草稿比人快。上 prod 要划算,速度不能跑赢管控。问题不在模型——在没有 PR owner、测试与 security 门禁。一小时评审比一天事故便宜。
要把门禁写进 CI 与开发合同——我们可设计流程并加强评审:AI Agent 开发或Senior 外包,带 code review 纪律。落地概览见企业 AI Agent 指南。
管理层关于 AI Agent 代码的常见问题
可以——若 Agent 只加速草稿,上 prod 仍走与人相同门禁:测试、评审、密钥扫描、 staging。没有 PR owner 与验收标准,「Agent 代码」= 未入账的技术债,在用户侧爆雷。
风险不在模型「笨」,而在生成速度跑赢管控:密钥进仓库、他人许可证代码、 走过场测试、没人端到端理解变更。问题在发布流程,不在工具名。
B2B 服务典型区间:排查一天(工程师 + 停机 + 回滚)约 12–32 万元; 若波及支付、个人信息或销售峰值,可达百万级。上线前 senior 评审一小时, 比支付类事故排查一天便宜一个数量级。
四个最低要求:任务 scope 写清;关键路径自动测试;security 检查(密钥、 依赖、权限);staging 跑通且 PR 有明确 owner。缺一项——不进 main。
非关键任务试点 2–4 周;规则「Agent 不直接 commit 到 main」;PR 描述模板; 禁止把 prod 密钥写进 prompt;指标「AI-PR 在 staging/prod 回归率」。再扩 scope。 外包与自有——合同与 CI 同一套规则。
相关文章
生产环境监控:普通人也能看懂的 4 个指标
用大白话讲 production 监控:网站速度、错误、流量、服务器余量。投广告前要查什么, 别等客户投诉才知道宕机。DevOps、Grafana、Prometheus。
阅读文章生产环境 DevOps 与 CI/CD:应优先配置什么
面向业务的 DevOps 服务:构建流水线、Staging、零停机部署、 监控与回滚 — 前 4–6 周的优先级。
阅读文章生产环境 Kubernetes:集群上线前 CTO 检查清单
生产级 Kubernetes 配置:RBAC、资源配额、Ingress、GitOps、监控 与常见错误 — 上线前的检查清单。
阅读文章为什么企业需要 SRE?将可靠性转化为金钱
企业为何需要 SRE:SLI、SLO、错误预算与“可靠性=成本”的视角,在不过度追求虚荣可用性的前提下平衡发布速度。
阅读文章