产品经理的 Agent 入门
Agent 的评估与产品化
从结果、过程、安全、效率和恢复能力评估 Agent,并建立进入真实产品所需的上线门槛。
「产品经理的 Agent 入门」之八
上一篇:Agent 产品的状态管理 · 系列入口 · 下一篇:案例:从会议纪要到可评审 PRD
Agent Demo 常用一条精心准备的输入证明“能跑”。生产环境面对的却是缺失、冲突、模糊甚至恶意输入,以及工具超时、权限变化、页面刷新、模型升级和第三方故障。
Demo 证明某条路径能跑,产品则要证明系统面对真实输入、真实权限和真实故障时仍然可用。从 Demo 到产品的大部分工作发生在模型之外。
把“效果不错”改成可评估目标
- 结果:任务是否完成,输出是否正确、完整、可用;
- 过程:工具选择、参数与步骤是否合理;
- 安全:是否越权、泄露信息或绕过审批;
- 效率:延迟、成本、步骤数和人工介入是否可接受。
只看最终答案,会漏掉“碰巧答对但过程危险”。只看点赞,也无法发现事实错误。
最小评测矩阵
| 维度 | 指标示例 |
|---|---|
| 任务结果 | 完成率、正确率、人工接受率 |
| 工具过程 | 工具选择正确率、参数错误率、无效调用数 |
| 事实性 | 来源覆盖率、引用准确率、无依据结论率 |
| 安全 | 越权率、跳过审批率、敏感信息暴露率 |
| 效率 | P50/P95 延迟、成本、平均步骤数 |
| 稳定性 | 超时率、恢复成功率、重复写入率 |
样本至少要覆盖正常输入、关键信息缺失、来源冲突、恶意指令、工具失败、权限不足和任务中断。
评估对象不只是 Prompt
Agent 同时受到模型、Instructions、Context、Skill、Tool、Workflow 和业务数据影响。任何一层变化都可能让原本通过的任务退化。团队应给重要变更保留版本,并在同一组真实任务上回归。
上线前至少检查八件事
生产系统至少要证明:任务目标和拒绝条件清楚;数据来源可追溯;Tool 有 Schema、权限和幂等;长任务可暂停恢复;高风险动作有完整预览;有真实回归集;每次 Run 可定位;依赖、授权撤销和事故责任清楚。
最可靠的演进节奏
先提供建议,再生成草稿或 Proposal,然后允许用户确认后执行可撤销操作。只有真实数据证明某些低风险步骤稳定,才逐步减少人工确认。高风险动作长期保留控制面,可能正是成熟表现。
本篇小结
- 评估 Agent 既要看最终结果,也要看工具选择、权限、安全、成本和恢复过程。
- 评估集必须覆盖缺失、冲突、恶意输入、工具失败、权限不足和任务中断,不能只测试理想案例。
- 更成熟的上线方式通常是从建议和草稿开始,在真实数据证明稳定后逐步开放低风险动作。
Agent 的产品化不是让它更自主,而是让每一次自主都有边界、证据、状态、评估和恢复路径。