Agent 可靠性实验
从一个“多数时候能完成任务”的客服 Agent 开始:它重试过于激进,可能循环太久,也可能在校验不足时直接退款。你的目标不是让它更能跑,而是把执行边界、验证与人工控制组合成更可靠的运行策略。
可靠的 Agent 不是可以无限重试的 Agent,而是能在明确边界内执行、验证结果、正确停止,并在不可逆操作前引入必要的人类控制。
场景:客服 Agent 需要查询账户、核对退款政策,并可能调用不可逆的退款工具。基线给了它足够大的执行自由度,所以很多任务能完成;但薄弱的停止规则与过高的重试预算同时制造了可靠性债务和安全风险。
—
—
—
—
—
—
—
没有结果校验,也没有在不可逆退款之前设置审批边界。
为什么工具都能正常工作,Agent 仍然会失败?
模型能力不错、工具也都可用,并不等于 Agent 已经可靠。真正决定生产行为的是连接“观察 → 下一步动作”的运行时策略:允许执行多久、哪些错误可以重试、哪些结果必须校验、哪些动作需要审批,以及什么条件下必须停止。
更多重试提高恢复能力,也扩大失败面
瞬时工具错误值得重试,但没有边界的重试会重复副作用、放大错误假设,并持续消耗模型与工具调用。生产系统需要区分可重试故障、校验失败与永久错误,而不是给所有失败统一增加重试次数。
最大步数是保险丝,不是规划策略
最大步数适合作为最终熔断器,但不应该成为唯一停止条件。更好的 Harness 还会在目标已完成、同一失败状态重复、必要信息不可获得,或继续尝试已经不值得时主动停止。
结果校验与人工审批解决的是两个问题
结果校验判断观察结果、结构化输出或拟执行动作是否满足内部契约;人工审批则在高后果动作真正发生前,引入外部决策者。校验可以频繁执行,审批应该只放在后果足够高的边界。
这里模拟的是什么?
成功率、延迟、成本指数和风险值都是确定性的教学模拟指标,不是来自真实客服 Agent、模型、工具 API 或人工审核队列的基准数据。目的,是先把工程上的因果关系变得可重复,再在未来的 Live Mode 中与真实执行做对照。
常见问题
不是。过低的步数会让本来合理的多工具任务无法完成。目标是让预算与任务复杂度匹配,同时仍然有明确上限。
不应该。是否重试取决于故障类型,以及重复该动作是否安全、是否幂等。
不会。审批只能降低特定高风险动作的后果,无法修复错误规划、薄弱校验或其他地方的失控循环。
因为系统可能大多数任务都能完成,却仍然在一部分运行中循环、超支或执行危险动作。平均成功不代表运行时已经安全。