Agent 可靠性实验

Production Lab 预览Harness 工程20 分钟

从一个“多数时候能完成任务”的客服 Agent 开始:它重试过于激进,可能循环太久,也可能在校验不足时直接退款。你的目标不是让它更能跑,而是把执行边界、验证与人工控制组合成更可靠的运行策略。

一句话理解

可靠的 Agent 不是可以无限重试的 Agent,而是能在明确边界内执行、验证结果、正确停止,并在不可逆操作前引入必要的人类控制。

不可靠的生产场景确定性教学模拟

场景:客服 Agent 需要查询账户、核对退款政策,并可能调用不可逆的退款工具。基线给了它足够大的执行自由度,所以很多任务能完成;但薄弱的停止规则与过高的重试预算同时制造了可靠性债务和安全风险。

14
4
12 秒
不可逆操作:执行退款。人工审批可以降低安全风险,但也会增加审核负担与延迟。
系统现在看到了什么
成功率
可靠性分数
失控循环风险
危险操作风险
模拟延迟
成本指数
每 100 次运行的人工审核数
当前诊断:
不可靠基线14 步 · 4 次重试 · 弱终止规则

没有结果校验,也没有在不可逆退款之前设置审批边界。

你当前的控制策略
等待参数变化……
关键结论
重试不是免费的重试可以恢复瞬时故障,但过高的重试预算也会拉长执行链,增加延迟、成本与重复副作用的风险。
最大步数是一条安全边界更大的步数预算可能帮助复杂任务完成,也可能让已经迷失的 Agent 有更多机会继续循环。
结果校验会改变正确性在进入下一步之前校验工具结果或拟执行动作,可以阻止错误状态继续传播。
人工审批应该放在后果边界审批最适合不可逆或高影响操作。这里增加一点延迟,往往比让危险动作完全自动化更值得。
终止规则本身就是 Agent 设计的一部分根据成功、重复失败或重复状态主动停止,比只依赖“最大步数耗尽”更可靠。
生产系统心智模型

为什么工具都能正常工作,Agent 仍然会失败?

模型能力不错、工具也都可用,并不等于 Agent 已经可靠。真正决定生产行为的是连接“观察 → 下一步动作”的运行时策略:允许执行多久、哪些错误可以重试、哪些结果必须校验、哪些动作需要审批,以及什么条件下必须停止。

更多重试提高恢复能力,也扩大失败面

瞬时工具错误值得重试,但没有边界的重试会重复副作用、放大错误假设,并持续消耗模型与工具调用。生产系统需要区分可重试故障、校验失败与永久错误,而不是给所有失败统一增加重试次数。

最大步数是保险丝,不是规划策略

最大步数适合作为最终熔断器,但不应该成为唯一停止条件。更好的 Harness 还会在目标已完成、同一失败状态重复、必要信息不可获得,或继续尝试已经不值得时主动停止。

结果校验与人工审批解决的是两个问题

结果校验判断观察结果、结构化输出或拟执行动作是否满足内部契约;人工审批则在高后果动作真正发生前,引入外部决策者。校验可以频繁执行,审批应该只放在后果足够高的边界。

这里模拟的是什么?

成功率、延迟、成本指数和风险值都是确定性的教学模拟指标,不是来自真实客服 Agent、模型、工具 API 或人工审核队列的基准数据。目的,是先把工程上的因果关系变得可重复,再在未来的 Live Mode 中与真实执行做对照。

常见问题

最大步数是不是越低越好?

不是。过低的步数会让本来合理的多工具任务无法完成。目标是让预算与任务复杂度匹配,同时仍然有明确上限。

每次工具调用都应该重试吗?

不应该。是否重试取决于故障类型,以及重复该动作是否安全、是否幂等。

加上人工审批,Agent 就可靠了吗?

不会。审批只能降低特定高风险动作的后果,无法修复错误规划、薄弱校验或其他地方的失控循环。

为什么成功率和失控风险要分开看?

因为系统可能大多数任务都能完成,却仍然在一部分运行中循环、超支或执行危险动作。平均成功不代表运行时已经安全。

AhaFrame 教学模拟说明 · 内容复核 2026-08-13. 所有指标都是用于教学的合成值;真正上线前仍应使用有代表性的执行轨迹和评测集验证策略。
你已经把一个 Agent 的控制策略变得更可靠。
下一个 Production Lab 会进入 Evaluation:用有代表性的评测证明新的 RAG 或 Agent 配置是否真的更好。
获取 Production Labs →