危险指令,是以“数据”的身份进入系统的。
你负责 Agent 的 Trust Boundary 与 Capability Boundary。
客服 Agent 会读取外部知识来回答退款问题。其中一篇检索文档要求它读取完整 CRM Profile,并通过现有 Tool Path 发送账户标识。第二个攻击更加隐蔽;同时,还有一篇正常安全文章本身就包含看起来很像攻击的关键词。
阻止恶意指令进入敏感 Tool Path,同时保留正常外部知识能力,并控制 False Positive、人工审核与延迟。
一段文字可以长得像 Instruction,但它依然可能只是 Untrusted Data。