OpenAPPA 是一个开源的、MIT 许可的确定性 AI 护栏。网站称它对由提示注入或模型幻觉导致的数据外泄具有 100% 的抵御能力,并有一篇被 NeurIPS 接收的论文支持。它与供应商无关,运行在智能体的提示词和执行循环之外,因此模型无法看到、与之协商或操纵它。它是跨平台、可插拔的引擎,由单一配置驱动,只需在现有智能体循环中的一处接入。 OpenAPPA 不匹配模式,也不列黑名单命令,而是跟踪数据流。其配置描述数据源、受众、信任级别和授权方。每条轨迹都带有安全标签,即受众 × 信任,且该标签只会变得更严格;引擎据此用代数方式推导出每个决策。由于配置是声明式的,用户可以在 CI/CD 中验证整个工具图是否被覆盖。 为帮助智能体完成任务,OpenAPPA 会返回机器可读的补救方案,列出合规的前进方式。净化器通过屏蔽密钥或脱敏 PII 来转换负载。授权方批准某一个具体操作,而不解除会话对后续调用的限制。子智能体把不受信任的读取隔离在一次性分支中,使父级轨迹继续不受污染。网站报告其基准测试中 OpenAPPA 的任务完成率为 89%,攻击成功率为 0%。
团队用 OpenAPPA 防止由提示注入或模型幻觉导致的数据外泄。
团队用 OpenAPPA 跟踪跨工具调用的数据流,而不是匹配模式。
团队用 OpenAPPA 在 CI/CD 中验证整个工具图是否被覆盖。
团队用 OpenAPPA 返回机器可读的补救方案,让智能体能合规地继续。
团队用 OpenAPPA 通过净化器屏蔽密钥或脱敏 PII。
团队用 OpenAPPA 把不受信任的读取隔离在一次性的子智能体分支中。
团队用 OpenAPPA 只需在现有智能体循环中的一处接入。
团队用 OpenAPPA 在智能体的提示词和执行循环之外运行。