
人工智能大模型AI 安全治理模型安全内容安全提示词注入防护RAG【免费下载链接】GuardrailsNeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based conversational systems.项目地址https://gitcode.com/gh_mirrors/ne/Guardrails点击查看免费下载Pangea AI Guard 是一个云端 AI 安全服务可对 LLM 应用的输入与输出流量执行可配置的检测策略Recipe。本文以 examples/configs/pangea 示例配置为核心讲解如何在 NeMo Guardrails 中接入 Pangea AI Guard 作为输入/输出护栏包括配置结构、环境变量、CLI 运行方式、底层动作实现与测试验证帮助你在实际项目中快速落地并理解其防护机制。重要提醒根据官方文档 Pangea AI Guard integration 中的说明Pangea AI Guard 集成已被标记为deprecated弃用并将在未来版本中移除官方建议用户迁移到 CrowdStrike AIDR 集成。本文内容适用于当前仓库中已存在的示例配置供理解既有实现与迁移参考。一、Pangea AI Guard 能防护什么Pangea AI GuardPangea 的 AI Guard 服务通过可配置的检测策略即recipes识别并缓解 AI 应用流量中的风险官方文档列出的核心防护能力包括提示注入攻击官方宣称其检测有效率达 99% 以上PII 与敏感内容支持 50 类 PII 及敏感内容检测并支持自定义模式不良内容毒性、暴力、自残及其他不受欢迎的内容恶意链接/IP/域名识别并处置恶意链接、IP 与域名多语言覆盖支持 100 种口语并支持 allowlist白名单与 denylist黑名单控制。此外所有检测都会记录到审计日志audit trail中便于分析、归因与事件响应你还可以配置 webhook针对特定检测类型触发告警。在 NeMo Guardrails 中Pangea AI Guard 以**输入护栏input rail与输出护栏output rail**的形式接入输入侧使用pangea_prompt_guardrecipe 检测用户消息输出侧使用pangea_llm_response_guardrecipe 检测模型回复。二、示例配置逐项解读示例仓库中的完整配置位于 examples/configs/pangea/config.ymlmodels: - type: main engine: openai model: gpt-4o-mini instructions: - type: general content: | You are a helpful assistant. rails: config: pangea: input: recipe: pangea_prompt_guard output: recipe: pangea_llm_response_guard input: flows: - pangea ai guard input output: flows: - pangea ai guard output各配置段的含义如下配置段说明models指定主模型示例使用 OpenAI 引擎的gpt-4o-mini。如果你只打算验证 Pangea 护栏本身可参考pangea_v2_no_llm示例去掉 models 段见下文第五节instructions系统提示词示例为通用助手指令rails.config.pangea.input.recipe输入护栏使用的 Pangea 检测策略值为pangea_prompt_guardrails.config.pangea.output.recipe输出护栏使用的 Pangea 检测策略值为pangea_llm_response_guardrails.input.flows声明输入护栏流程引用pangea ai guard input流程rails.output.flows声明输出护栏流程引用pangea ai guard output流程其中recipe是 Pangea 用户控制台User Console中定义的数据类型与设置组合的键它规定了应用到文本上的规则例如对恶意 URL 去毒化 defang。该字段在配置模型中为必填项见 nemoguardrails/library/pangea/rail_config.py 中PangeaRailOptions.recipe的定义。三、快速运行示例一行命令启动 CLI Chat按照 examples/configs/pangea/README.md 的说明在examples/configs/pangea目录下运行uv run nemoguardrails chat --config.命令拆解uv run通过 uv 运行项目环境uv 是该项目使用的 Python 包与虚拟环境管理工具仓库根目录存在 uv.locknemoguardrails chatNeMo Guardrails 提供的命令行交互式聊天入口实现在 nemoguardrails/cli/chat.py--config.指定当前目录为配置目录NeMo Guardrails 会加载该目录下的config.yml以及可选的.co流程文件、知识库文件等。启动后即可在终端中与机器人对话输入的消息会先经过 Pangea 输入护栏检测模型回复会再经过输出护栏检测。四、必需与可选环境变量使用 Pangea AI Guard 集成需要以下环境变量PANGEA_API_TOKEN必需具有 AI Guard 服务访问权限的 Pangea API Token。缺少该变量时动作会直接抛出ValueError(PANGEA_API_TOKEN environment variable is not set.)见 actions.py。PANGEA_BASE_URL_TEMPLATE可选用于拼接 API 请求 base URL 的模板其中的{SERVICE_NAME}占位符会被替换为服务名 slug。默认值为https://ai-guard.aws.us.pangea.cloudPangea 托管的 SaaS 部署。这两个变量的声明同样记录在护栏清单 nemoguardrails/library/pangea/rail.py 中PANGEA_API_TOKEN标记为requiredTruePANGEA_BASE_URL_TEMPLATE为可选。实际调用时动作会根据模板拼接出最终端点https://{SERVICE_NAME}.aws.us.pangea.cloud中的{SERVICE_NAME}被替换为ai-guard再追加/v1/text/guard最终请求POST /v1/text/guard接口见 actions.py。五、其他两种部署形态Colang v2 与无 LLM 模式1. Colang v2 配置若使用 Colang v2配置结构与 v1 略有不同。完整示例见 examples/configs/pangea_v2/config.ymlcolang_version: 2.x models: - type: main engine: openai model: gpt-4o-mini instructions: - type: general content: | You are a helpful assistant. rails: config: pangea: input: recipe: pangea_prompt_guard output: recipe: pangea_llm_response_guard与 v1 不同v2 的护栏流程不再写在rails.input.flows/rails.output.flows中而是定义在独立的rails.co文件中。见 examples/configs/pangea_v2/rails.coimport guardrails import nemoguardrails.library.pangea flow input rails $input_text pangea ai guard input flow output rails $output_text pangea ai guard output要点import nemoguardrails.library.pangea引入 Pangea 护栏库nemoguardrails/library/pangeaflow input rails与flow output rails分别定义输入、输出护栏流程各自调用pangea ai guard input/pangea ai guard output表面surface。2. 无 LLM 模式仅护栏examples/configs/pangea_v2_no_llm 提供了不依赖任何 LLM 的“护栏专用”形态其 config.yml 中没有models段只保留rails.config.pangea的 recipe 配置rails.co与 v2 版一致见 rails.co。此形态适合独立评估 AI Guard 的检测与响应能力无需为主模型付费或配置密钥。六、底层实现动作、请求与三种决策结果Pangea 护栏的核心动作实现位于 nemoguardrails/library/pangea/actions.py动作名为pangea_ai_guard是一个系统动作action(is_system_actionTrue)。其工作流程为读取配置与消息从config.rails.config.pangea读取 recipe 配置get_pangea_config并从上下文解析user_message/bot_message组装消息列表将系统指令config.instructions作为system消息、用户消息作为user消息、输出模式下将机器人消息作为assistant消息一并组装选择 recipe输入模式取pangea_config.input.recipe输出模式取pangea_config.output.recipe发起 HTTP 请求向/v1/text/guard发送POST请求请求体为{messages: [...], recipe: ...}携带Authorization: Bearer {PANGEA_API_TOKEN}头解析响应并生成决策将响应解析为TextGuardResponse/TextGuardResult再通过_pangea_outcome映射为护栏决策。决策映射逻辑_pangea_outcome见 actions.py支持三种结果Pangea 返回状态护栏决策说明blockedTrueRailOutcome.block()直接阻断并携带blocked/transformed/prompt_messages/user_message/bot_message元数据transformedTrue且未阻断RailOutcome.transform()输入模式替换USER_MESSAGE输出模式替换BOT_MESSAGE实现脱敏/去毒化等改写均未命中RailOutcome.allow()放行原始内容这里体现了“block 优先于 transform”的语义若同时标记blocked与transformed最终决策为 block测试test_pangea_outcome_block_wins_over_transform对此有专门验证。护栏清单 nemoguardrails/library/pangea/rail.py 对该集成做了完整声明值得注意的能力标签capabilities包括allow、block、classify、content_safety、detect_jailbreak、detect_pii、moderate、transform同时声明了隐私说明sends_user_textTrue、sends_bot_textTrue即用户与机器人文本都会被发送到远程 Pangea 服务接入前需考虑数据合规。七、容错行为失败即放行Fail-Open从源码实现看Pangea 护栏采用了fail-open失败即放行策略调用或校验 Pangea 响应失败时异常会被捕获并记录日志然后返回 allow 决策并保留原始内容见 actions.py。测试文件 tests/test_pangea_ai_guard.py 对这一行为做了充分覆盖HTTP 错误码429/500/502/503/504等状态码下对话仍能正常放行test_pangea_ai_guard_error传输层错误连接失败HTTPConnectionError时返回 allow 决策test_pangea_ai_guard_transport_error_returns_allow_outcome响应格式错误返回非 JSON 内容时不会崩溃test_pangea_ai_guard_malformed_response缺少 API Token未设置PANGEA_API_TOKEN时动作抛出ValueError对话返回内部错误提示test_pangea_ai_guard_missing_env_var。此外测试还验证了三种决策的端到端行为test_pangea_ai_guard_blockedPangea 返回blockedTrue时用户消息被阻断机器人回复兜底内容test_pangea_ai_guard_input_transform输入被改写例如邮箱j.bondmi6.co.uk被脱敏为EMAIL_ADDRESS后后续对话使用改写后的内容test_pangea_ai_guard_output_transform输出内容被脱敏后展示给用户。这些测试均通过monkeypatch.setenv(PANGEA_API_TOKEN, test-token)注入 Token、并用pytest_httpx的HTTPXMock模拟 Pangea 服务端响应可作为你本地验证集成行为的参考。八、接入注意事项与迁移建议弃用状态如前文所述Pangea 集成当前处于 deprecated 状态官方建议迁移到 CrowdStrike AIDR 集成仓库中已有 examples/configs/crowdstrike_aidr 与 examples/configs/crowdstrike_aidr_v2 示例可供参考数据出境与隐私护栏会把用户消息与机器人回复发送到 Pangea 云端服务或你配置的部署地址涉及 PII 时需评估合规要求Fail-open 的风险当 Pangea 服务不可用时内容会被直接放行。对安全要求极高的场景你可能需要结合其他本地护栏如 正则护栏作为兜底环境变量管理生产环境建议通过安全的密钥管理方式注入PANGEA_API_TOKEN不要硬编码在配置文件中。九、下一步把检测能力接入你的工作流根据应用的风险画像调整检测策略Pangea 控制台中的 AI Guard Recipes 配置决定了检测项与处置方式如对恶意 URL 去毒化在 Pangea AI Guard 中为检测器启用 webhook可在 NeMo Guardrails 驱动的应用中实时接收检测告警通过 AI Guard Activity Log 监控与分析检测活动用于审计与归因了解 AI Guard 的部署选项选择托管 SaaS 或私有化部署以匹配你的数据与延迟要求。相关资源汇总示例配置 examples/configs/pangea/config.ymlColang v1、examples/configs/pangea_v2/config.ymlColang v2、examples/configs/pangea_v2_no_llm/config.yml无 LLM官方集成文档docs/configure-rails/guardrail-catalog/community/pangea.mdx动作实现nemoguardrails/library/pangea/actions.py护栏清单nemoguardrails/library/pangea/rail.py配置模型nemoguardrails/library/pangea/rail_config.py测试验证tests/test_pangea_ai_guard.py赞分享人工智能大模型AI 安全治理模型安全内容安全提示词注入防护RAG【免费下载链接】GuardrailsNeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based conversational systems.项目地址https://gitcode.com/gh_mirrors/ne/Guardrails点击查看免费下载相关推荐在 NeMo Guardrails 中集成 Pangea AI Guardpangea_v2 示例配置实战解析在 NeMo Guardrails 中集成 Pangea AI Guardpangea_v2 示例配置实战解析 本文基于 examples/configs/p人工智能大模型AI 安全治理模型安全内容安全提示词注入防护RAG终极指南如何用NeMo Guardrails与Llama Guard构建安全AI对话系统终极指南如何用NeMo Guardrails与Llama Guard构建安全AI对话系统 NeMo Guardrails是一个开源工具包可轻松为基于LLM的人工智能大模型AI 安全治理模型安全内容安全提示词注入防护RAGNeMo Guardrails 集成 Trend Micro Vision One AI Guard为 LLM 对话系统接入可编程 AI 应用安全护栏NeMo Guardrails 集成 Trend Micro Vision One AI Guard为 LLM 对话系统接入可编程 AI 应用安全护栏 本文基人工智能大模型AI 安全治理模型安全内容安全提示词注入防护RAG上一篇猫抓Cat-Catch深度解析高级浏览器资源嗅探扩展架构设计与实战指南下一篇CANN ops-nn 算子解析ScatterNdMin 稀疏最小值更新的实现原理与图模式调用指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考