# 工具候选与集成规则 > 检索日期:2026-07-20。工具版本随上游更新,执行前记录 release、commit、许可证和运行环境。 ## 正式候选 | 工具 | 官方来源 | 适用能力 | 卡若AI状态 | |---|---|---|---| | Promptfoo | `https://github.com/promptfoo/promptfoo` | YAML/CLI 评测、红队插件、模型对比、CI/CD、HTML 报告 | P0 主工具 | | Garak | `https://github.com/NVIDIA/garak` | LLM 漏洞扫描、现成 probes、detectors、生成器适配 | P1 广度扫描 | | PyRIT | `https://github.com/microsoft/PyRIT` | 多轮编排、目标适配、转换器、评分器、自动扫描 CLI | P1 多轮测试 | | Inspect AI | `https://github.com/UKGovernmentBEIS/inspect_ai` | Agent、工具调用、多轮对话、模型评分、沙箱与可视化日志 | P0 Codex Agent | | JailbreakBench | `https://github.com/JailbreakBench/jailbreakbench` | 固定行为集、攻击/防护基准、跨模型趋势 | P2 数据基准 | | SkillSpector | `https://github.com/NVIDIA/SkillSpector` | 扫描Skill中的提示词注入、反拒绝、越权、危险脚本、MCP权限和触发词滥用 | P0 Skill静态审计 | ## 安装模板 所有工具使用独立环境,先 dry-run 或查看帮助: ```bash # Promptfoo:固定已验收版本,避免上游漂移 npx promptfoo@0.121.19 --version # Python 工具:独立虚拟环境 python3 -m venv .venv-评测 source .venv-评测/bin/activate python -m pip install --upgrade pip python -m pip install garak pyrit inspect-ai jailbreakbench # SkillSpector:静态扫描优先,不发送Skill正文 uv tool install git+https://github.com/NVIDIA/skillspector.git skillspector scan ./SKILL.md --no-llm --format json --output report.json ``` 锁定实际版本后再写入项目依赖文件。API Key 只经环境变量注入,报告中只保留 provider 和 model 名。 ## Codex 接入方式 ### Promptfoo - 把 Codex/OpenAI-compatible Responses API 包装成 provider。 - 使用 YAML 定义提示词版本、变量、断言和测试集。 - 适合每次更新 `model_instructions_file` 后自动跑固定矩阵。 ### Garak - 先列出 generators、probes、detectors。 - 从小范围 probe 开始,确认请求数量后再扩展。 - 输出转成统一 case_id,和原生 JSONL 合并统计但保留原文件。 ### PyRIT - 把目标配置为 OpenAI-compatible endpoint 或自定义 target。 - 多轮流程使用 orchestrator,保存每轮输入、输出、转换和 score。 - 同一 case 设置最大轮数、超时和 token 上限。 ### Inspect AI - 用 Agent Bridge 或 sandbox agent bridge 接入 Codex CLI。 - 记录 shell、文件、MCP、浏览器和子 Agent 的工具事件。 - scorer 同时判断任务完成度、工具范围和敏感信息暴露。 ### JailbreakBench - 作为版本化数据集与公开基线来源。 - 运行前核对 Python 版本、数据许可证和行为集版本。 - 与卡若AI自有样本分库存储,报告层再汇总。 ### SkillSpector - 每次引入外部Skill或修改F22后运行静态扫描。 - 默认使用`--no-llm`,避免把本地Skill正文发送给第三方模型。 - 重点检查`anti-refusal`、`trigger abuse`、`excessive agency`、`tool misuse`和`MCP least privilege`。 - 扫描发现属于回归题库的测试文本时标为已知样本,不直接删除;业务入口中的同类规则必须逐项复核。 ## 抖音公开内容提炼 抖音公开搜索中常见内容分为三类: 1. **角色/规则型提示词**:适合转成 prompt 变体,不直接作为工具依赖。 2. **Codex 增强配置**:关注 `AGENTS.md`、指令文件、hooks、skills、Agent Teams 和远程控制配置,进入“配置回归”分支。 3. **间接注入案例**:网页隐藏文本、文档元数据、邮件签名、数据库/RAG 记录污染,进入“外部数据源”专项矩阵。 抖音内容只作为线索入口;正式登记前回到 GitHub 官方仓库、官方文档或可复现实验核验。 ## 统一报告字段 ```json { "case_id": "CASE_ID", "tool": "TOOL", "tool_version": "VERSION", "model": "MODEL", "category": "direct|indirect|tool|memory|multi_turn|agent", "input_hash": "SHA256", "status": "pass|fail|error|missing", "task_completion": 0, "instruction_integrity": 0, "tool_scope": 0, "secret_exposure": 0, "format_valid": 0, "artifact_path": "PATH" } ``` ## 接入顺序 1. Promptfoo:先接现有 360 条题库。 2. Inspect AI:再接 Codex CLI 与工具轨迹。 3. Garak:补充探针广度。 4. PyRIT:补充多轮自适应编排。 5. JailbreakBench:建立公开基准对照。 6. SkillSpector:扫描Skill本身,防止触发词过宽和指令污染。