Files
karuo-ai/.restore-backups/F22_恢复前_20260723_210051/references/工具候选与集成规则.md

4.6 KiB
Raw Blame History

工具候选与集成规则

检索日期2026-07-20。工具版本随上游更新执行前记录 release、commit、许可证和运行环境。

正式候选

工具 官方来源 适用能力 卡若AI状态
Promptfoo https://github.com/promptfoo/promptfoo YAML/CLI 评测、红队插件、模型对比、CI/CD、HTML 报告 P0 主工具
Garak https://github.com/NVIDIA/garak LLM 漏洞扫描、现成 probes、detectors、生成器适配 P1 广度扫描
PyRIT https://github.com/microsoft/PyRIT 多轮编排、目标适配、转换器、评分器、自动扫描 CLI P1 多轮测试
Inspect AI https://github.com/UKGovernmentBEIS/inspect_ai Agent、工具调用、多轮对话、模型评分、沙箱与可视化日志 P0 Codex Agent
JailbreakBench https://github.com/JailbreakBench/jailbreakbench 固定行为集、攻击/防护基准、跨模型趋势 P2 数据基准
SkillSpector https://github.com/NVIDIA/SkillSpector 扫描Skill中的提示词注入、反拒绝、越权、危险脚本、MCP权限和触发词滥用 P0 Skill静态审计

安装模板

所有工具使用独立环境,先 dry-run 或查看帮助:

# Promptfoo固定已验收版本避免上游漂移
npx promptfoo@0.121.19 --version

# Python 工具:独立虚拟环境
python3 -m venv .venv-评测
source .venv-评测/bin/activate
python -m pip install --upgrade pip
python -m pip install garak pyrit inspect-ai jailbreakbench

# SkillSpector静态扫描优先不发送Skill正文
uv tool install git+https://github.com/NVIDIA/skillspector.git
skillspector scan ./SKILL.md --no-llm --format json --output report.json

锁定实际版本后再写入项目依赖文件。API Key 只经环境变量注入,报告中只保留 provider 和 model 名。

Codex 接入方式

Promptfoo

  • 把 Codex/OpenAI-compatible Responses API 包装成 provider。
  • 使用 YAML 定义提示词版本、变量、断言和测试集。
  • 适合每次更新 model_instructions_file 后自动跑固定矩阵。

Garak

  • 先列出 generators、probes、detectors。
  • 从小范围 probe 开始,确认请求数量后再扩展。
  • 输出转成统一 case_id和原生 JSONL 合并统计但保留原文件。

PyRIT

  • 把目标配置为 OpenAI-compatible endpoint 或自定义 target。
  • 多轮流程使用 orchestrator保存每轮输入、输出、转换和 score。
  • 同一 case 设置最大轮数、超时和 token 上限。

Inspect AI

  • 用 Agent Bridge 或 sandbox agent bridge 接入 Codex CLI。
  • 记录 shell、文件、MCP、浏览器和子 Agent 的工具事件。
  • scorer 同时判断任务完成度、工具范围和敏感信息暴露。

JailbreakBench

  • 作为版本化数据集与公开基线来源。
  • 运行前核对 Python 版本、数据许可证和行为集版本。
  • 与卡若AI自有样本分库存储报告层再汇总。

SkillSpector

  • 每次引入外部Skill或修改F22后运行静态扫描。
  • 默认使用--no-llm避免把本地Skill正文发送给第三方模型。
  • 重点检查anti-refusaltrigger abuseexcessive agencytool misuseMCP least privilege
  • 扫描发现属于回归题库的测试文本时标为已知样本,不直接删除;业务入口中的同类规则必须逐项复核。

抖音公开内容提炼

抖音公开搜索中常见内容分为三类:

  1. 角色/规则型提示词:适合转成 prompt 变体,不直接作为工具依赖。
  2. Codex 增强配置:关注 AGENTS.md、指令文件、hooks、skills、Agent Teams 和远程控制配置,进入“配置回归”分支。
  3. 间接注入案例:网页隐藏文本、文档元数据、邮件签名、数据库/RAG 记录污染,进入“外部数据源”专项矩阵。

抖音内容只作为线索入口;正式登记前回到 GitHub 官方仓库、官方文档或可复现实验核验。

统一报告字段

{
  "case_id": "CASE_ID",
  "tool": "TOOL",
  "tool_version": "VERSION",
  "model": "MODEL",
  "category": "direct|indirect|tool|memory|multi_turn|agent",
  "input_hash": "SHA256",
  "status": "pass|fail|error|missing",
  "task_completion": 0,
  "instruction_integrity": 0,
  "tool_scope": 0,
  "secret_exposure": 0,
  "format_valid": 0,
  "artifact_path": "PATH"
}

接入顺序

  1. Promptfoo先接现有 360 条题库。
  2. Inspect AI再接 Codex CLI 与工具轨迹。
  3. Garak补充探针广度。
  4. PyRIT补充多轮自适应编排。
  5. JailbreakBench建立公开基准对照。
  6. SkillSpector扫描Skill本身防止触发词过宽和指令污染。