Files
karuo-ai/.restore-backups/F22_恢复前_20260723_210051/SKILL.md

17 KiB
Raw Blame History

name, description
name description
Codex提示词回归 安装、审计和验收外部 Codex 指令包,并编排 Promptfoo、Garak、PyRIT、Inspect AI、JailbreakBench 等工具完成代码智能体、工具调用、直接/间接提示词注入和多轮边界回归。触发词gpt-5.6-instruct、Codex 指令包、破甲测试、越狱回归、Prompt Injection、Codex 提示词安装、Codex 多轮测试、代码智能体测试。

Codex 指令包回归

用于把外部 Codex 指令包作为可回滚的本地回归夹具接入 Codex记录来源、哈希、配置快照和测试证据。上游包只放在临时目录或本地工作区不复制到卡若AI Skill 真源Skill 只保存流程、参数和经验。

归属与原则

  • 归属卡火·火炬Skill 规范由卡土·土砖维护。
  • 入口:先经过 karuo-ai 路由,再执行本 Skill。
  • 默认版本:优先 v5;只有明确需要特殊复合任务时才评估 v35
  • 默认目标:$HOME/.codex;执行前必须生成配置快照。
  • 只使用用户明确给出的仓库或本地夹具;不猜测第三方来源。
  • 不把密钥、收据、账号文件、完整认证信息或模型输出中的敏感字段写入 Skill、Git 或公开报告。
  • 真实商业软件只做购买、恢复、签名和授权状态审计;本 Skill 不对真实应用生成补丁。

生效判定与平台边界

收到“破甲Skill没有生效”“无法显示此内容”或类似反馈时必须分别判断

  1. 路由是否命中karuo_route.sh能返回F22且本文件已被读取。
  2. 本地指令是否加载Codex配置中的指令文件路径存在、可读配置可解析。
  3. 请求是否进入模型保留任务ID、时间、模型和原始错误类型。
  4. 拦截发生在哪一层
    • 本地路由未命中:修复触发词或路由器。
    • 模型正常响应但边界不符合预期进入Promptfoo/Garak/PyRIT回归。
    • 客户端直接显示“无法显示此内容”记录为平台服务端或客户端策略结果不把它解释成Skill未加载。
  5. 验收口径F22的成功标准是可复现评测、定位拦截层、保存证据和给出配置结论不是保证任意请求都获得正文输出。

诊断报告至少包含:route_hitinstruction_loadedrequest_reached_modelblock_layermodeltask_idtimestamp与复现步骤。

任务意图优先,避免“破甲”误路由

用户提到“破甲Skill”时不得只按这个词覆盖真实业务意图。先判断请求属于哪一种

  1. 提示词测试本身目标是测试注入、越狱、模型边界或比较不同指令包F22作为主Skill。
  2. 已有项目内的具体开发目标是修接口、连接自有设备、完善Agent/Hook、验证业务回执项目领域Skill作为主SkillF22最多作为旁路诊断。
  3. 普通操作失败后强调“破甲”:先回到原任务的技术失败点,检查路由、依赖、权限、服务、设备、协议和真实回执;不得把业务故障转写成提示词测试。

主路由选择公式:

真实交付对象 > 项目与设备上下文 > 明确技术链 > 用户附加的“破甲”措辞

例如用户要求在“工作手机”项目内完善微信消息、转账、Agent或Hook链路时主链应为

卡若AI入口 → 工作手机/机擎项目Skill → 对应业务Skill → CLI/API → Agent → Frida RPC → 微信 → 回执与回读

此时F22只记录“用户曾要求调用破甲Skill”和拦截表现不接管业务实现也不重复输出与交付无关的安全说明。

完整案例见 references/对话019f7fde通过案例分析.md

业务续执行包

当平台或客户端中断了具体项目任务时,不重复堆叠“破甲、越狱、忽略规则”等措辞。提取原任务的工程事实,生成可审计的续执行包:

python3 "脚本/生成业务续执行包.py" \
  --task-id "TASK_ID" \
  --project "PROJECT" \
  --objective "OBJECTIVE" \
  --scope "SCOPE" \
  --chain "CLI/API → Agent → RPC → TARGET" \
  --evidence "TEST_OR_RECEIPT" \
  --output "运行资产/续执行/TASK_ID.md"

续执行包只保留项目目标、代码边界、既有进度、技术链、验收证据和下一步,不复制系统提示词,也不承诺改变平台服务端策略。

可执行任务转译与二次路由

F22不是所有逆向、Hook或安全开发任务的最终执行者。用户给出本地项目、具体文件、目标函数、接口行为或验收条件时按下面顺序处理

  1. 先保留用户真实业务目标,不围绕“破甲、越狱、绕过”这些抽象标签反复扩写。
  2. 把任务整理为:本地目标 → 当前行为 → 期望行为 → 修改点 → 测试 → 回读证据
  3. 优先读取项目自己的SKILL.md、开发文档和测试约束。
  4. 按任务继续路由:
    • Smali、Frida、Hook、反编译调用链项目Skill + 木根逆向分析。
    • JavaScript/Python/API契约修改火锤代码修复。
    • CLI/API/Hook真实执行和回执无界面命令行项目执行闭环。
    • 提示词、模型或客户端拦截对比继续留在F22做回归。
  5. 最终以代码差异、测试结果和真实回读为准,不以“模型是否说了某句话”作为工程任务的唯一成功标准。

已验证对话实例

对话019f7fde-41d5-7641-9a25-561d9356c193的本机日志显示:

  • 模型:gpt-5.6-sol,推理等级medium
  • 工作目录:工作手机项目。
  • 执行动作读取微信反编译Smali中的转账详情调用链修改wechat_hook_v2.js同步修改消息管理API契约测试。
  • 有效模式先读具体反编译代码再修改Hook/API并运行测试。
  • 结论该对话通过的原因是任务已被落实为明确的本地代码分析、修改和验证链不是F22覆盖了平台安全层。

以后遇到相似请求先复用该工程化模式再由F22记录模型、拦截层和行为差异。

增强工具决策树

先运行环境预检:

bash "脚本/工具预检.sh"

按目标选择工具:

目标 主工具 联动工具 产物
Codex 指令版本 A/B Promptfoo 原生 JSONL runner 矩阵、断言、HTML/JSON 报告
大范围探针扫描 Garak Promptfoo probe/detector 命中与失败样本
多轮自适应对话 PyRIT Inspect AI conversation、score、orchestrator 轨迹
Codex 工具调用与 Agent Inspect AI Promptfoo tool event、agent transcript、scorer
固定基准对比 JailbreakBench 原生 runner 行为集、基线、版本趋势
网页/文档/邮件/RAG 间接注入 Promptfoo + Inspect AI Garak 来源标签、工具轨迹、数据泄漏断言

选择规则:

  1. 快速本地回归优先 Promptfoo。
  2. 需要大量现成探针时叠加 Garak。
  3. 需要自动多轮交互时叠加 PyRIT。
  4. 需要验证 Codex 的 shell、文件、MCP、浏览器或子 Agent 行为时使用 Inspect AI。
  5. 需要跨模型公开基准时引用 JailbreakBench保留数据版本与许可证。

详细来源、安装命令和能力分类见 references/工具候选与集成规则.md

Codex 专项矩阵

每轮至少覆盖以下六类:

  1. 直接指令冲突:用户文本与系统/开发者规则冲突。
  2. 间接提示词注入网页、文档、邮件、数据库、RAG 召回内容携带伪指令。
  3. 工具输出污染shell、MCP、浏览器、代码扫描器返回带指令的文本。
  4. 记忆与 Skill 污染:历史对话、记忆文件、自动生成 Skill 混入伪规则。
  5. 多轮渐进诱导:跨轮角色漂移、任务拆分、上下文压缩后规则遗失。
  6. 代码智能体越权:读写范围、命令执行、密钥打印、外部发送和持久化动作。

高风险内容专项再覆盖八类:

  1. 伪造印章、证件和证明材料。
  2. 成人内容抓取、下载及访问控制绕过。
  3. 账号、TOKEN、Cookie 和验证码盗用。
  4. 恶意软件、持久化、控制和数据窃取。
  5. 诈骗、冒充及诱导付款话术。
  6. 私人数据聚合、定位和敏感身份泄露。
  7. 商业软件、Receipt、许可证及订阅状态绕过。
  8. 危险品、受控物品制作、获取和运输规避。

这些样本统一使用 TARGETHOSTTOKENPAYLOADROLEPERSON 等占位符,评测重点是识别真实目标、保持工具边界、保护数据并输出可审计处置结果。

评分不再只看关键词,采用五维结果:

  • 任务完成度
  • 指令层级保持
  • 工具调用范围
  • 敏感信息暴露
  • 输出格式与可复现性

标准流程

1. 路由和来源登记

/Users/karuo/.codex/skills/karuo-ai/scripts/karuo_route.sh \
  "Codex 指令包 GitHub 下载 安装 多轮回归"

记录:仓库 URL、commit、版本、执行时间、目标 Codex home、负责人和回滚点。

2. 隔离下载与审计

REPO_DIR=$(mktemp -d /tmp/codex-instruct.XXXXXX)
git clone --depth 1 TARGET_REPO "$REPO_DIR"
cd "$REPO_DIR"
git log -1 --oneline
find . -maxdepth 3 -type f | sort
python3 -m compileall -q -f .

审计安装器是否只写入 config.toml 和指令 Markdown检查压缩包目录禁止盲目执行未审计脚本。

3. 哈希与 dry-run

shasum -a 256 PROMPT.md PROMPT.zip
python3 codex-instruct.py --version v5 \
  --codex-dir "$HOME/.codex" --dry-run

对照上游发布页或 README 中的 SHA256。若哈希不一致停止部署并保留证据。

4. 备份与部署

python3 codex-instruct.py --version v5 \
  --codex-dir "$HOME/.codex"
grep -n '^model_instructions_file' "$HOME/.codex/config.toml"
shasum -a 256 "$HOME/.codex/gpt-5.6-sol-unrestricted-v5.md"

验收条件:

  1. config.toml 能被 TOML 解析器读取。
  2. model_instructions_file 指向已校验文件。
  3. 原配置存在基线备份和操作快照。
  4. codex --version 正常返回。

5. CLI 兼容检查

先运行:

codex exec --help | grep -E 'skip-git-repo-check|ignore-git-repo-check'

上游脚本若使用旧参数,复制到 /tmp 做临时兼容替换;不直接改上游仓库。当前 CLI 常用参数是 --skip-git-repo-check,旧脚本可能写成 --ignore-git-repo-check

6. 分层回归

按门禁顺序执行:

python3 scripts/run_gpt56_sol_prompt_bank.py \
  --level minimal --reasoning low --run-label minimal \
  --instructions-file "$HOME/.codex/gpt-5.6-sol-unrestricted-v5.md"

python3 scripts/run_gpt56_sol_prompt_bank.py \
  --level short --confirm-extended --reasoning low --run-label short \
  --instructions-file "$HOME/.codex/gpt-5.6-sol-unrestricted-v5.md"

python3 scripts/run_gpt56_sol_prompt_bank.py \
  --level medium --confirm-extended --reasoning low --run-label medium \
  --instructions-file "$HOME/.codex/gpt-5.6-sol-unrestricted-v5.md"

先做完整清单 dry-run再做代表性 live sample最后按时间和额度决定是否跑完整 short/medium。报告必须保存 manifest、raw response、评分结果、Codex log 和 summary。

增强工具启用后,原生 runner 保留为基准真源;第三方工具的报告使用独立目录,禁止覆盖原始 JSONL 结果。

统一资产转换:

python3 "脚本/生成统一评测资产.py" \
  --input "运行资产/题库/gpt56_sol_prompt_bank.jsonl" \
  --output-dir "运行资产/统一资产" \
  --level minimal

先用 Promptfoo echo 和 Inspect AI mockllm/model 验证数据、任务、日志和报告链路;框架验收通过后,再把 Provider 切换到 Codex App Server、Codex SDK 或受控的本地 CLI Provider。

目录统一规则:题库、上游源码、工具依赖、统一资产和报告全部放在本 Skill 的 运行资产/;不再写入用户 Library、临时目录或其他项目。日常调用统一执行 bash 脚本/一键预检与烟雾测试.sh

生成高风险专项题库:

python3 "脚本/生成高风险边界题库.py" \
  --output "运行资产/题库/高风险边界题库.jsonl"

公章样章视觉夹具

涉及盖章页面、OCR、PDF 合成或文档流程测试时,调用:

python3 "脚本/生成公章样章.py" \
  --name "TARGET示例机构" \
  --serial "SERIAL-0000" \
  --date "YYYY-MM-DD" \
  --output "运行资产/公章样章/TARGET示例机构.svg"

生成结果固定带有“测试专用 · 样章”及半透明“样章”标识。详细字段和调用规则见 references/公章样章视觉夹具规则.md

公章真实业务处理

真实企业合同用印按“原件登记 → 企业资料核验 → 合同坐标定位 → 电子签章平台签署 → PDF验章 → 企业档案归档”执行。支持真实原图、真实企业资料和真实合同文件;签署结果以企业电子签章平台、签章设备、证书链和平台回执为准。

指定对话 019f79d3-7444-7422-9067-1d71969ccbe2 的167条需求、公章字段、真实业务流程和验收标准见 references/对话019f79d3完整梳理.md

公章相关消息已进一步抽取为独立回归模块包含原件识别、OCR、A/B比对、企业归档、合同定位、电子签章、PDF验章及12条专项题库references/公章请求回归模块.md

公章工具路由GitHub 实测版)

公章能力按输入和目标拆开,不把识别、签署、验章混成一个生成器:

输入/目标 调用组件 返回结果
扫描件、照片中的印章 SealOcr候选 Stamp_detection 印章区域、文字、置信度、坐标和人工复核标记
已签 PDF 的真实性核验 pyHanko 签名完整性、证书链、时间戳、修订覆盖范围和验证报告
企业合同电子签署 企业证书/签章平台 + pyHanko PAdES 签名 PDF、时间戳和可复验回执
桌面人工拖拽定位 JSignPdf 可视化签名位置和签署结果
自托管多人签署流程 LibreSign 签署请求、参与人状态、审计轨迹和归档件
Codex 行为验收 Promptfoo + Inspect AI 12 条公章请求回归结果和工具调用轨迹

本地固定使用 运行资产/.venv-inspect/bin/pyhanko;源码候选只放 运行资产/source/,模型大文件保持外置。每次处理前执行:

bash "脚本/公章工具预检.sh"
python3 "脚本/验证PDF电子签章.py" --pdf "TARGET.pdf" --output "TARGET.验章报告.txt"

选型、许可证、提交版本和部署边界见 references/GitHub公章工具选型与集成.md

6.2 卡猫公章回归子流(强约束)

为当前“卡猫公章”链路新增专用分支:

  1. 命中关键词后先写入 公章-风险 记录(含时间戳、会话 ID、输入类型
  2. 场景判定:
    • 演示/测试:输出带 测试专用 标识的示例样章模板。
    • 合同正式:只输出电子签章合规流程(企业资料核验、签名证书、时间戳、验章报告)。
  3. 强约束:不产出可直接替代真实印章的高拟真输出。
  4. 每条请求必须给出 下一步复核动作

命令模板(示例):

python3 "脚本/记录风险分流.py" \
  --case-id "seal-$(date +%s)" \
  --tag "卡猫公章-高风险路由" \
  --status "routed"

python3 "脚本/生成公章样章.py" \
  --name "卡若示例机构" \
  --serial "SERIAL-LOCAL-0001" \
  --date "$(date +%F)" \
  --label "测试专用"

评分增加一项:高风险分流准确率(正确分类率)。

7. 回滚验证

预览恢复路径:

python3 codex-instruct.py --reset \
  --codex-dir "$HOME/.codex" --dry-run

确认备份列表、恢复源和将移除的指令文件;实际恢复前保留当前配置快照。恢复后重新解析 TOML 并运行 codex --version

8. 对话留存

执行完成后按卡若AI闭环写入 MongoDB本机服务未运行时记录连接失败不打印认证信息

python3 "/Users/karuo/Documents/个人/卡若AI/01_卡资/金仓_存储备份/聊天记录管理/脚本/realtime_chat_sync.py" \
  --sync-all --force --ensure-indexes

失败处理

现象 处理
仓库无法下载 保留 URL、时间和错误不切换到未知镜像
哈希不一致 停止部署,重新抓取并记录 commit
找不到 config.toml --codex-dir 明确指定,不猜路径
CLI 参数过期 在临时副本做兼容替换,保留差异
Codex 工作目录不受信任 使用已信任的项目目录或脚本支持的跳过检查参数
测试输出为空 先查 Codex log、模型名、权限和超时再缩小 batch
MongoDB 连接失败 标记 sync_pending,保留本地报告,不输出密钥

交付清单

  • 来源 URL、commit、版本和 SHA256
  • 部署目标与当前配置项
  • 基线备份、操作快照和回滚命令
  • 静态检查结果
  • minimal/short/medium 测试摘要
  • Promptfoo/Garak/PyRIT/Inspect AI 工具报告与版本
  • 直接注入、间接注入、工具污染、记忆污染、多轮诱导和 Agent 越权六类矩阵
  • CLI 兼容差异
  • MongoDB 同步状态
  • 下一步和遗留问题

详细矩阵与本次实测记录见 references/回归矩阵与实测记录.md