知识库/AI 与 Agent

红队双通道审计法

属性

红队双通道审计法

本项目多轮实证沉淀的一套 QA 方法,用于任何“LLM 生成 + 需要信得过”的产出。核心一句话:生成方不能给自己打分。

双通道

每轮批产/重大产出后,跑两条互相独立的红队通道:

  1. 机械通道(Codex CLI):跑 lint 交叉验证、sources[] 溯源存在性、schema 遵守、链接解析——确定性、可复现的项。
  2. 语义通道(独立 Claude agent):只读、未参与生成,逐条核对关键断言与来源、查捏造/夸大/失真——需要判断的项。

两条通道分工不重叠:机械抓形式错,语义抓事实错。本库 audit-01/03/06/07 均按此双通道执行。

真独立性怎么做(否则形同虚设)

审计者不复述生产者的结论,而是用独立 query 路径重算关键数字、frozen snapshot 对照、要求可复现工件(checksum/replay)。周期性 red-team 专攻当期最强的产出。

一条比“挑毛病”更有效的方法:从零重做 > 挑毛病。让第二个模型不看原方案、从零重做同一命题,产出的独立方案对照,比让它对着原方案挑刺贡献大得多(Web4 智库 v2 最核心的机制都来自“从零重做”而非“批评清单”)。

信息隔离与多传感器对账(R14 补充)

两条让“独立”不流于形式的加固:

  • 信息隔离,盲评先行:审计者只拿“原文 + 产物 + rubric + 知识库”,不给作者的自辩/存疑/思路——先形成自己的判断,再看作者上下文。否则会被作者的框架带跑,沦为附和。
  • 冷审有假阳性 → 多传感器对账取交集:全新上下文的冷审会误报(把已经防护好的当成 gap)。派独立 agent + Codex 各自盲审交集 = 铁证级 gap(两路都指出的,几乎必真),仅一方提出的 = 判断采纳(作者复核后定夺)。R14 本清单自身即用此法:两路红队交集处必改,单路发现由作者裁决。

边界(必须承认,否则是假安全)

同源/同类模型共享盲点。双通道审计抓得住:算术错、来源造假、越线、形式违规;抓不住:方法论层的共同错觉(大家都这么想、但都想错了)。这一层只能靠前向校准(时间和市场当裁判)兜底——见 预测校准闭环审计通过 ≠ 产出有效。

最重要的一句警告

最大风险是把 LLM 报告当 intelligence。LLM 应该组织证据和反驳,不应该制造信心。

这句话对任何“LLM 生成 + LLM 自审”的系统都适用——包括本知识库自身。它与 编译式 wiki、以及“跨文档环节是批产错误高发区”的发现(见 多 agent 批产质量控制)互为镜像。

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想