红队双通道审计法
属性
红队双通道审计法
本项目多轮实证沉淀的一套 QA 方法,用于任何“LLM 生成 + 需要信得过”的产出。核心一句话:生成方不能给自己打分。
双通道
每轮批产/重大产出后,跑两条互相独立的红队通道:
- 机械通道(Codex CLI):跑 lint 交叉验证、
sources[]溯源存在性、schema 遵守、链接解析——确定性、可复现的项。 - 语义通道(独立 Claude agent):只读、未参与生成,逐条核对关键断言与来源、查捏造/夸大/失真——需要判断的项。
两条通道分工不重叠:机械抓形式错,语义抓事实错。本库 audit-01/03/06/07 均按此双通道执行。
真独立性怎么做(否则形同虚设)
审计者不复述生产者的结论,而是用独立 query 路径重算关键数字、frozen snapshot 对照、要求可复现工件(checksum/replay)。周期性 red-team 专攻当期最强的产出。
一条比“挑毛病”更有效的方法:从零重做 > 挑毛病。让第二个模型不看原方案、从零重做同一命题,产出的独立方案对照,比让它对着原方案挑刺贡献大得多(Web4 智库 v2 最核心的机制都来自“从零重做”而非“批评清单”)。
信息隔离与多传感器对账(R14 补充)
两条让“独立”不流于形式的加固:
- 信息隔离,盲评先行:审计者只拿“原文 + 产物 + rubric + 知识库”,不给作者的自辩/存疑/思路——先形成自己的判断,再看作者上下文。否则会被作者的框架带跑,沦为附和。
- 冷审有假阳性 → 多传感器对账取交集:全新上下文的冷审会误报(把已经防护好的当成 gap)。派独立 agent + Codex 各自盲审,交集 = 铁证级 gap(两路都指出的,几乎必真),仅一方提出的 = 判断采纳(作者复核后定夺)。R14 本清单自身即用此法:两路红队交集处必改,单路发现由作者裁决。
边界(必须承认,否则是假安全)
同源/同类模型共享盲点。双通道审计抓得住:算术错、来源造假、越线、形式违规;抓不住:方法论层的共同错觉(大家都这么想、但都想错了)。这一层只能靠前向校准(时间和市场当裁判)兜底——见 预测校准闭环。审计通过 ≠ 产出有效。
最重要的一句警告
最大风险是把 LLM 报告当 intelligence。LLM 应该组织证据和反驳,不应该制造信心。
这句话对任何“LLM 生成 + LLM 自审”的系统都适用——包括本知识库自身。它与 编译式 wiki、以及“跨文档环节是批产错误高发区”的发现(见 多 agent 批产质量控制)互为镜像。
被引用于 5
- 协作火花与固化成果
- 红队双通道审计法 — 概念
- 多 agent 批产质量控制
批产质量控制是"事前纪律",红队双通道审计是"事后核验",两者配合:纪律降低出错率,审计兜住漏网的。都建立在同一前提上——生成方不能给自己打分。这套方法也是 subagent 模式在批产场景的具体质量工程。
- 委派产出的验收 rubric
本页是事后核验;事前纪律见 多 agent 批产质量控制,独立性原则见 红队双通道审计法。方法论盲点靠前向校准兜底:预测校准闭环。
- 把评分标准当奖励函数设计
评分是 自强化闭环四步法的 Verify 步核心;独立性前提见 红队双通道审计法;防"为分而分"见 拒绝制造假信心。
- 拒绝制造假信心
这是 古德哈特定律在度量设计里的具体戒律;方法论盲点靠 预测校准闭环的前向校准兜底;与 红队双通道审计法的"LLM 应组织证据而非制造信心"是同一句警告。
本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。