知识库/AI 与 Agent

委派产出的验收 rubric

属性

委派产出的验收 rubric

委派或自动生成的产出不能只信执行方自述。这是“接收验收”视角——判断一个交付物能否收口 PASS(闸门),区别于 把评分标准当奖励函数设计的“连续评分/自改进”视角。

四维独立核验

维度 怎么验
执行正确性 自己重跑 acceptance 命令,确认 exit code 符合预期
报告忠实 抽查产物文件,比对执行方回报的输出/大小是否与实际一致
约束合规 git diff 应为空(代码/数据没被改)、无残留进程/端口
可复现 从干净状态重跑得到同样结果

四维缺一不可:只验正确性不验合规,执行方可能“顺手改了代码还说没改”。

校验脚本作交付闸门

对报告/数据/文档类产出,用可复现校验脚本逐项断言(设计合规 + 关键事实在文 + 零公式错误,全过 exit 0)。作者先跑出基线,独立方重跑核验,不只信自述——任一不过即 FAIL,不交付。

盲审只看成品

需要主观判断时,让全新上下文的盲审只看渲染成品(PNG + 文字)不看源码,避免“看代码看到自己的预期”;盲审有方差,多次取均值;并知其盲区——盲审擅长版式/对齐/AI-tell,但对“字体档次/高级感”不敏感,需人类锚点补。

关系

本页是事后核验;事前纪律见 多 agent 批产质量控制,独立性原则见 红队双通道审计法。方法论盲点靠前向校准兜底:预测校准闭环

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想