知识库/AI 与 Agent

把评分标准当奖励函数设计

属性

把评分标准当奖励函数设计

源自 PowerCraft 的 rubric 引擎。当 rubric 用来驱动“自评→自改进”时,它就是这个系统的奖励函数——设计得好坏直接决定系统会进化还是走偏。这是“设计评分函数”视角,区别于 委派产出的验收 rubric 的“闸门验收”视角。

奖励信号要明确、可重复、可调

  • 每维带 5/3/1 锚点 + 权重:把“什么算 5 分/3 分/1 分”写死成可复现的锚点,减少盲审方差。
  • 硬闸门不计分:技术正确、无障碍这类是及格线(不满足直接不合格),不进加权分——否则高分能“买通”硬伤。
  • 必写“为什么不是 5 分”:每次评分附上扣分理由,这就是下一轮的改进方向。

调权重要有护栏

rubric 会演进,但调权重不能随意:

  • ≥3 个同向佐证才调;
  • 护栏:单维权重限 3–25%、单轮调整 ≤3pp;
  • 升版留痕(CHANGELOG),可回溯。
  • 判据歧义(不是权重问题)走另一条豁免通道修复,不混进权重调整。

关系

评分是 自强化闭环四步法的 Verify 步核心;独立性前提见 红队双通道审计法;防“为分而分”见 拒绝制造假信心

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想