知识库/AI 与 Agent

自强化闭环四步法

属性

自强化闭环四步法

源自 PowerCraft 引擎与投研 loop 系统的共同母题。LLM 不能改自己的权重,但可以靠“记忆-检索”闭环让产出质量逐轮抬升——前提是把开环接成闭环。

四步

  1. Gather:广采素材,且采集即拆解(不是收藏,是拆成可复用参数/结构)。
  2. Act:产出,用两遍法先方案后落地。
  3. Verify:盲审打分,并追问**“为何不满分”**——差距即改进方向。
  4. Reinforce:把可复用配方/反模式沉淀回知识库、精炼 rubric、固化铁律。

闭环 vs 开环

闭环 = Act → Sense(量结果)→ Compare(与目标比出误差)→ Adjust(回读结果改上游)。缺“回读结果改上游”那条反馈线的,就是开环。系统进化 = 把只记录的“记录仪”变成会校准的“仪器”。

用什么替代权重更新

权重不可得,就用更新知识库 + 调 rubric + 记铁律当作“权重更新”的替身——这正是知识复利的工程化形态,与 知识复利同源、与 阿马拉定律的长期累积呼应。评分信号怎么设计见 把评分标准当奖励函数设计

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想