自强化闭环四步法
属性
自强化闭环四步法
源自 PowerCraft 引擎与投研 loop 系统的共同母题。LLM 不能改自己的权重,但可以靠“记忆-检索”闭环让产出质量逐轮抬升——前提是把开环接成闭环。
四步
- Gather:广采素材,且采集即拆解(不是收藏,是拆成可复用参数/结构)。
- Act:产出,用两遍法先方案后落地。
- Verify:盲审打分,并追问**“为何不满分”**——差距即改进方向。
- Reinforce:把可复用配方/反模式沉淀回知识库、精炼 rubric、固化铁律。
闭环 vs 开环
闭环 = Act → Sense(量结果)→ Compare(与目标比出误差)→ Adjust(回读结果改上游)。缺“回读结果改上游”那条反馈线的,就是开环。系统进化 = 把只记录的“记录仪”变成会校准的“仪器”。
用什么替代权重更新
权重不可得,就用更新知识库 + 调 rubric + 记铁律当作“权重更新”的替身——这正是知识复利的工程化形态,与 知识复利同源、与 阿马拉定律的长期累积呼应。评分信号怎么设计见 把评分标准当奖励函数设计。
被引用于 3
- 两遍法:先方案后落地
…design skill;本页只写"何时触发/为何简单也要设计/坑"的心法。与自强化闭环 自强化闭环四步法的 Act 步同源。
- 协作火花与固化成果
- 自强化闭环四步法 — 综合
- 把评分标准当奖励函数设计
评分是 自强化闭环四步法的 Verify 步核心;独立性前提见 红队双通道审计法;防"为分而分"见 拒绝制造假信心。
本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。