知识库/AI 与 Agent

拒绝制造假信心

属性

拒绝制造假信心

源自投研 loop 系统的教训。最大的风险不是“没有结论”,而是制造一个看起来有依据、其实站不住的结论

数据不够就说不够

数据不足时,诚实说**“还不能下结论”**,而不是硬凑一个指标演戏。少量样本上建“测量环”,本质是表演有把握。

append-only ≠ 闭环

不断往里追加数据(append-only)不等于有了自我校正的闭环。除非:

  • 预注册单一 spec(先定好要测什么、怎么判);
  • 冻结基准(benchmark 不随结果改);
  • 未来 OOS 裁决(用样本外/未来数据当裁判)。

否则每次追加只是扩大 p-hacking / cherry-pick 的空间。

best_k = max() 的陷阱

一个具体反模式:用 best_k = max(...) 取“最好的那个”当结论——这是把 cherry-pick 藏进 max()。选择偏差被一个函数名掩盖了。

关系

这是 古德哈特定律在度量设计里的具体戒律;方法论盲点靠 预测校准闭环的前向校准兜底;与 红队双通道审计法的“LLM 应组织证据而非制造信心”是同一句警告。

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想