知识库/经典概念 · 费曼寓言

选择性标签

属性
概念经典概念 · 费曼寓言属于AI 与科技置信· 1 源2026-07-15#mental-models#ai#decision-making#machine-learning#data-bias

选择性标签

🎭 本篇寓言已有视觉化剧场版:门外没有脚印 · 寓言剧场——滚动叙事 + 机制动画,先看故事再读概念。

出自 寓言剧场·AI 生成寓言集《门外没有脚印》寓言:回雾关只让铜燕认可的人走入长雾,也只收到这些被放行者留下的归来铜环。阿汀年年被挡在门内,守门人便拿“从没有这样的人回来”证明拒绝正确。直到她从泄水洞绕过关门、救回雪橇,众人才明白:门外没有她的脚印,不是那边没有路,只是门从未为她打开。

概念内核

选择性标签(Selective Labels)是一个由决策过程自己制造的数据盲区:只有当决策者作出某种选择后,后续真实结果才有机会被观察;对于未被选择的对象,结果不是“坏”,而是未知

例如,银行能看到获批贷款者后来是否还款,却不能直接看到被拒者如果获贷会怎样;公司能看到录用者的工作表现,却看不到落选者在同一岗位上的表现;保释场景中,也只有被释放者才可能留下“释放后是否再犯”的可观察结果。若把这些历史 outcome 当成覆盖全部人的完整答案,模型就会学习一个由过去决策筛出来的世界。

Lakkaraju、Kleinberg、Leskovec、Ludwig 与 Mullainathan 在 KDD 2017 论文 The Selective Labels Problem: Evaluating Algorithmic Predictions in the Presence of Unobservables 中系统研究了这一问题:决策者的选择决定哪些真实结果可见,因此不能像普通完整标签数据那样直接评估新的预测规则。

它形成一个反馈回路:

  1. 过去的规则只给一部分人机会;
  2. 只有这部分人产生可观察结果;
  3. 下一轮模型把这部分记录当作“历史经验”;
  4. 模型继续偏向过去已被选择的人,门外的空白便越来越像可靠规律。

三条边界必须分清:

  • 未知不等于优秀。 被拒者中当然可能有人会失败;问题是现有记录没有告诉我们谁会失败,不能把空白直接当成负面 label。
  • 已有记录未必是错的。 获批者的还款、录用者的绩效都可以是真实结果;偏差来自这些结果只回答“过去被选中的人后来怎样”。
  • 补标签不能无视伦理与风险。 在低风险场景可以设计受控探索或随机试验;高风险决策则需要因果方法、制度性复核、自然实验或决策者分歧等额外证据,不能为了收集数据随意让人承担伤害。

寓言全文

《门外没有脚印》全文照录,供细读研究;剧场版为节选配画。本篇由寓言剧场以 fabulist-v1.md 提示词生成(Codex,2026-07-15),原文一字未改。概念事实另以 KDD 2017 论文为依据,寓言不作为经验事实的证据。

回雾关立在两座雪山相夹的地方。

关外是一条穿过长雾的旧路。有人沿它去盐海换药,有人去北坡采种,也有人一去便再没回来。每一个想出关的人,都要先把木牌放进门楼上的铜燕腹中。铜燕会低头听一听木牌的声响,再看那人的靴底、绳结和背囊,然后吐出一枚青羽,或吐出一片灰石。

得青羽的人,门开;得灰石的人,回家。

铜燕从不凭空作决定。它身后的墙上,挂满了归来者留下的小铜环。每个铜环都记着一段远行:什么样的靴子走过碎冰,什么样的绳结挨住山风,什么样的背囊从雾里带回盐和种子。守门人每到冬天,就把这些铜环一枚枚放进燕腹。第二年春天,铜燕便比上一年更谨慎。

它挑中的旅人越来越像那些曾经回来的人。它放行得越来越少,回来的人却越来越多。关里人于是说,这只燕子不但记得路,还看得见人的命。

织索匠的女儿阿汀第一次来时,铜燕吐给她一片灰石。她的靴子是自己缝的,鞋底横着一道别人没有的软缝;她的绳结也不照门楼里的旧样,而是向里多绕半圈。守门人把灰石推还给她,说:“雾路不认这些东西。”

第二年,阿汀又来,仍是灰石。后来每逢开关,她都背着同一个旧背囊站在队尾;门开了又关,她总在门里。

“你看,”守门人有一次劝她,“这么多年,像你这样系绳的人,从没有一个从雾里回来。”

阿汀望着门外。新雪一直铺到雾中,雪上没有她的脚印。

那年秋末,关外的风铃忽然乱响。那是远行者求救的声音。大雪堵住旧路,出去的人困在北坡,门楼里却没有谁认得新落下的雪层。守门人急得来回踱步,铜燕只会低头啄那些旧铜环。

阿汀把自己的绳索缠上腰,钻过门楼下泄水的石洞。她那道横缝很软,踩在浮雪上不会把雪壳割破;向里多绕的半圈绳结,受力时反而越收越紧。天黑以前,她从雾里拖回了第一副雪橇。夜深时,最后一盏风灯也跟着她回到门内。

守门人把一枚新铜环送进燕腹。铜燕啄了很久,却找不到安放它的槽。

它腹中只有两类旧物:被它放行的人,怎样回来;被它放行的人,怎样没有回来。至于那些被灰石挡住的人,墙上没有铜环,燕腹里也没有一丝声响。它从未见过他们在雾里会怎样,却年复一年,用这片沉默证明自己不该放他们出去。

守门人这才重新看向关外的雪。

门外没有脚印,并不是那边没有路。

只是门一直没有开。

隐喻对照

  • 回雾关 = 决定谁能获得机会的高风险关口,例如放贷、录用、保释或接受治疗
  • 铜燕 = 根据历史决策与可见结果作判断的模型
  • 被放行者留下的铜环 = 只有作出“允许”决定后才能观察到的 outcome label
  • 灰石挡住的人 = 被拒绝,因此永远没有机会留下结果的人
  • “从没有这样的人回来” = 把“从未让他们尝试”误当成“他们做不到”
  • 阿汀从石洞出关并救人 = 一次越过旧选择边界的探索,补回原本看不到的结果
  • 铜燕找不到安放新铜环的槽 = 旧记录只认识自己过去允许发生的世界

费曼版:假如你只让穿蓝鞋的孩子参加跑步,然后发现获奖者全都穿蓝鞋,你不能因此说“红鞋孩子不会跑”。你根本没有让他们上场,所以你没有他们跑得快不快的答案。可是,如果下一次你又拿“过去的冠军都穿蓝鞋”当理由,只让蓝鞋孩子参赛,这个空白就会一直留着,还会越来越像一条可靠的规律。

跨主题应用

  • 与算法单一化的区别算法单一化讲多个决策者横向共享同一判断来源;选择性标签讲决策在纵向上控制哪些结果能进入下一轮数据。两者可以叠加,但不是同一机制。
  • 与逆向选择的区别逆向选择源于交易双方掌握的信息不同;选择性标签即使没有一方隐瞒信息,也会因为“未获机会就没有结果”而产生不可观察项。
  • 模型评估:不要只问模型在历史可见 label 上多准,还要问这些 label 是谁的旧决定筛出来的、哪些人从未获得产生结果的机会,以及部署后选择边界会怎样改变未来数据。

一句话钉子:没有结果,有时不是因为谁做不到,而是因为门从未为他打开。

本页由 AI 从原始资料编译生成、经人工确认后发布;原始资料保留在私有工作区。

人负责策展与提问,AI 负责编译与记账· 源自 Karpathy 的 LLM Wiki 构想