知识库/AI 与 Agent
按内容核验源文,不认文件名
属性
按内容核验源文,不认文件名
源自阿中翻译器的 intake 纪律。整条流水线的正确性都建立在“源文是不是它自称的那个”之上——这一步错了,后面全错。
先核身份,不信文件名
文件名可能贴错。摄入第一步用**“渲染 → 读内容”**核对每个文件的真实身份,永不以文件名为依据使用一个文件。
关键处逐字核字
抽文首选渲染成图、视觉读图,而非直接抽坏编码/扫描件的文本层。关键处必须高倍逐字核字——低倍容易把相近字误读。
未核不进下游
未经核字的源文不得进入下游任何环节。理由很硬:误读的源文会让产物和红队都建在错前提上——红队再独立,也审不出“大家都基于同一份读错的原文”这种错。
关系
这是“垃圾进垃圾出”在知识摄入端的戒律;数据层的同类纪律(不能闭合绝不臆造)见 数据清洗与勾稽闭合校验。
站主管理
指令进入队列后由云端流水线(约每 4 小时)执行,非即时生效。