验证集准确率很高,上线后预测像瞎猜。特征泄露:训练时用了当时还不知道的信息——事后质检结果、当月末库存、用未来标签算的统计量。泄露让模型在回测里作弊,生产里没有作弊卷,效果断崖。项目要把时间切分和特征审查写成关卡,过不了关不准上线。
好看的回测如果不能用当时可获得的数据复现,就还不能进生产。
只准用当时能看见的
按业务时间切分训练/验证,禁止随机打散有时序的样本。特征字典注明可获得时点。衍生统计只用过去窗口。标签与特征由不同管道生成,避免同一张宽表偷偷带入未来。
- 上线前用\"当时快照\"重放,效果掉出阈值即判泄露。
- 业务专家审查特征是否像事后诸葛。
- 监控生产效果,断崖先查泄露再调模型。

审查比刷分重要
XYN 数智化系统把预测当建议,仍要求特征可解释时点。泄露过关的模型才配进流程;刷分过关的,会在第一周输掉信任。信任输掉后,再诚实的模型也没人开。
列出每条特征的可获得时点。写不出时点的,先删掉再训练。
