数值接近只回答了一个问题
两个模型参数接近,最多说明在当前输入与设定下计算结果相似。它不能证明样本具有相同代表性,也不能排除共同偏差。模型验证需要把计算一致性、预测表现和实际适用人群分开。
分布式环境还要考虑节点差异。整体指标可能掩盖某个地区表现明显下降,因此至少应查看节点级误差与样本构成。
边界来自数据生成过程
训练资料如何被收集、谁被排除、标签由谁判断,都会限制模型能回答的问题。若历史数据主要来自特定机构,模型在其他流程中表现下降并不意外。
评估报告应描述时间范围、缺失处理和外部验证,而不是只列一个准确率。没有背景的高分很难转化为可靠决策。
把不确定性留在页面上
置信区间、敏感性分析和失败案例不是附录装饰,而是帮助使用者决定何时停止依赖模型。结果页应明确哪些条件尚未验证,避免把研究发现包装成通用承诺。
模型更新后,应保留旧版本对应的结果与日期。只有这样才能判断变化来自新数据、算法调整,还是运行环境。