HKBEUPGENOME PRIVACY OBSERVATORY

模型评估

模型结果接近,不代表研究结论完全一致

参数差异很小只能说明特定计算步骤接近,不能替代样本代表性、偏差和临床适用范围的判断。

数值接近只回答了一个问题

两个模型参数接近,最多说明在当前输入与设定下计算结果相似。它不能证明样本具有相同代表性,也不能排除共同偏差。模型验证需要把计算一致性、预测表现和实际适用人群分开。

分布式环境还要考虑节点差异。整体指标可能掩盖某个地区表现明显下降,因此至少应查看节点级误差与样本构成。

边界来自数据生成过程

训练资料如何被收集、谁被排除、标签由谁判断,都会限制模型能回答的问题。若历史数据主要来自特定机构,模型在其他流程中表现下降并不意外。

评估报告应描述时间范围、缺失处理和外部验证,而不是只列一个准确率。没有背景的高分很难转化为可靠决策。

把不确定性留在页面上

置信区间、敏感性分析和失败案例不是附录装饰,而是帮助使用者决定何时停止依赖模型。结果页应明确哪些条件尚未验证,避免把研究发现包装成通用承诺。

模型更新后,应保留旧版本对应的结果与日期。只有这样才能判断变化来自新数据、算法调整,还是运行环境。