HKBEUPGENOME PRIVACY OBSERVATORY

基因组隐私

去掉姓名之后,基因组数据仍然可能指向谁

基因序列具有长期稳定性,也可能与公开族谱、表型和地理资料组合,因此去标识化不是终点。

姓名不是唯一的身份线索

基因序列具有稳定、可遗传和可关联的特征。即使姓名与证件号码已删除,罕见变异、亲缘关系、地区和表型组合仍可能缩小身份范围。传统去标识化只能处理显式标识符,无法消除所有链接风险。

风险评估应关注数据组合,而不是只看单个字段。一个看似普通的出生年份,在加入罕见疾病、家族结构与地理信息后,可能产生完全不同的识别能力。

查询结果也可能泄露信息

隐私问题不只发生在上传原始文件时。重复查询、过细的分组统计和高精度模型输出,都可能让外部人员逐步推断某个样本是否存在于数据集中。限制查询频率与输出粒度,和加密传输同样重要。

WIDGET一类隐私评估思路的价值,在于把风险变成可以比较的指标。但指标只描述特定攻击假设,不能被当作永久安全证明。

保存期限必须匹配研究目的

基因资料难以像密码一样更换,因此保留时间越长,未来可链接的数据来源越多。协议应说明为何保留、谁能访问、何时删除,以及衍生模型是否仍可能包含成员信息。

面向协作者的结果页应同时列出用途限制、样本范围与隐私假设。只有准确率而没有风险背景的报告,无法支持负责任的数据再利用。