Google DeepMind 在 2026 年 9 月 30 日发布了 SynthID Bio,把水印技术第一次系统性地带进合成生物学:AI 设计的蛋白质序列和预测结构里会被嵌入不可见签名,而且这枚水印不只存在于数字模型里——在实验室真正合成出来的蛋白质上也能被验证,同时不损害蛋白质的生物功能。
水印打在哪:序列和结构两套手法
SynthID Bio 是一整套专为合成生物学设计的水印方法,根据数据类型用不同的手法:对蛋白质序列,在氨基酸选择上做细微引导;对预测的 3D 结构,微调原子坐标。两种调整都会产生稳定可检测的信号。
在蛋白折叠这边,DeepMind 微调了 AlphaFold 3 扩散网络的一小部分,把水印能力直接做进模型权重里。这样一来,不管谁运行这个模型,预测出的 3D 坐标天生就带可检测签名。官方称,这种做法在保持 AlphaFold 3 预测精度的同时,实现了近乎完美的可检测性,还能扛住数字噪声和轻微的坐标改动。
湿实验验证:三个靶点,性能没打折
水印最大的考验是:加了签名之后,蛋白质还能不能正常工作。DeepMind 用自家的蛋白 binder 设计方法 AlphaProteo,搭配支持 SynthID Bio 的 ProteinMPNN(常用的蛋白序列生成方法),在三个靶点上做了湿实验:VEGF-A、新冠病毒刺突蛋白 RBD、PD-L1。
结果是,加水印版本和未加水印版本在命中率、结合亲和力、天然序列多样性上基本相当。DeepMind 称,这是第一批“加了水印且生物功能完整”的蛋白 binder——水印没有以牺牲功能为代价。
解决什么问题:筛查与数据库
这项工作瞄准的是两个真实存在的缺口。第一,DNA 合成筛查:把数字蛋白设计变成实体分子,需要向 DNA 合成商下单,合成商会筛查订单是否涉及已知威胁。过去,一个陌生序列可以被合理假设为“尚未发现的天然生物”;但 AI 能设计出与已知危害毫无相似性的全新序列,这个假设不再成立,筛查方只能靠大量人工复核,拖慢正常研究。水印提供了一个自动化验证信号:证明这份订单来自带内置安全措施的可信模型。
第二,公共数据库的完整性:Protein Data Bank、UniProt、GenBank 等数据库大多开放投稿,错误标注的合成 3D 结构一旦混入,会误导下游研究。水印可以在投稿环节帮数据库正确标注合成条目,或者标记出来进一步审查。
生物安全政策专家 Sarah Carter 评价说,把设计与模型开发者关联起来,水印让开发者可以在安全上带头,也让合成商能更顺畅地筛查。Twist Bioscience 政策与生物安全副总裁 James Diggans 则认为,水印是生物安全工具箱里“有前景的新成员”,能让筛查把资源集中在真正需要细看的序列上。(此前 vLLM 也在文本生成侧上线过无失真水印,思路相通:vLLM 上线无失真文本水印。)
开源与下一步
DeepMind 这次选择了开放路线:发表 methods paper(Nature),开源代码、体外实验数据,并向研究社区发布模型权重。同时,他们正在和斯坦福 Hie 实验室、Arc Institute 合作,把 SynthID Bio 接入基因组模型 Evo 2,给噬菌体基因组打水印——细菌培养中的早期实验已确认,加水印的噬菌体依然有功能,技术手稿即将发布。
当然,DeepMind 也承认,没有任何单一生物安全措施是银弹。接下来的挑战包括让水印更抗故意篡改,以及和 C2PA 式的来源元数据、AI 生成生物数据的中央仓库等方案配合使用。水印只是“瑞士奶酪”防御模型中新的一层,但它是第一层真正嵌进生物设计本身的可验证层。