NVIDIA 在 9 月 24 日的官方博客宣布,与 Google DeepMind、欧洲分子生物学实验室下属欧洲生物信息研究所(EMBL-EBI)等全球研究机构合作,开放 2800 多种病毒的蛋白复合物预测 3D 结构,任何科学家都可以通过 AlphaFold Database 免费获取。其中约 30% 的蛋白相互作用形态,是科学界从未记录过的全新发现。
这批数据到底是什么
这次开放的不是单个蛋白,而是"蛋白复合物"——多个蛋白抱团协作的 3D 结构。疫苗和药物要打断病毒功能,瞄准的往往正是这些复合物。结构由 DeepMind 的 AlphaFold2 预测,经 NVIDIA BioNeMo 推理运行时优化,才得以批量处理数千种病毒的全部蛋白组。传统实验方法解析一个结构可能耗时数年、花费数千美元,AI 预测几分钟就能完成一批,再由实验去验证高置信度的结果。
怎么拿到,谁最受益
数据已进入 AlphaFold Database,该库目前持有超过 2.6 亿条蛋白与蛋白复合物预测,几乎覆盖科学界已知的所有蛋白。NVIDIA 同时开源了生成这批数据的 BioNeMo 结构预测流水线,研究者可以对自己的靶点从蛋白序列直接预测结构。EMBL-EBI 方面表示,数据集覆盖了不少研究较少的病毒,也降低了资源有限地区一线研究者的门槛。
为什么是现在
这次发布的时间点,正好赶上联合国大会期间在纽约举行的世界经济论坛大流行预防会议。全球发展中心的一项分析估计,到 2050 年,世界遭遇堪比新冠的大流行的概率约为 50%。新冠疫苗能快速问世,很大程度上得益于此前数十年对冠状病毒蛋白的积累;而下一次疫情的病原体可能完全陌生,这批数据就是提前"备课"。
对药物研发和公共卫生领域来说,新增的是可直接用于假设生成的靶点信息。接下来值得关注的是,会有多少预测结构被实验验证,并转化为真实的诊断与治疗进展。