Biohub“虚拟生物学计划”启动,AI制药数据窗口期如何兑现?

非营利生物医学研究组织Biohub于2026年10月7日宣布,美国政府、谷歌母公司Alphabet(GOOG.O)和Meta Platforms(META.O)将共同加入其“虚拟生物学计划”,总计投入18亿美元构建用于训练AI模型的开放生物数据集。其中,Meta、Google DeepMind与药物发现公司Isomorphic Labs联合出资3亿美元,美国能源部将在五年内投入超5亿美元用于实验测量与计算建模,而美国国立卫生研究院(NIH)则协调此前已拨付的5亿多美元联邦资金所建立的数据资源,由Biohub统一标准化以适配AI训练。这一合作的核心目标,是在五年内压缩原本需数十年才能完成的细胞响应数据积累,并在约一年内发布首个数据集——但真正值得投资者关注的,不是资金规模本身,而是这种“先私有使用、后公共开放”的数据共享机制,如何在推动开放科学的同时,为参与企业创造实质性技术窗口期。
私有窗口期:开放科学下的商业激励
Biohub科学主管Alex Rives明确表示,商业出资方将享有“禁售期”(embargo period),即在数据公开前的一段时间内独家使用这些高维生物数据进行模型训练。这种设计巧妙地解决了开放科研项目长期面临的资金难题:既维持了最终成果的公共属性,又为科技巨头提供了短期排他性回报。对谷歌和Meta而言,这不仅是履行企业社会责任,更是抢占下一代AI模型训练数据的战略卡位。当前主流细胞数据集仅覆盖数亿细胞,而构建精准预测模型需要万亿级数据量——谁先获得高质量、高维度的细胞响应图谱,谁就可能在AI驱动的药物发现、基因编辑或个性化医疗赛道建立先发优势。
政企分工:两类资金,两种节奏
值得注意的是,此次合作中政府与企业的角色存在明显分工。能源部和NIH的资金主要用于基础测量、计算基础设施和已有数据整合,且其产出将无条件公开;而私营部门的3亿美元则聚焦于生成全新、高通量的实验数据,如空间转录组学(spatial transcriptomics)和环境扰动筛选。这意味着,未来两年内可能出现两条并行的数据流:一条是即时开放的政府支持数据,另一条是带有使用期限的商业资助数据。这种双轨制既加速了整体进展,也制造了阶段性信息不对称——药企和AI实验室若想获得完整数据优势,可能不得不跟进投资或寻求合作。
行业竞合:不只是Biohub的战场
Biohub并非孤例。路透社报道指出,Anthropic已设立湿实验室强化生物学能力,而OpenAI基金会也启动了超1.25亿美元的专项资助计划,专门支持生物与医学数据集建设。这说明,AI大模型公司正集体从纯算法竞争转向“数据+领域知识”的深水区。对谷歌和Meta来说,参与Biohub不仅是为了获取数据,更是为了在标准制定上占据话语权。一旦Biohub的数据格式、标注规范或接口协议成为行业默认选项,其生态影响力将远超项目本身。
数据语言成形之日,才是AI制药兑现之时
说到底,这项18亿美元的豪赌押注在一个前提上:细胞的行为可以被编码为一种“语言”,而AI能学会这门语言并做出可靠预测。Biohub的目标不是简单堆砌数据,而是构建可泛化的细胞响应模型,从而将动辄十年的药物开发周期大幅压缩。如果一年后发布的首个数据集验证了这一路径的可行性,市场对AI制药板块的估值逻辑将发生根本转变——从概念炒作转向交付验证。但若数据质量或模型泛化能力不及预期,即便投入再大,也可能陷入“更多数据、更少洞见”的陷阱。
接下来可重点观察两个信号:一是Biohub是否如期在2027年秋季发布首个数据集,并披露其覆盖的细胞类型、扰动条件和初步模型性能;二是参与企业是否基于该数据推出新的药物发现管线或开源工具,这将直接反映数据的实际价值。












