内容概览
Biohub的核心判断是:生物学的下一次跃迁,不只是需要更大的AI模型,而是需要AI与实验生物学共同创造此前不存在的数据。该机构从资助单细胞测序方法、人类细胞图谱和cellxgene工具起步,逐渐形成以开放科学为原则、以虚拟生物学为主线的长期计划。其技术路线按照蛋白质、细胞、多细胞系统和人体机制逐层构建世界模型,并用成像、细胞工程、传感器和结构生物学实验连接不同层级、验证模型预测。最新蛋白质语言模型已预测超过11亿种蛋白质结构,并展示出从通用理解自然涌现出蛋白质及单链抗体设计能力。受访者认为,未来模型不仅能发现结构和功能,还可能预测毒性、脱靶效应及个体对干预的反应。不过,基础研究的加速并不会自动转化为临床成果,临床研究、监管、递送和患者组织方式仍需同步改变。Biohub因此选择非营利、开放源码和十至十五年的投入周期,让学术界、生物技术产业与罕见病群体都能利用这些通用工具推进各自的问题。
更多内容
综合洞察
从访谈中的组织设计、技术路线与临床愿景推导出的关键含义。
- Biohub真正稀缺的资产不是单一模型,而是“发明测量方法—生成独有数据—训练模型—实验验证”的完整闭环;这使其竞争优势更接近科研操作系统,而非传统AI实验室。
- 开放源码在这里不仅是传播策略,也是研究组合策略:它把疾病和科学问题的选择权分散给大量研究者与患者群体,从而覆盖中心机构难以经济地优先处理的长尾问题。
- 如果虚拟生物模型显著降低分子设计成本,药物研发的主要稀缺资源可能从候选分子转向高质量临床数据、患者组织、监管路径与安全验证能力。
- Biohub从“懂技术的生物学机构”转向“具备深厚生物学能力的AI主导机构”,反映出其判断:未来的主要增量价值将来自可学习、可泛化和可设计的生物表征。
核心概念
访谈中反复使用或明确解释的关键术语。
- 虚拟生物学:利用数字模型表征蛋白质、细胞及更高层级生物系统,使研究者能够在计算环境中提出问题、模拟干预并形成可实验验证的预测。
- 生物世界模型:从大规模生物数据中学习底层规律的通用模型;它不仅执行特定预测任务,还可用于理解、搜索和设计新的生物结构或功能。
- 虚拟细胞:连接蛋白质组、遗传、转录组与表型等多个复杂性层级,并能对训练中未见过的干预情境给出可泛化预测的系统。
- 机制可解释性:分析模型内部表征与计算过程,以识别其预测所依据的结构、关系和潜在生物机制,而不只观察输入与输出。
- 可编程生物学:通过模型理解和设计分子、蛋白质或细胞干预,使生物系统逐渐具备可预测、可操作和可定制的工程属性。
技术与数据细节
访谈明确给出的模型、数据、实验验证和系统架构信息。
- 蛋白质语言模型以蛋白质序列中的符号预测任务训练,从数十亿条序列中自然学习蛋白质结构和功能表征。
- 团队称已使用新模型预测超过11亿种蛋白质的原子级结构,并通过机制可解释性识别它们之间的关联特征。
- 抗体设计流程可先在数字空间筛选数十万条轨迹,再合成约96个蛋白质并以96孔板规模测试;团队报告发现了纳摩尔级结合物。
- 实验验证结合了功能测试、生物物理表征和冷冻电镜,可在结合界面观察原子级结构,以检验模型设计的分子是否按预期工作。
- 跨尺度数据来源包括单细胞转录组、转录物的细胞内空间定位、透明斑马鱼发育观测、细胞间通信传感器、炎症测量设备和细胞工程实验。
- 目标虚拟细胞模型需连接蛋白质组、遗传、转录组和表型层,并对训练分布之外的新干预产生具有泛化能力的预测。
原话摘录
最能体现项目使命、技术判断和医疗愿景的访谈原话。
- We just want to give tools to the whole scientific community.
- What if we could actually understand how biology worked?
- If we could design a protein to actually change the physiology then we can actually cure someone.
- We didn't design a model for antibodies. We didn't design a model to, you know, to be able to bind one particular target.
- Our vision is not that there's going to be like some central super intelligence that solves all of science.