内容概览
虚拟细胞真正困难的地方,不是复述细胞当前是什么样,而是预测改变一个基因、通路或药物后,整个细胞会发生什么。Xaira 因此把药物研发拆成三个相互连接的 AI 平台:蛋白设计、虚拟细胞和患者表征,希望贯通靶点发现、分子设计与患者选择。团队认为,公共单细胞数据主要是观察性数据,适合细胞表征和批次校正,却不足以识别因果关系;为此,他们利用 CRISPR、Perturb-seq 和单细胞 RNA 测序构建覆盖七次全基因组筛选、16 种生物情境和约 2500 万个高质量细胞的因果数据集。X-Cell 不再把基因表达强行处理成有序序列,而以扩散过程反复修正完整转录组预测,并引入文献、蛋白互作、基因必需性、形态及细胞类型等先验。受访者认为,当前性能贡献依次来自数据质量与规模、模型架构、生物先验。模型已在未见的活化 T 细胞、留出的细胞类型以及多名供体的原代 T 细胞上显示泛化潜力,但团队明确承认,走向类器官、动物和患者仍需大量实验验证。最终目标不是取代实验,而是把最昂贵、最难开展的实验留给经过模型筛选的高质量假设。
更多内容
综合洞察
由访谈中的数据策略、模型设计与验证逻辑综合得出的高层判断。
- Xaira 的实际护城河更接近“实验系统—因果数据—模型—验证”的闭环,而不是某个孤立模型架构。扩散模型可以被复现,但持续生成低批次效应、多情境、全基因组扰动数据的能力更难复制。
- 线性基线争议暴露出的核心问题不是模型复杂度,而是评估目标:若指标奖励接近平均值,模型学习到的情境依赖效应反而可能得不到认可。面向真实用途的基准应重点检验未见情境中的扰动变化。
- “在容易实验的系统中收集数据,在难以实验的系统中使用模型”构成虚拟细胞最清晰的经济逻辑。模型价值会随着目标系统的实验成本、伦理限制和不可穷举程度上升。
- 从静态转录组走向真正的虚拟细胞,主要瓶颈可能转向测量技术,而非纯算法:同一细胞的无损纵向测量和高通量蛋白状态读取,会改变模型能够学习的问题类别。
技术细节
X-Cell 的数据生成、模型架构、条件信息和验证设计。
- Perturb-seq 使用 CRISPR guide RNA 作为扰动地址和可读取条形码,在池化实验中让不同细胞分别接受基因抑制,再通过单细胞 RNA 测序读取每个细胞约 2 万个基因的表达响应。
- 公开的 Pisces 数据集包含七次全基因组扰动筛选、16 种细胞类型或生物情境,以及经过严格质量过滤的约 2500 万个细胞;原始实验处理的细胞数量达到数千万乃至数亿。
- X-Cell 采用 decoder-only 的生成式目标预测完整转录组,以双向扩散替代依赖基因顺序的自回归生成,通过多轮去噪或编辑逐步逼近扰动后的表达状态。
- 模型训练融合五类生物先验,包括文献生成的基因描述嵌入、蛋白质互作网络、DepMap 基因必需性信息、形态信息和细胞类型嵌入;访谈提到通过 cross-attention 注入这些条件。
- 泛化评估包含三类留出设计:从静息 T 细胞预测活化 T 细胞、留出一个 iPSC 分化细胞类型、从 T 细胞系迁移到多名供体的原代 T 细胞。比较对象包括线性叠加基线和领域内其他模型。
- 当前模型以单基因、功能缺失扰动和 RNA 表达输出为主要训练框架;后续数据平台计划扩展至多基因或通路扰动、多模态读出、原代细胞、类器官及体内扰动。
关键原话
最能体现受访者判断、边界与长期愿景的原始表述。
- If we cannot describe, let's learn it.
- What gets measured will get improved.
- It's about bits per dollar in information content.
- the holy grail of virtual cell is to have a model to generalize to on-scene context that is harder or even impossible to conduct biological experiments on
- You can't have the cake and eat it.