细胞生物学中生成式AI的15个挑战:Cell论文的解读

Avatar
Lisa Ernst · 21.08.2026 · 人工智能 · 13分钟

2026年8月17日,Cell发表了题为“生成式AI在细胞生物学中应用的十五个挑战”的观点文章。作者团队没有宣布另一个特别大的模型取得了突破,而是提出了一个更基本的问题:在能够进行可靠预测和有针对性地控制细胞之前,生成式AI实际上需要解决哪些任务?

答案是15个挑战,涵盖了从分子相互作用、细胞状态、作用机制到生物标志物、有机体反应和临床试验。因此,该论文与其说是当前模型的排名,不如说是一个关于更好科学目标的建议:成功应以模型在未知生物环境中能否提供有用的、可实验验证的预测来衡量。

简而言之

Cell论文的真正目的

Léo Dupire及其他14位作者(包括Theofanis Karaletsos、Shana O. Kelley、Emma Lundberg、Jian Ma、Stephen R. Quake和Andrea Califano)的工作是一篇观点文章,即科学的指导和讨论性贡献。它不呈现一个具有新最高性能的单一细胞模型。相反,它试图将该领域引导至那些解决它们具有生物学意义的任务。

这一点很重要,因为计算生物学中的“良好性能”在很大程度上取决于具体测量的是什么。一个模型可以很好地对已知的细胞类型进行分类,或合理地补充缺失的值,但仍然无法预测对新基因扰动、未知组织或新活性药物的反应。对于真正的预测性细胞生物学,这种泛化能力至关重要。

研究人员正在用光学显微镜检查样品

来源: pexels.com

生物学上有用的AI的标准不仅仅是好的基准测试值。关键在于预测是否能在新条件下的实验中站得住脚,并帮助研究人员做出下一个决定。

因此,作者沿着日益增长的生物学尺度构建了15个任务。下方是挑战标题的英文原文。中文解释是对每种预测或设计任务应该检验内容的编辑性归纳;它们并非论文全文的直译。

15个挑战概览

第一层:分子相互作用

第一层涉及构成细胞行为的基本关系。模型不仅要识别哪些分子一起存在,还要能够可靠地处理调控背景、染色质状态以及细胞之间的通信。

编号 原始标题 实际内容
1 Regulatory and signaling interactions 预测调控和信号关系,从而推断出对干预或刺激的可理解的反应。
2 Epigenetic interactions 解释染色质和其他表观遗传状态如何根据上下文改变基因活性和细胞反应。
3 Cell-cell interactions 预测不同细胞之间的通信和相互影响,而不是单独对每个细胞进行建模。
HeLa细胞的多光子荧光图像,显示了染色的肌动蛋白、微管和细胞核

来源: commons.wikimedia.org / National Institutes of Health

细胞行为源于多个层面的结构和相互作用。NIH的图像显示了肌动蛋白呈红色、微管呈青色、细胞核呈蓝色的HeLa细胞——这是分子和细胞组织同时存在的生动例子。

第二层:分子功能

第二层将问题从观察到的关系转移到功能。在这里,有趣的是,AI是否能从序列和分子组件推断出生物学效应,甚至设计出新的功能机制。

编号 原始标题 实际内容
4 Synthetic mechanisms 设计具有期望行为的新型、构建的分子机制,并可靠地预测其功能。
5 Genome to biochemical function 从基因组信息推导出具体的生化能力和过程——而不仅仅是统计学上的序列相似性。
6 Drug mechanism of action 预测药物通过哪些靶结构、信号通路和背景条件发挥作用。

第三层:细胞和系统功能

在此层级,分子预测转化为系统任务。细胞有许多可能的状态,对环境做出反应,并通过干预进行重新编程。正是在这里,我们可以看到为什么“基因语言模型”不一定是一个完整的虚拟细胞。

编号 原始标题 实际内容
7 Genome to phenotype 从基因组可靠地推断出表型特征和行为,即使组合的变异或条件是新的。
8 Cell state reprogramming 找到能够将细胞从起始状态有针对性地引导到期望目标状态的干预措施。
9 Synthetic circuit design 设计能够根据要求在真实细胞中运行的稳健的人工基因回路。
10 Systems-level mechanisms 解释系统层面的机制,其中细胞状态、环境和多个耦合过程共同决定观察到的功能。
带有细胞培养的培养皿在实验室显微镜下

来源: pexels.com

许多建议的任务需要一个封闭的模型和实验循环:提出预测,在受控细胞培养中进行测试,测量偏差,并从中推导出下一代模型。

第四层:转化

第四层是最终的现实检验。现在,分子和细胞预测需要转化为对药物开发和医学相关的问题。这不仅增加了生物学复杂性,也增加了数据质量、患者异质性和前瞻性验证的重要性。

编号 原始标题 实际内容
11 Complex biomarker identification 找到多维生物标志物,这些标志物能可靠地指示临床相关的状态或反应,并在发现数据集之外得到验证。
12 Drug toxicity 在相关的生物学背景下,尽可能早地预测药物的毒性效应。
13 Drug efficacy 预测疗效,不仅是平均疗效,还包括不同生物状态和潜在不同患者群体的疗效。
14 Organismal responses 将从单个细胞和组织推广到整个有机体的反应,其中免疫、代谢和器官系统是耦合的。
15 Clinical trial outcomes 预测临床试验在实际条件下的结果——这是一项远超重构现有组学数据的任务。
佩戴护目镜的科学家在实验室的显微镜前工作

来源: pexels.com

最后的挑战延伸到转化。预测越接近药物安全性、疗效或临床试验,对独立数据、可重复性和前瞻性确认的要求就越高。

为什么当前“虚拟细胞”的基准测试不够

这15个挑战触及了当前AI生物学的一个痛点:基准测试在技术上可能是严谨的,但仍然可能产生对进展的错误认识。如果训练数据和测试数据非常相似,模型就可以内插模式,而没有充分理解潜在的机制。因此,对于真正的预测能力,需要测试案例,这些案例故意偏离已知分布——例如,新的扰动、不同的细胞类型、不同的组织或模型在训练中未见过的组合。

2025年《Nature Methods》上的一篇开放获取论文展示了这一论点的相关性。Constantin Ahlmann-Eltze、Wolfgang Huber和Simon Anders在预测基因扰动后的转录组变化时,比较了五个单细胞基础模型和另外两个深度学习方法与故意设计的简单基线。在研究的任务中,没有一个复杂模型能够持续超越简单的基线。作者们自己强调,这并不意味着深度学习根本不适用于单细胞生物学。这一发现更说明了强大的基线和具有挑战性的测试对于关于泛化的论断的重要性。

Cell论文正是从这一点出发:未来的模型不应通过特别真实地重构已知数据来取胜,而应通过其预测能够改进下一次实验决策来取胜。因此,核心问题从“输出有多相似?”转变为“我们能够以可接受的错误率测试哪些新的生物学见解?”

15个挑战背后的三个结构性问题

1. 生物数据丰富,但并非自动就是合适的训练数据

单细胞图谱如今包含大量的测量值。然而,对于许多预测任务,恰恰是那些允许因果推断的数据却缺失了:受控的干预、时间序列、剂量-效应关系、空间背景、多组学测量以及足够多的独立生物系统。对于某些问题来说,观察到的十亿个细胞的信息量不如一个规模较小、精心设计的、包含有针对性干预措施的数据集。

Chan Zuckerberg Initiative(CZI)或Biohub,在构建大型细胞数据集的同时,明确追求基于人工智能(AI)的虚拟细胞目标,旨在预测和解释细胞行为。2024年发表在《Cell》杂志上的“如何用人工智能构建虚拟细胞”的观点文章,也将虚拟细胞描述为多尺度、多模态的分子、细胞和组织模型。2026年的15项挑战可以被视为更具体的检验标准,用以衡量这一宏伟目标。

2. 细胞生物学是组合性的和情境依赖的

语言有规则和重复模式;细胞也是如此——但其状态空间同时受到基因调控、蛋白质相互作用、代谢、表观遗传学、空间邻近性、发育史和环境的影响。即使是微小的变化,其效果也可能因细胞类型或情境的不同而改变。因此,一个能正确了解单个成分的模型,并不意味着它就能正确预测多种干预措施组合后的结果。

这支持了那些不将生物学先验知识作为事后解释,而是将其纳入模型架构、训练和评估的模型:例如已知的相互作用网络、物理约束、反应途径或明确的扰动数据。更大的参数数量可能有所帮助,但不能自动取代这种结构。

3. 对于许多挑战,相关性是不足够的

细胞状态重编程、作用机制或药物疗效涉及干预:如果我们改变X,会发生什么?正是这个问题区分了相关性和因果性。一个模型可以完美地将一个标记与疾病状态联系起来,却不知道该标记是原因、结果还是仅仅是伴随现象。对于挑战8、11、12和13,这种区分是直接相关的。

一个直观的例子,说明了所需的验证周期,是Zerlo报告关于实验室验证的DeepMind/Yale癌症假说:在那里,一个模型得出了一个具体、情境相关的假说,随后在人体细胞模型中进行了测试。这样的命中并不能证明存在一个普遍的“虚拟细胞”,但它说明了为什么前瞻性实验比纯粹的回顾性基准测试更有说服力。

一个真正有用的“AI虚拟细胞”应该具备什么能力

AI虚拟细胞”这个术语经常用于从大型单细胞数据集中学习表示的基础模型。这是一个重要的组成部分,但15项挑战表明了更高的标准。一个有用的虚拟细胞不仅需要编码当前状态,还需要能够模拟干预和后果。

这样一来,就清楚了为什么挑战15——临床试验结果——位于列表的最后。从基因表达谱到研究结果之间有许多层面:剂量、药代动力学、免疫反应、合并症、患者选择、研究方案和统计终点。一个能够可靠地将所有这些因素联系起来的模型,在质量上将不同于细胞类型分类系统。

AI和生物学团队可以从该论文中得出什么

从15项挑战中可以推导出一种实际的开发策略。以下是对该论文和当前基准测试辩论的编辑性综合,而非作者的额外列表:

  1. 首先定义生物学决策。 在选择模型指标之前,应明确预测旨在改进哪项实验或转化决策。
  2. 认真对待简单的基线。 复杂的基金模型应与朴素的、线性的和领域特定的基线进行比较。否则,将无法清楚额外复杂性是否带来了真正的知识增益。
  3. 根据泛化能力规划测试数据。 合理的划分应保留稍后要预测的情况:新的扰动、新的细胞情境或整个独立的数据集。
  4. 区分回顾性和前瞻性评估。 回顾性基准测试有助于方法比较。而前瞻性实验则测试模型是否能真正预测新的、未知生物学。
  5. 整合生物学先验知识和不确定性。 网络、机制和物理约束可以构建搜索空间;不确定性估计有助于避免有风险的过度解读。
  6. 发表阴性结果。 如果一个大型模型未能击败简单的基线,这也是有科学价值的。这类结果可以防止该领域将计算能力与生物学进展混淆。

为什么这篇关于细胞生物学的论文具有相关性

该观点文章是生成式AI普遍存在的一个问题的例子:模型生成输出的能力越令人印象深刻,就越容易将似是而非与正确混淆。在细胞生物学中,这种差异尤为明显,因为看似合理的预测可能会在实验中失败——而且因为错误的假设会浪费时间、动物、样本或临床资源。

因此,15项挑战与纯粹的扩展思维形成了一个有益的对比。它们要求解决的任务,随着远离分子重构,朝着因果细胞控制和临床转化方向发展,其解决难度和科学价值也随之提高。该论文故意不明确说明是当前的Transformer、图基模型、混合机械系统还是新的架构将最好地解决这些任务。

常见问题解答

“生成式AI在细胞生物学应用中的十五项挑战”是什么意思?

这是2026年发表在《Cell》杂志上的一篇观点文章的标题。作者团队提出了15个科学挑战,通过这些挑战,可以有意义地评估用于细胞生物学的生成式AI——从调控相互作用到预测临床试验结果。

15项挑战涵盖了哪四个层面?

这些挑战涵盖了从分子相互作用、分子功能、细胞/系统功能到转化的各个方面。这使得衡量标准逐步从局部生物学关系提升到药物、有机体和临床试验的预测。

《Cell》论文是否说虚拟细胞已经存在?

不。这篇论文并不是关于一个已解决的虚拟细胞的成功报告。它描述了未来的生成模型必须解决的任务,才能使其预测在生物学和转化方面更具说服力。

为什么在现有的单细胞基准测试中取得好分数是不够的?

高分数可能来自与训练非常相似的任务,或者可以通过简单的模式解决。对于预测性生物学,关键在于模型能否泛化到新的扰动、细胞类型、组织或其他以前未见过的条件,并在那里提供优于强大的简单基线的预测。

更大的基础模型能否通过简单扩展来解决这15个问题?

这一点尚未得到证实。更大的模型可以容纳更多数据和更复杂的表示,但这些挑战还涉及数据质量、因果关系、生物学约束、泛化能力和实验验证。2025年Nature Methods的基准测试也表明,模型复杂性本身并不能保证在扰动预测方面具有可靠的优势。

哪个挑战对医学最具深远意义?

挑战15“临床试验结果”,位于转化层面的末端。它要求模型能够充分整合许多前置层面:分子机制、细胞状态、疗效、毒性、有机体反应和临床异质性。

结论

“生成式AI在细胞生物学应用中的十五项挑战”主要是对更高级别进展定义的倡导。这15个任务将焦点从令人印象深刻的数据重构转移到泛化、机制、干预和前瞻性验证。列表越是朝着转化方向发展,一个仅仅能合理重现生物学模式的模型就越不够用。

这为AI虚拟细胞的争论提供了一个有用的衡量标准:一个真正的虚拟细胞不仅仅是一个非常大的基因表达模型,而是一个能够预测新的生物学情境、能够表明其不确定性并在实际实验中反复提供有用命中结果的系统。在那之前,这15项挑战与其说是对已取得成就的证明,不如说是对仍需弥补之处的具体研究议程。

分享我们的文章!
参考文献