15 défis pour l'IA générative en biologie cellulaire : ce que dit l'article de Cell
Le 17 août 2026, Cell a publié la perspective « Fifteen challenges for generative AI applications to cell biology ». Au lieu de déclarer un autre grand modèle comme une percée, l'équipe d'auteurs pose une question plus fondamentale : Quelles tâches l'IA générative devrait-elle réellement résoudre avant que l'on puisse parler de prédictions fiables et de contrôle ciblé des cellules ?
La réponse est 15 défis, allant des interactions moléculaires aux états cellulaires et aux mécanismes d'action, en passant par les biomarqueurs, les réponses de l'organisme et les essais cliniques. L'article est donc moins un classement des modèles actuels qu'une proposition d'objectifs scientifiques meilleurs : le succès devrait être mesuré à l'aune de la capacité d'un modèle à fournir des prédictions utiles et expérimentalement vérifiables dans des situations biologiques inconnues.
En bref
- L'article formule 15 défis concrets pour l'IA générative en biologie cellulaire et les classe en quatre niveaux : interactions moléculaires, fonction moléculaire, fonction cellulaire/systémique et traduction.
- Le point essentiel n'est pas de savoir si un modèle reconstruit des données biologiques de manière convaincante, mais s'il fait des prédictions correctes et pratiquement pertinentes en dehors des situations d'entraînement connues.
- Les tâches impliquant la causalité sont particulièrement exigeantes : quelle intervention modifie un état cellulaire, pourquoi un médicament est-il efficace, comment les cellules communiquent-elles entre elles, ou quel serait le résultat d'une étude non encore réalisée ?
- Les modèles fondamentaux actuels ne sont donc pas automatiquement des « cellules virtuelles ». Une évaluation publiée en 2025 a montré, par exemple, que plusieurs modèles d'apprentissage profond n'ont pas réussi à battre de manière constante des baselines simples dans la prédiction de perturbations génétiques.
- Les 15 défis relient le développement de l'IA à la biologie expérimentale : les bonnes évaluations devraient être conçues de manière à ce que les progrès puissent être traduits en gains de connaissances biologiques mesurables.
Ce que l'article de Cell veut réellement accomplir
Le travail de Léo Dupire et de 14 autres auteurs – dont Theofanis Karaletsos, Shana O. Kelley, Emma Lundberg, Jian Ma, Stephen R. Quake et Andrea Califano – est une perspective, c'est-à-dire une contribution scientifique d'orientation et de discussion. Il ne présente pas un seul nouveau modèle cellulaire avec une nouvelle meilleure performance. Il tente plutôt d'orienter le domaine vers des tâches dont la résolution a une signification biologique.
C'est important car la « bonne performance » en biologie computationnelle dépend fortement de ce qui est exactement mesuré. Un modèle peut classifier très bien les types de cellules connus ou compléter de manière plausible les valeurs manquantes et échouer néanmoins à prédire la réponse à une nouvelle perturbation génétique, un tissu inconnu ou un nouvel agent thérapeutique. Pour une biologie cellulaire réellement prédictive, cette généralisation est cruciale.

Source: pexels.com
L'étalon-mesure de l'IA biologiquement utile n'est pas seulement une bonne valeur d'évaluation. L'essentiel est de savoir si les prédictions tiennent dans des expériences avec de nouvelles conditions et aident les chercheurs dans leur prochaine décision.
Les auteurs structurent donc les 15 tâches le long d'une échelle biologique croissante. En bas sont reproduits les titres originaux anglais des défis. Les explications allemandes sont une contextualisation éditoriale du type de prédiction ou de tâche de conception à tester ; elles ne sont pas une traduction littérale du texte complet de l'article.
Les 15 défis en un coup d'œil
Niveau 1 : Interactions moléculaires
Au premier niveau, il s'agit des relations élémentaires à partir desquelles le comportement cellulaire émerge. Un modèle doit non seulement reconnaître quelles molécules coexistent, mais aussi gérer de manière fiable le contexte réglementaire, l'état de la chromatine et la communication entre les cellules.
| N° | Titre original | Ce qu'il s'agit pratiquement |
|---|---|---|
| 1 | Regulatory and signaling interactions | Prédire les relations réglementaires et de signalisation de manière à en déduire des réponses compréhensibles à une intervention ou un stimulus. |
| 2 | Epigenetic interactions | Saisir comment les états chromatiniens et autres états épigénétiques modifient l'activité des gènes et la réponse d'une cellule de manière contextuelle. |
| 3 | Cell-cell interactions | Prédire la communication et l'influence mutuelle de différentes cellules, au lieu de modéliser chaque cellule isolément. |

Source: commons.wikimedia.org / National Institutes of Health
Le comportement cellulaire émerge de structures et d'interactions à plusieurs niveaux. L'image du NIH montre des cellules HeLa avec de l'actine en rouge, des microtubules en cyan et des noyaux en bleu – un exemple frappant de l'organisation moléculaire et cellulaire simultanément présente.
Niveau 2 : Fonction moléculaire
Le deuxième niveau déplace la question des relations observées vers la fonction. Il devient intéressant de savoir si l'IA peut déduire l'action biologique à partir de séquences et de composants moléculaires, ou même concevoir de nouveaux mécanismes fonctionnels.
| N° | Titre original | Ce qu'il s'agit pratiquement |
|---|---|---|
| 4 | Synthetic mechanisms | Concevoir de nouveaux mécanismes moléculaires construits avec un comportement souhaité et prédire leur fonction de manière fiable. |
| 5 | Genome to biochemical function | Passer de l'information génomique à des capacités et processus biochimiques concrets – pas seulement à des similitudes séquentielles statistiques. |
| 6 | Drug mechanism of action | Prédire à travers quelles structures cibles, voies de signalisation et conditions contextuelles un médicament agit réellement. |
Niveau 3 : Fonction cellulaire et systémique
À ce niveau, la prédiction moléculaire devient une tâche systémique. Une cellule possède de nombreux états possibles, réagit à son environnement et peut être reprogrammée par des interventions. C'est précisément ici que l'on voit pourquoi un « modèle linguistique pour les gènes » n'est pas automatiquement une cellule virtuelle complète.
| N° | Titre original | Ce qu'il s'agit pratiquement |
|---|---|---|
| 7 | Genome to phenotype | Déduire de manière fiable les propriétés phénotypiques et le comportement à partir d'un génome, même si les combinaisons de variantes ou les conditions sont nouvelles. |
| 8 | Cell state reprogramming | Trouver des interventions qui déplacent une cellule de manière ciblée d'un état de départ vers un état cible souhaité. |
| 9 | Synthetic circuit design | Concevoir des circuits génétiques artificiels robustes dont le comportement dans des cellules réelles correspond aux spécifications. |
| 10 | Systems-level mechanisms | Saisir les mécanismes au niveau du système, où l'état cellulaire, l'environnement et plusieurs processus couplés déterminent conjointement la fonction observée. |

Source: pexels.com
Beaucoup des tâches proposées exigent une boucle fermée entre modèle et expérimentation : formuler une prédiction, tester dans une culture cellulaire contrôlée, mesurer les écarts et en déduire la prochaine génération du modèle.
Niveau 4 : Traduction
Le quatrième niveau est le test de réalité le plus difficile. Maintenant, les prédictions moléculaires et cellulaires doivent aboutir à des questions pertinentes pour le développement de médicaments et la médecine. La complexité biologique augmente alors, mais aussi l'importance de la qualité des données, de l'hétérogénéité des patients et de la validation prospective.
| N° | Titre original | Ce qu'il s'agit pratiquement |
|---|---|---|
| 11 | Complex biomarker identification | Trouver des biomarqueurs multidimensionnels qui indiquent de manière robuste un état cliniquement pertinent ou une réponse et qui font leurs preuves en dehors de l'ensemble de données de découverte. |
| 12 | Drug toxicity | Prédire les effets toxiques d'un médicament le plus tôt possible et dans des contextes biologiques pertinents. |
| 13 | Drug efficacy | Prédire l'efficacité non seulement en moyenne, mais pour différents états biologiques et potentiellement différents groupes de patients. |
| 14 | Organismal responses | Généraliser à partir de cellules et de tissus individuels vers les réactions d'un organisme entier, où les systèmes immunitaires, métaboliques et organiques sont couplés. |
| 15 | Clinical trial outcomes | Prédire comment une étude clinique se déroulera dans des conditions réelles – une tâche qui va bien au-delà de la reconstruction des données omiques existantes. |

Source: pexels.com
Les derniers défis vont jusqu'à la traduction. Plus une prédiction se rapproche de la sécurité des médicaments, de l'efficacité ou des études cliniques, plus les exigences en matière de données indépendantes, de reproductibilité et de confirmation prospective augmentent.
Pourquoi les évaluations actuelles pour les « cellules virtuelles » ne suffisent pas
Les 15 défis touchent un point sensible de la biologie IA actuelle : une évaluation peut être techniquement propre et néanmoins créer une fausse idée de progrès. Si les données d'entraînement et de test sont très similaires, un modèle peut interpoler des motifs sans saisir suffisamment le mécanisme sous-jacent. Pour une véritable capacité de prédiction, les cas de test qui s'écartent délibérément de la distribution connue sont donc importants – par exemple, de nouvelles perturbations, d'autres types de cellules, d'autres tissus ou des combinaisons que le modèle n'a pas vues lors de l'entraînement.
La pertinence de cette objection a été démontrée en 2025 par un article en libre accès dans Nature Methods. Constantin Ahlmann-Eltze, Wolfgang Huber et Simon Anders ont comparé cinq modèles fondamentaux monocellulaires et deux autres approches d'apprentissage profond avec des baselines délibérément simples pour prédire les changements transcriptomiques après des perturbations génétiques. Dans les tâches étudiées, aucun des modèles complexes n'a pu systématiquement surpasser les baselines simples. Les auteurs eux-mêmes soulignent que cela ne signifie pas que l'apprentissage profond est fondamentalement inadapté à la biologie monocellulaire. Le résultat montre plutôt l'importance de baselines solides et de tests exigeants pour les affirmations concernant la généralisation.
L'article de Cell aborde précisément ce point : un modèle futur ne devrait pas convaincre en reproduisant les données connues de manière particulièrement réaliste, mais en ce que ses prédictions améliorent la prochaine décision expérimentale. La question directrice se déplace ainsi de « À quel point la sortie ressemble-t-elle ? » à « Quelle nouvelle affirmation biologique pouvons-nous tester avec un taux d'erreur acceptable ? »
Trois problèmes structurels derrière les 15 défis
1. Les données biologiques sont riches, mais pas automatiquement les bonnes données d'entraînement
Les atlas monocellulaires contiennent aujourd'hui d'énormes quantités de valeurs mesurées. Néanmoins, pour de nombreuses tâches prédictives, précisément les données qui permettent des affirmations causales font défaut : perturbations contrôlées, séries temporelles, relations dose-réponse, contexte spatial, mesures multi-omiques et un nombre suffisant de systèmes biologiques indépendants. Un milliard de cellules observées est moins informatif pour certaines questions qu'un ensemble de données plus petit, planifié proprement, avec des interventions ciblées.
L'initiative Chan Zuckerberg, ou Biohub, poursuit donc, en parallèle de la constitution de vastes ensembles de données cellulaires, l'objectif explicite d'une cellule virtuelle basée sur l'IA, destinée à prédire et à rendre compréhensible le comportement cellulaire. La perspective « How to build the virtual cell with artificial intelligence » publiée en 2024 dans Cell décrit également la cellule virtuelle comme un modèle multi-échelle et multimodal pour les molécules, les cellules et les tissus. Les 15 challenges de 2026 peuvent être considérés comme des bancs d'essai plus concrets sur lesquels cet objectif ambitieux peut être mesuré.
2. La biologie cellulaire est combinatoire et dépendante du contexte
Le langage a des règles et des motifs récurrents ; les cellules aussi – mais leur espace d'états est simultanément façonné par la régulation génique, les interactions protéiques, le métabolisme, l'épigénétique, le voisinage spatial, l'histoire du développement et l'environnement. Même de petites modifications peuvent changer leur effet en fonction du type de cellule ou du contexte. Un modèle qui connaît correctement un seul composant ne doit donc pas nécessairement prédire correctement la conséquence d'une combinaison de plusieurs interventions.
Cela plaide en faveur de modèles qui ne traitent pas les connaissances biologiques préalables comme une explication a posteriori, mais qui en tiennent compte dans l'architecture, l'entraînement et l'évaluation : par exemple, les réseaux d'interactions connus, les contraintes physiques, les voies de réaction ou les données de perturbation explicites. Des nombres de paramètres plus importants peuvent être utiles, mais ne remplacent pas automatiquement cette structure.
3. La corrélation ne suffit pas pour de nombreux défis
La reprogrammation de l'état cellulaire, les mécanismes d'action ou l'efficacité des médicaments impliquent des interventions : que se passe-t-il si nous modifions X ? C'est précisément cette question qui sépare la corrélation de la causalité. Un modèle peut parfaitement associer un marqueur à un état pathologique sans savoir si le marqueur est la cause, la conséquence ou simplement un phénomène concomitant. Cette distinction est directement pertinente pour les challenges 8, 11, 12 et 13.
Un exemple frappant du cycle de validation souhaité est le rapport Zerlo sur l'hypothèse du cancer DeepMind/Yale confirmée en laboratoire: là, un modèle a conduit à une hypothèse concrète et dépendante du contexte, qui a ensuite été testée dans des modèles cellulaires humains. Un tel succès ne prouve pas une « cellule virtuelle » générale, mais montre pourquoi les expériences prospectives sont nettement plus significatives que les benchmarks purement rétrospectifs.
Ce que devrait être capable de faire une « AI Virtual Cell » vraiment utile
Le terme AI Virtual Cell est souvent utilisé pour les modèles fondamentaux qui apprennent des représentations à partir de grands ensembles de données single-cell. C'est un élément constitutif important, mais les 15 challenges suggèrent une barre plus haute. Une cellule virtuelle utile devrait non seulement coder l'état actuel, mais aussi être capable de simuler des interventions et leurs conséquences.
- Généraliser : Les prédictions doivent rester fiables même pour des types de cellules, des perturbations ou des environnements non observés.
- Connecter plusieurs échelles : Les interactions moléculaires doivent être liées à l'état cellulaire, aux tissus et, finalement, aux réponses de l'organisme.
- Indiquer l'incertitude : Un modèle doit permettre de savoir quand les données manquent pour une prédiction fiable, au lieu de faire paraître chaque sortie comme également certaine.
- Être expérimentalement falsifiable : Les prédictions doivent être suffisamment concrètes pour pouvoir être réfutées ou confirmées en laboratoire.
- Être mécanistiquement utile : Pour la recherche et le développement de médicaments, ce n'est pas seulement que l'on prédit un effet qui compte, mais, dans la mesure du possible, aussi les mécanismes par lesquels il se produit et dans quelles conditions.
Cela montre aussi pourquoi le Challenge 15 – résultats d'essais cliniques – se situe en fin de parcours. Entre un profil d'expression génique et l'issue d'une étude, il y a de nombreux niveaux : posologie, pharmacocinétique, réactions immunitaires, comorbidités, sélection des patients, protocole d'étude et points d'extrémité statistiques. Un modèle qui relie de manière fiable tous ces facteurs serait qualitativement différent d'un système de classification de types cellulaires.
Ce que les équipes d'IA et de biologie peuvent déduire du papier
Les 15 challenges permettent de dériver une stratégie de développement pratique. Ce qui suit est une synthèse éditoriale du papier et du débat actuel sur les benchmarks, et non une liste supplémentaire des auteurs :
- Définir d'abord la décision biologique. Avant de choisir une métrique de modèle, il doit être clair quelle décision expérimentale ou translationnelle doit être améliorée par la prédiction.
- Prendre au sérieux les bases simples. Un modèle fondamental complexe devrait être comparé à des bases naïves, linéaires et spécifiques au domaine. Sinon, on ne sait pas si la complexité supplémentaire apporte un véritable gain d'information.
- Planifier les données de test pour la généralisation. Des divisions judicieuses gardent précisément les situations qui doivent être prédites ultérieurement : nouvelles perturbations, nouveaux contextes cellulaires ou ensembles de données indépendants entiers.
- Séparer l'évaluation rétrospective et prospective. Les benchmarks rétrospectifs aident à comparer les méthodes. Les expériences prospectives, en revanche, testent si le modèle peut réellement prédire une biologie nouvelle et inconnue.
- Intégrer les connaissances biologiques préalables et l'incertitude. Les réseaux, les mécanismes et les contraintes physiques peuvent structurer l'espace de recherche ; les estimations d'incertitude aident à éviter les surinterprétations risquées.
- Publier les résultats négatifs. Si un grand modèle ne bat pas les bases simples, c'est scientifiquement précieux. De tels résultats empêchent le domaine de confondre les efforts de calcul avec les progrès biologiques.
Pourquoi le papier est pertinent au-delà de la biologie cellulaire
La perspective est un exemple d'un problème général en IA générative : plus un modèle peut produire de résultats impressionnants, plus il est facile de confondre plausibilité et correction. En biologie cellulaire, cette différence est particulièrement frappante car une prédiction plausible peut échouer en expérience – et parce que des hypothèses erronées peuvent coûter du temps, des animaux, des échantillons ou des ressources cliniques plus tard.
Les 15 challenges constituent donc un contrepoint utile à la simple pensée de mise à l'échelle. Ils exigent des tâches dont la solution devient mesurablement plus difficile et scientifiquement plus précieuse à mesure que l'on s'éloigne de la reconstruction moléculaire pour aller vers le contrôle cellulaire causal et la translation clinique. Le papier laisse délibérément ouverte la question de savoir si les transformeurs actuels, les modèles basés sur des graphes, les systèmes mécanistiques hybrides ou de nouvelles architectures résoudront le mieux ces tâches.
FAQ
Que signifie « Fifteen challenges for generative AI applications to cell biology » ?
C'est le titre d'une perspective publiée en 2026 dans Cell. L'équipe d'auteurs formule 15 défis scientifiques à l'aide desquels l'IA générative peut être judicieusement testée pour la biologie cellulaire – des interactions régulatrices à la prédiction des résultats d'essais cliniques.
Quels sont les quatre niveaux couverts par les 15 challenges ?
Les défis vont des interactions moléculaires à la fonction moléculaire, en passant par la fonction cellulaire/systémique, jusqu'à la translation. La barre est ainsi progressivement relevée, des relations biologiques locales aux prédictions sur les médicaments, les organismes et les essais cliniques.
Le papier Cell affirme-t-il qu'une cellule virtuelle existe déjà ?
Non. Le papier n'est précisément pas un compte rendu de succès sur une cellule virtuelle entièrement résolue. Il décrit des tâches que les futurs modèles génératifs devraient être capables de réaliser pour que leurs prédictions soient plus convaincantes biologiquement et translationnellement.
Pourquoi de bons scores sur les benchmarks single-cell existants ne suffisent-ils pas ?
Un bon score peut provenir de tâches très similaires à l'entraînement ou qui peuvent être résolues par des motifs simples. Pour la biologie prédictive, il est crucial de savoir si un modèle généralise à de nouvelles perturbations, de nouveaux types de cellules, de nouveaux tissus ou d'autres conditions jamais vues auparavant, et y fait de meilleures prédictions que des bases simples solides.
Les grands modèles fondamentaux peuvent-ils simplement résoudre les 15 problèmes par mise à l'échelle ?
Ce n'est pas prouvé. Les modèles plus grands peuvent absorber plus de données et des représentations plus complexes, mais les challenges concernent également la qualité des données, la causalité, les contraintes biologiques, la généralisation et la validation expérimentale. Le benchmark Nature Methods de 2025 montre en outre que la seule complexité du modèle ne garantit pas encore un avantage fiable pour les prédictions de perturbation.
Quel challenge a le plus de portée pour la médecine ?
Le challenge 15, « Clinical trial outcomes », se situe à la fin du niveau translationnel. Il suppose qu'un modèle intègre suffisamment bien de nombreux niveaux précédents : mécanismes moléculaires, états cellulaires, efficacité, toxicité, réponses de l'organisme et hétérogénéité clinique.
Conclusion
« Fifteen challenges for generative AI applications to cell biology » est avant tout un plaidoyer pour une définition plus exigeante du progrès. Les 15 tâches déplacent l'attention de la reconstruction de données impressionnante vers la généralisation, les mécanismes, l'intervention et la confirmation prospective. Plus la liste s'étend vers la translation, moins un modèle qui ne fait que reproduire de manière plausible les motifs biologiques est suffisant.
Pour le débat sur les AI Virtual Cells, c'est une échelle utile : une véritable cellule virtuelle ne serait pas simplement un très grand modèle pour l'expression génique, mais un système qui prédit de nouvelles situations biologiques, indique son incertitude et fournit des résultats utiles de manière répétée dans des expériences réelles. D'ici là, les 15 challenges sont moins une preuve de ce qui a été accompli qu'un agenda de recherche concret pour ce qui manque encore.