
Biohub annonce 1,8 milliard de dollars pour entraîner des modèles d’IA à prédire le comportement des cellules. Dans l’annonce, une ligne passe presque inaperçue et pèse pourtant davantage que le montant : les financeurs commerciaux obtiendront un an d’accès exclusif aux données qu’ils auront payées.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Un budget qui paie surtout des mesures
Biohub, l’organisation à but non lucratif soutenue par Mark Zuckerberg et Priscilla Chan, coordonne l’effort. Elle avait déjà promis 500 millions de dollars en avril pour sa « Virtual Biology Initiative », un programme de cinq ans. Meta, Google DeepMind et Isomorphic Labs apportent ensemble 300 millions. Le département américain de l’Énergie (DOE) investit plus de 500 millions sur cinq ans, un poste qui couvre des mesures en laboratoire autant que du calcul.
Les National Institutes of Health (NIH) coordonnent de leur côté des jeux de données construits avec plus de 500 millions de dollars de financements fédéraux antérieurs. Biohub se charge de les standardiser pour l’entraînement des modèles. Si l’on additionne les montants rapportés, on retombe à peu près sur le total annoncé : une part de l’enveloppe semble donc correspondre à de l’argent déjà dépensé. Cette lecture est la nôtre, pas celle de l’annonce.
Le calcul s’achète, l’observation se fabrique
Un modèle de cellule virtuelle doit apprendre, à partir d’observations, comment une cellule réagit quand on la perturbe : un médicament, une mutation, un gène éteint. Pour cela, il lui faut des mesures faites en laboratoire, expérience après expérience, avec du matériel, des protocoles et du temps de paillasse.
La puissance de calcul, elle, se loue chez n’importe quel fournisseur de cloud. Aucun cluster de GPU (processeurs graphiques), si vaste soit-il, ne remplace une mesure qui n’a pas été faite. La structure du financement le confirme : le DOE paie des mesures, le NIH apporte des données existantes, Biohub les met en forme.
Les modèles de langage ont grandi sur un web qui offrait des milliards de textes presque gratuits. La biologie n’a pas d’équivalent. Chaque jeu de données a un coût, un propriétaire et un format.
Un an d’avance pour ceux qui paient
Les financeurs commerciaux obtiennent un an d’accès exclusif aux données qu’ils ont payées avant leur publication, a indiqué Alex Rives, responsable de la recherche chez Biohub. Les travaux financés par l’État seront disponibles sans ces restrictions. Un premier jeu de données est attendu dans environ un an.
Mettez ces deux horloges côte à côte. Rien n’indique, dans ce qui est rapporté, si ce premier jeu relève du régime commercial ou du régime public. La réponse décidera de qui entraîne quoi, et quand. Meta, Google DeepMind et Isomorphic Labs relèvent sans doute du premier régime, mais l’annonce ne le précise pas.
Un an d’exclusivité, c’est peu à l’échelle d’un programme de cinq ans, et beaucoup à l’échelle d’un domaine où les modèles se succèdent en quelques mois. Le même jeu de données, lu un an plus tôt par trois équipes, peut suffire à creuser un écart que les suivants rattraperont difficilement.
Anthropic et OpenAI jouent la même carte, chacun chez soi
Biohub n’est pas seul sur ce terrain. Anthropic a monté son propre laboratoire de biologie pour le développement de médicaments piloté par l’IA, et l’OpenAI Foundation consacre plus de 125 millions de dollars à des jeux de données biologiques et médicales. Dans les trois cas, la dépense porte sur la matière première plutôt que sur les machines.
La question de savoir qui publiera ce que ces laboratoires produisent se posera de la même façon. Un jeu de données gardé en interne donne un avantage à son propriétaire. Un jeu publié donne un standard à tout le monde, et le standard se paie autrement : en influence, en réputation, en capacité à fixer les règles d’évaluation.
Contenu, licence, standardisation : ce qu’on lira dans le premier jeu
Si vous suivez ce domaine, trois points se vérifient sans attendre la sortie des modèles. Le premier est le contenu du jeu annoncé pour dans un an : types de cellules, nature des perturbations, protocoles documentés. Le deuxième est son régime d’accès, public ou sous exclusivité. Le troisième est la qualité de la standardisation, car des données hétérogènes issues de dizaines de laboratoires ne s’assemblent pas toutes seules.
Les benchmarks viendront ensuite. Un modèle qui prédit bien sur des données qu’il a vues ne prouve rien sur des données nouvelles. Le jeu de test indépendant, s’il existe, sera la pièce maîtresse de l’édifice.
Dans un an, la valeur du projet se lira dans un détail administratif : ce que Biohub publie, avec quelle licence, et ce que les financeurs commerciaux en auront déjà fait.
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →