Inherent affirme battre Opus 4.8 avec 27 milliards de paramètres

Inherent affirme battre Opus 4.8 avec 27 milliards de paramètres

L’essentiel

  • Inherent, laboratoire londonien fondé par d’anciens de Google DeepMind, affirme que son agent Faraday a dépassé Claude Opus 4.8 et GPT-5.5 sur la reproduction de résultats scientifiques publiés.
  • Faraday s’appuie sur Qwen 3.6, un modèle de 27 milliards de paramètres, très loin de la taille des systèmes frontière auxquels il est comparé.
  • Pour la programmation, l’agent utilise Codex GPT-5.5, l’outil d’OpenAI, plutôt qu’une solution maison.
  • Le classement est publié par l’entreprise qui commercialise l’agent, sans évaluation indépendante à ce stade.

Douze personnes à Londres, 50 millions de dollars levés en amorçage il y a quelques semaines, et déjà un premier résultat public : leur agent, Faraday, passerait devant Claude Opus 4.8 et GPT-5.5 sur la reproduction de résultats scientifiques publiés. Inherent, fondé par d’anciens de Google DeepMind, le fait tourner avec un modèle ouvert de 27 milliards de paramètres, une taille sans commune mesure avec celle des systèmes frontière qu’il affronte. Le classement est maison, et le dispositif qu’il mesure mérite qu’on l’ouvre.

Le modèle de 27 milliards de paramètres n’appartient pas à Inherent

Le moteur de Faraday s’appelle Qwen 3.6, un modèle ouvert de 27 milliards de paramètres : ce compteur sert d’indicateur de taille et, le plus souvent, de coût d’entraînement. Le laboratoire l’a pris tel quel.

Ce que l’équipe a réellement construit se situe autour. Un apprentissage par renforcement, l’entraînement qui récompense les bons résultats au lieu d’énoncer des règles, installe dans l’agent ce qu’Edward Hughes, cofondateur et directeur scientifique, appelle un « goût de recherche » : l’instinct des expériences qui valent la peine d’être lancées. La performance annoncée porte sur cet assemblage, pas sur la qualité intrinsèque du modèle emprunté.

L’agent qui bat GPT-5.5 fait appel à GPT-5.5

Le détail le plus parlant tient en une phrase : plutôt que de développer son propre outil de programmation, Inherent fait travailler Faraday avec Codex GPT-5.5, celui d’OpenAI. L’entreprise l’assume et le rapproche du réflexe d’un scientifique qui utilise les logiciels existants au lieu de tout réécrire.

Le compteur de paramètres ne couvre donc que la couche qui orchestre. Le système complet, lui, embarque le modèle frontière qu’il est censé dépasser. Comparer les deux revient à mesurer un atelier contre l’un de ses outils : l’atelier gagne, et on n’apprend rien sur l’outil. La facture réelle, celle des appels à un modèle frontière pendant des heures d’expériences, ne se lit pas davantage dans le nombre de paramètres.

Reproduire un papier, c’est travailler avec le corrigé

La tâche retenue consiste à retrouver seul les résultats d’articles déjà publiés, sans connaître la réponse à l’avance. Hughes rappelle que beaucoup de doctorants commencent par là. L’exercice est sérieux, et sa réponse existe déjà : elle est imprimée dans le papier.

Cette propriété n’a rien d’anodin : elle est la condition même de la méthode employée. L’apprentissage par renforcement a besoin d’un signal net pour distribuer ses récompenses, et une conclusion publiée fournit exactement cela. L’objectif affiché par Inherent, produire des connaissances nouvelles, n’offre aucun corrigé. Rien ne garantit qu’un score obtenu là où la vérité est connue se transporte là où elle ne l’est pas.

Le protocole est public, l’arbitre reste l’entreprise

Il faut créditer Inherent sur un point : la méthode est sur la table. Le papier publié décrit Replica, sa série de 310 tâches tirées de 100 articles scientifiques, et la grille qui attribue les points : ressemblance de la figure reproduite, soutien réel apporté à la conclusion de l’article, conformité de l’expérience à ce qui y est décrit, usage du budget de calcul, intégrité de la démarche. Un juge automatisé applique cette grille. Ce qui manque n’est donc pas le protocole : c’est un tiers pour le rejouer, et un jeu de tâches que d’autres pourraient reprendre à leur compte.

Reste l’asymétrie du dispositif, que le papier ne cache pas. Tout tient à l’outillage logiciel qui encadre le modèle, ce que le métier appelle le harness. Les concurrents ont été évalués dans les produits du commerce, Opus 4.8 dans Claude Code et GPT-5.5 dans Codex, quand Faraday disposait du sien, taillé pour l’exercice, et d’un entraînement mené sur 242 tâches du même jeu, les 68 autres étant réservées au test. Cette couche pèse lourd : à modèle identique, le score varie fortement selon la mémoire, les outils et la supervision accordés à l’agent. Le classement oppose donc un système entraîné pour cette tâche à deux assistants généralistes, ce qui ne répond pas à la question du meilleur modèle.

Un modèle ouvert, un outil tiers, un entraînement ciblé

Il y a pourtant une leçon utile dans cette annonce, et elle n’est pas sur le podium. Elle est dans la recette : un modèle ouvert de taille moyenne, un outil tiers pour la partie technique, un entraînement qui porte sur la façon de mener le travail plutôt que sur le volume de connaissances. Aucune de ces briques n’exige un campus de chercheurs, et une équipe de douze personnes peut aujourd’hui les assembler.

Le tri, devant le prochain record annoncé, tient alors à peu de chose : savoir qui a mené l’évaluation et ce que cette partie gagne au résultat, vérifier si les concurrents tournaient dans l’outillage du champion ou dans le leur, regarder enfin si la tâche possède déjà sa réponse quelque part.

Inherent prévoit de passer à une vingtaine de personnes d’ici la fin de l’année et vise les world models, ces systèmes censés se construire une représentation interne du réel pour anticiper ce qui va s’y produire. Ouvrir Replica à qui veut s’en servir, concurrents compris, coûterait peu et changerait le statut de cette annonce : d’un résultat interne, elle deviendrait un point de comparaison. En l’état, elle établit la qualité de son ingénierie, pas l’avance scientifique revendiquée.

Mon avis

Ce que Faraday démontre dessert Inherent plus qu’il ne le sert : n’importe quelle équipe capable d’écrire un bon harness peut désormais prendre un modèle ouvert de 27 milliards de paramètres et se hisser au niveau des systèmes frontière sur une tâche cadrée. La taille du modèle cesse d’être une barrière à l’entrée, et la valeur migre vers l’ingénierie d’agents, où elle se copie vite. J’attends la prochaine série de records de laboratoires de douze personnes, pas de campus à plusieurs milliards de dollars. Le danger de cette séquence est ailleurs : à force de classements auto-publiés, plus personne ne saura ce que vaut un classement.

Sources

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *