Claude pousse un calcul de physique théorique à neuf boucles

Claude pousse un calcul de physique théorique à neuf boucles

Comment savoir si une IA a vraiment trouvé quelque chose ? En biologie, la réponse prend des mois de paillasse. En physique théorique, elle peut tenir dans un fichier : l’amplitude est juste, ou elle ne l’est pas. Anthropic vient de choisir ce terrain, quelques jours après avoir présenté l’enzyme découverte par Claude.

Dans un billet publié sur son blog Science, « Yes, Claude can do nine loops », l’entreprise annonce que son modèle a calculé l’amplitude de diffusion à six particules de la théorie N=4 super Yang-Mills planaire à neuf boucles. Aucun physicien n’avait atteint ce palier par un calcul direct.

À quoi sert une amplitude de diffusion

Quand deux particules se percutent, la physique ne prédit pas une trajectoire unique mais des probabilités : telle particule sortira dans telle direction, avec telle énergie. La formule qui donne ces probabilités s’appelle une amplitude de diffusion. On la confronte ensuite aux mesures des accélérateurs.

Encore faut-il pouvoir l’écrire, ce qu’on ne sait presque jamais faire d’un bloc. Les physiciens l’approchent par couches de corrections successives, les « boucles ». Chaque boucle ajoutée affine la prédiction, et le coût de calcul grimpe de façon exponentielle.

Imaginez un développement décimal que l’on pousserait chiffre après chiffre, où chaque nouvelle décimale coûterait davantage que toutes les précédentes réunies. La théorie N=4 super Yang-Mills sert ici de banc d’essai : un modèle simplifié, sans équivalent direct dans la nature, mais assez régulier pour que l’on puisse espérer aller très loin dans ces corrections.

Un défi lancé de l’extérieur par Matt von Hippel

Le point de départ ne vient pas de l’entreprise. Matt von Hippel, ancien physicien théoricien devenu auteur scientifique, avait lancé le 7 août un défi aux laboratoires d’IA : montrer qu’un modèle, avec les moyens de calcul d’un universitaire, peut résoudre l’un des grands problèmes ouverts du domaine. Parmi ses exemples figurait précisément N=4 super Yang-Mills à neuf boucles. Il signe d’ailleurs, en invité, le billet publié par Anthropic.

Le record précédent, huit boucles, revenait depuis 2023 à Lance Dixon, professeur au SLAC National Accelerator Laboratory (le laboratoire d’accélérateurs de Stanford), et à Yu-Ting Liu. Deux physiciens d’Anthropic, Liam Fitzpatrick et Siddharth Mishra-Sharma, ont relevé le défi en confiant le problème à Claude Science, l’environnement qui encadre le modèle par des règles et des prompts structurés pour les travaux de recherche.

La consigne faisait quelques lignes, avec une instruction de conduite : continuer jusqu’à ce qu’on lui dise d’arrêter, et donner des nouvelles toutes les quatre à six heures. Claude a ensuite travaillé pendant des jours, en grande partie sans supervision.

Le bootstrap, ou l’enquête par élimination

Claude n’a pas inventé de méthode. Il a appliqué celles que Dixon et ses collègues ont mises au point, dont le « bootstrap ». Au lieu de recenser toutes les interactions possibles entre particules, on écrit la forme générale que peut prendre la réponse, dans un alphabet mathématique spécialisé, puis on élimine les candidats qui violent les contraintes physiques connues, jusqu’à ce qu’il n’en reste qu’un.

Plus qu’un calcul frontal, un tri méthodique. Selon Anthropic, cette partie a tourné en Python avec la bibliothèque SymPy et coûté une centaine de dollars, l’équivalent de 96 processeurs pendant une semaine. En parallèle, Claude a suivi une seconde voie, indirecte, via une grandeur voisine appelée « form factor ». Chaque approche aurait coûté à un utilisateur final entre 1 000 et 2 000 dollars, surtout à cause du temps passé par le modèle à raisonner.

Les spécialistes connaissent la fragilité du procédé. Dixon la résume sans détour : une seule erreur dans la recette de calcul, et tout s’effondre. Qu’un agent autonome travaille plusieurs jours sans personne pour rattraper une faute d’indice n’allait pas de soi.

Qui relit un calcul que plus personne ne refait ?

Ce terrain a un avantage sur la biologie : il se vérifie. Une hypothèse biologique peut rester séduisante longtemps avant d’être confirmée ; une amplitude se compare à des contraintes connues et à des résultats antérieurs. Claude a livré la sienne dans le format standard employé pour les résultats à huit boucles et moins, ce qui a permis à Dixon de la contrôler.

Dixon n’a pas refait le bootstrap. Il explique qu’il est relativement facile de repartir de l’amplitude à neuf boucles pour retrouver le form factor, et qu’il a validé le résultat surtout par cette voie. La relecture a donc porté sur une conséquence facile à contrôler, pas sur les jours de calcul eux-mêmes.

Quand un agent produit en une semaine ce que personne n’a le temps de refaire à la main, la confiance ne peut plus reposer sur la reproduction du raisonnement. Elle s’appuie sur des contrôles croisés, des formats partagés et quelques experts capables de concevoir le bon test. Ces experts sont rares : dans ce cas précis, le validateur est aussi l’auteur des méthodes employées.

Des méthodes de 2019, un seul essai sans filet

Le billet ne gonfle pas le résultat. Aucune idée physique nouvelle n’en sort : Claude a mené jusqu’au bout des techniques existantes, publiées par l’équipe de Dixon en 2019 et 2023. Et Anthropic n’était pas seul sur le coup : à peu près au même moment, le groupe de Song He, à l’Académie chinoise des sciences, a calculé la partie de l’amplitude à neuf boucles appelée « symbole », avec l’aide d’une IA fondée sur GPT-6 d’OpenAI, mais dans une démarche bien plus encadrée par des humains.

Le problème était donc à portée. L’expérience d’Anthropic se distingue par sa conduite : une seule tentative, presque sans intervention humaine, sur un calcul où la moindre erreur ruine tout. Si vous déployez des agents, retenez la condition qui a rendu l’essai possible : un agent autonome devient utile là où son travail se vérifie à moindre coût que sa production. Le contrôle se conçoit avant de lancer le calcul, pas après.

La physique des amplitudes dispose de ce luxe, avec des formats communs et des voies de vérification indirectes. La plupart des domaines où les laboratoires d’IA veulent maintenant envoyer leurs agents ne l’ont pas encore. Qui bâtira ces bancs de contrôle, et qui les tiendra quand les calculs dépasseront ce que leurs propres auteurs savent vérifier ?

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *