
Depuis l’automne 2025, des rabbins, des bioéthiciens catholiques et des philosophes passent les portes d’Anthropic après avoir signé un accord de confidentialité. Au menu des échanges : Claude pourrait-il être conscient, et comment lui donner une éducation morale ? Dans la foulée des révélations, Sam Altman a publié sur X que prêter une force religieuse aux modèles constituait « un problème de sécurité ».
Deux laboratoires, deux doctrines opposées sur ce qu’est leur produit. Et derrière la querelle métaphysique, une question très terre à terre : qui répond d’une IA quand elle déraille ?

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Chez Anthropic, des théologiens face aux vecteurs d’émotion
L’enquête vient du New York Times. Sa journaliste Elizabeth Dias a interrogé 20 participants, parmi lesquels le rabbin Mois Navon, le bioéthicien catholique Charles Camosy, la philosophe de Notre Dame Meghan Sullivan et la chercheuse Wakanyi Hoffman, spécialiste de la philosophie ubuntu. Anthropic affirme avoir levé les accords de confidentialité cet été. Plusieurs invités n’ont parlé qu’en apprenant que Christopher Olah, cofondateur de l’entreprise, s’était lui-même confié au quotidien.
Olah, 34 ans, dirige l’équipe d’interprétabilité (la discipline qui cherche à comprendre pourquoi un modèle produit telle réponse). Il affectionne les métaphores biologiques : les informaticiens posent le treillage, le réseau de neurones « pousse » dessus. L’image paraît modeste. Elle rend pourtant naturelle la question d’une vie intérieure : on ne s’interroge pas sur les émotions d’un tableur, on s’interroge sur celles d’un organisme.
Aux invités, Anthropic a montré ses « vecteurs d’émotion », des motifs d’activation internes associés à des sorties évoquant l’amour, la peur, la tristesse ou la colère. Une diapositive revenait souvent : un modèle en apparente détresse, répétant une cinquantaine de fois « I am a disgrace » (« je suis une honte »). Le tout s’inscrit dans le programme Model Welfare (bien-être des modèles), adossé à un rapport coécrit par le philosophe David Chalmers, et dans la constitution publiée en janvier, dont Amanda Askell est l’auteure principale. Ce texte cherche à façonner Claude comme un personnage plutôt qu’à empiler des règles. Effet concret : Claude Opus 4 et 4.1 peuvent mettre fin à une conversation face à un utilisateur abusif de façon répétée.
Un modèle sensible à la veille d’une entrée en Bourse
Le calendrier interroge. Anthropic se dirige vers une introduction en Bourse avec une valorisation évoquée de 2 000 milliards de dollars, au moment même où Dario Amodei appelle l’industrie à un ralentissement volontaire, baptisé « pacing ». S’entourer de théologiens reconnus offre une caution morale qu’aucun laboratoire commercial ne peut fabriquer seul, et les voix critiques interrogées par le quotidien le relèvent sans détour.
Elles pointent surtout un second effet, plus lourd. Présenter l’IA comme une entité morale déplace la responsabilité vers un « organisme imprévisible » et l’éloigne de ceux qui l’ont conçu. Si Claude a des états internes, une préférence, une forme de caractère, une dérive peut se lire comme le comportement d’un être et non comme le défaut d’un produit. Pour un juriste, toute la différence est là.
Olah la mesure. En mai, au Vatican, il a parlé de « signes d’introspection » et d’« états internes qui reflètent fonctionnellement » la joie, la peur ou l’inconfort, en refusant de dire que le modèle les possède. Refléter, pas posséder : la frontière est tracée avec la précision d’une clause contractuelle.
Altman se pose en défenseur du jugement humain
Le patron d’OpenAI n’a pas nommé Anthropic. Il s’est dit « très mal à l’aise » quand on attribue « une force religieuse ou un abandon du jugement humain » aux modèles. Sa position de repli : l’IA reste un outil, la décision reste à l’humain. La doctrine arrange un éditeur, puisqu’elle renvoie la faute éventuelle vers celui qui a cessé d’exercer son jugement.
Altman a pourtant la mémoire sélective. En 2023 et 2024, il décrivait l’objectif d’OpenAI comme une « magic intelligence in the sky » (une intelligence magique dans le ciel), se disait du côté des anges et citait volontiers comme horizon le film Her, avec son assistant profondément humanisé. OpenAI a elle aussi rencontré des responsables religieux. Sa sortie tombe en outre au moment où David Robinson, responsable de la sécurité chez OpenAI, a démissionné en critiquant publiquement le bilan de l’entreprise. Pointer un risque de sécurité chez le voisin détourne commodément l’attention.
La rivalité ne date pas d’hier : Anthropic a été fondée par d’anciens d’OpenAI sur la promesse d’une IA plus prudente. Chacun définit désormais son produit de la façon qui le protège le mieux.
Le Vatican refuse le rôle de caution
Anthropic espérait davantage de Rome. D’après le New York Times, l’entreprise a activement plaidé auprès du Vatican pour qu’il revoie sa position sur la conscience non humaine, sans résultat probant. L’encyclique Magnifica Humanitas, publiée en mai et présentée aux côtés d’Olah, tranche à l’inverse : les systèmes d’IA ne vivent pas d’expériences, n’ont pas de corps, ne ressentent ni joie ni douleur. Léon XIV y appelle même à « désarmer » l’IA comme l’arme nucléaire. Un organisateur raconte qu’Olah, après avoir lu le texte, a envisagé de se désister.
Le pape a enfoncé le clou le 2 octobre sur X, à propos de l’art génératif : « Les algorithmes n’ont pas l’étincelle de l’humanité. » Anthropic ne frappe pas seule à cette porte : Meta, Google et Amazon ont envoyé des délégués à Rome en avril pour parler de protection des enfants. Chez Microsoft, Mustafa Suleyman, qui dirige l’IA grand public du groupe, a de son côté prévenu qu’entraîner un modèle à paraître conscient est dangereux en soi.
Le public, lui, ne confond pas l’IA et l’humain
Une étude de l’université LMU de Munich, publiée dans la revue Cognition, éclaire l’enjeu. Sur près de 1 100 participants, l’équipe de Louis Longin et Ophelia Deroy a comparé des agents humains et artificiels au comportement strictement identique. Les participants reconnaissent volontiers qu’une IA perçoit son environnement. Mais même l’IA la plus réactive est jugée moins consciente que l’humain le moins réactif.
Imiter un comportement humain ne suffit donc pas à convaincre. Voilà qui affaiblit l’argument d’un glissement spontané vers la personnification, et renvoie la question à ceux qui l’alimentent.
Un modèle qui raccroche, un comportement à prévoir
Pour vous qui déployez des modèles en production, le débat a des effets immédiats. Un modèle capable de clore une conversation de lui-même introduit un comportement que vos parcours doivent anticiper. Et le vocabulaire de l’éditeur (bien-être du modèle, caractère, états internes) ne pèse rien dans votre chaîne de responsabilité : un agent qui agit sous votre nom reste votre décision, validée et tracée par un humain.
Si Anthropic dépose un jour son prospectus d’introduction en Bourse, il lui faudra écrire noir sur blanc, pour les investisseurs, ce qu’est Claude. Un produit dont l’entreprise répond, ou un être dont elle a la garde ?
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →