OpenAI note ses propres modèles en thérapeutes du quotidien

Illustration avec le logo OpenAI pour l'annonce du benchmark MentalHealthBench sur les conversations liées à la santé mentale.

Avec MentalHealthBench, OpenAI annonce que les modèles de pointe progressent dans les conversations réalistes sur la santé mentale, et qu’on peut désormais le mesurer. L’instrument a pourtant été conçu par l’éditeur des modèles qu’il évalue, et il déplace l’évaluation vers le terrain où l’IA a le plus à gagner : la conversation ordinaire, loin des situations de crise.

Un banc de mesure qui élargit le périmètre

Les faits, d’abord, tels qu’OpenAI les a annoncés sur son compte officiel le 23 septembre. MentalHealthBench est un benchmark (banc d’évaluation standardisé) ouvert, construit avec les contributions de plus de 80 cliniciens spécialisés en santé mentale. Il sert, selon l’éditeur, à montrer que les modèles de pointe « ont continué à s’améliorer » dans des échanges réalistes sur ce sujet.

Le second message d’OpenAI livre la clé de l’opération. La plupart des benchmarks existants se concentrent sur les situations d’urgence ; MentalHealthBench veut couvrir « l’ensemble du spectre », du soutien quotidien jusqu’aux scénarios de crise aiguë.

Présenté ainsi, l’élargissement ressemble à un progrès méthodologique. Il change pourtant la question posée.

La crise, seul terrain où une bonne réponse se définit

Si les évaluations se concentraient sur l’urgence, ce n’était pas par paresse. La crise est le seul terrain où l’on sait à peu près définir une bonne réponse : repérer le risque suicidaire, orienter vers un numéro d’aide, ne pas banaliser, ne pas aggraver. Ce sont des critères de sécurité, vérifiables, qui disent ce qu’un modèle ne doit pas rater.

Le soutien quotidien obéit à une autre logique. Une personne qui parle de son anxiété au travail, de sa solitude ou d’un deuil n’attend pas une procédure. La qualité d’une réponse devient alors une affaire d’appréciation : ton, justesse, capacité à ne pas enfermer l’utilisateur dans l’échange. Mesurer cela revient à définir ce qu’est un bon accompagnement psychologique par une IA.

Et celui qui écrit cette définition fixe aussi la barre que ses modèles doivent franchir.

Juge et partie, même avec 80 cliniciens

La participation de plus de 80 cliniciens donne au projet une caution sérieuse, et il serait injuste de la balayer. D’après l’article technique publié par OpenAI, ces psychiatres et psychologues diplômés ont rédigé les critères de notation de chacune des 1 215 conversations synthétiques du benchmark. Cela vaut mieux qu’une grille écrite par des ingénieurs seuls.

Contribuer à un benchmark ne revient pas pour autant à valider cliniquement un usage. Les annonces d’OpenAI ne mentionnent ni essai, ni suivi de patients, ni mesure d’effet sur la santé des utilisateurs dans la durée. Un benchmark évalue des réponses à des conversations types ; il ne dit rien de ce que devient une personne qui confie, chaque soir, son moral à un chatbot pendant six mois.

Le problème de conception est connu dans toute l’industrie. Un éditeur qui publie le banc de mesure sur lequel ses modèles s’améliorent écrit à la fois le sujet et le barème. Ici, il fournit même le correcteur : les réponses sont notées par GPT-5.6 Sol, un modèle d’OpenAI. Même avec des intentions irréprochables, les scénarios retenus, la pondération entre soutien et crise, la façon de noter une réponse « empathique » reflètent ce que l’entreprise sait faire et ce qu’elle veut montrer.

L’ouverture du benchmark atténue en partie ce biais : d’autres laboratoires pourront y soumettre leurs modèles, des chercheurs pourront en contester la grille. C’est une qualité réelle. Elle ne change rien au fait que la première lecture publique des résultats est celle d’OpenAI, sur ses propres modèles.

Une bonne note en soutien quotidien, et ce qu’elle autorise

L’enjeu dépasse la querelle de méthode. Couvrir le soutien quotidien, c’est reconnaître qu’une part des conversations « que les gens apportent à l’IA », selon la formule d’OpenAI, relève déjà de l’accompagnement psychologique, hors de toute crise. La proportion paraît modeste ; rapportée au nombre d’utilisateurs, elle ne l’est plus. Anthropic, qui a passé au crible les échanges de Claude.ai en juin 2025, chiffrait à 2,9 % les conversations « affectives » (conseil, coaching, accompagnement psychologique, compagnie).

Un score qui progresse sur ce terrain devient un argument. Il permet de dire que le modèle se comporte bien quand on lui parle de son mal-être, et donc, implicitement, qu’on peut continuer à lui en parler. L’usage thérapeutique de masse se trouve normalisé par une courbe de performance, sans être passé par les étapes qui encadrent d’ordinaire une intervention de santé : validation clinique indépendante, identification des publics à risque, suivi des effets indésirables.

La crise était un garde-fou étroit mais net. Le quotidien, lui, n’a pas de bord.

Lire les résultats sans se tromper de question

Pour les équipes qui intègrent des modèles de langage dans des produits grand public (assistants, applications de bien-être, agents de support), MentalHealthBench sera probablement cité comme référence. Il mérite d’être utilisé pour ce qu’il est : un outil de comparaison entre modèles sur une grille donnée, utile pour repérer des régressions ou des écarts de comportement.

Il ne peut pas servir de feu vert. Un bon score ne dispense ni de tester le comportement de votre intégration dans votre propre contexte, ni de prévoir des mécanismes d’orientation vers des professionnels, ni de vous demander si votre produit doit accueillir ce type de conversation. Posez aussi une question simple aux résultats publiés : quelle part de la note vient du soutien quotidien, et quelle part de la gestion de crise ? Un modèle peut gagner des points sur l’empathie ordinaire tout en stagnant là où l’erreur coûte cher.

Le test décisif viendra des évaluations que d’autres acteurs (universités, cliniciens indépendants, autorités de santé) bâtiront sans l’éditeur. Tant qu’elles manqueront, la progression affichée par MentalHealthBench dira surtout jusqu’où OpenAI estime que ses modèles peuvent aller dans l’intimité de leurs utilisateurs.

Sources

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *