Changez un mot sur quatre et le filigrane d’OpenAI disparaît

Changez un mot sur quatre et le filigrane d'OpenAI disparaît

L’essentiel

  • OpenAI active un filigrane invisible sur le texte de ChatGPT et de Codex pour les utilisateurs de l’Union européenne, sur tous les forfaits, dans les semaines qui viennent.
  • Les clients de l’API, partout dans le monde, peuvent l’activer dès maintenant sur certains modèles : il est désactivé par défaut, alors que celui d’Anthropic pour Claude s’applique partout.
  • Dans les tests d’OpenAI, remplacer 10 % des mots par des synonymes fait passer la détection de 92 % à 66 %, et 25 % la ramènent à 17 %.
  • Le détecteur n’est ouvert qu’à des chercheurs et organisations approuvés, et l’absence de filigrane ne prouve pas qu’un humain a écrit le texte.

Prenez un passage de 300 mots produit par ChatGPT, et remplacez soixante-quinze d’entre eux par des synonymes. Le détecteur d’OpenAI ne reconnaît plus sa propre signature que dans 17 % des cas. L’entreprise publie elle-même cette mesure avec textGrain, le filigrane texte qu’elle déploie en Europe pour répondre à l’AI Act, le règlement européen sur l’intelligence artificielle.

Un motif statistique que quelques synonymes suffisent à brouiller

Un filigrane de texte n’est pas un symbole caché. Le modèle infléchit légèrement ses choix de mots selon une clé secrète, et un détecteur qui connaît cette clé repère ensuite le motif statistique, sans autre information que le texte lui-même. Le signal voyage avec le copier-coller, puisqu’il vit dans les mots.

Cela le rend aussi fragile. Les chiffres d’OpenAI, mesurés sur des passages de 400 tokens (environ 300 mots), se lisent par paliers :

  • texte brut : détection autour de 92 % ;
  • 10 % des mots remplacés par des synonymes : 66 % ;
  • 25 % des mots remplacés : 17 %, sous la barre des 20 % même sur un passage long.

Un élève qui reformule un devoir, un rédacteur qui retouche un paragraphe ou un script de quelques lignes qui permute des synonymes passent sous le seuil. Le contournement ne demande ni compétence ni outil particulier.

Un signal solide à 400 tokens, mince partout ailleurs

Les meilleurs scores d’OpenAI sont aussi les plus flatteurs : avec un taux de faux positifs fixé à 1 %, le détecteur retrouve environ 95 % des filigranes dans des passages de psychologie de 400 tokens. À 200 tokens, on tombe vers 80 %. Sur des contenus mathématiques, où le modèle a peu de latitude pour choisir ses mots, la détection est « substantiellement plus basse » : environ 60 % à 400 tokens selon le graphique publié.

Ces mesures décrivent donc le cas le plus favorable : un texte long, littéraire, non retouché. Les réponses courtes, le code, les traductions et les raisonnements chiffrés, c’est-à-dire une grande part de ce que les agents et les copilotes produisent au quotidien, se situent du mauvais côté de la courbe. OpenAI ne fournit aucune donnée pour vérifier que des passages plus longs corrigent le problème.

Côté qualité d’écriture, l’entreprise affirme n’avoir observé aucune différence significative sur huit benchmarks, dont GPQA Diamond, BrowseComp et DeepSWE, avec son modèle Astra. Ces tests évaluent le raisonnement, pas le style : la question reste ouverte, et des utilisateurs de Claude l’ont déjà posée.

Un détecteur réservé à quelques chercheurs

L’accès au détecteur est accordé au cas par cas aux chercheurs et organisations expertes approuvés, pas au public. OpenAI invoque le risque de filigranes manqués et de faux positifs. Un enseignant, une rédaction ou un recruteur ne peut donc pas lancer lui-même le contrôle.

OpenAI borne elle-même la portée de son outil. Un filigrane répond à une seule question, « ce texte a-t-il probablement été généré par un modèle OpenAI ? », et ne dit ni qui l’a demandé, ni combien de retouches ou de création humaine s’y sont ajoutées. Son absence ne prouve pas non plus qu’un humain a écrit : le texte peut être trop court, trop retouché, traduit, ou issu d’un autre modèle. L’entreprise publie par ailleurs son rapport technique, co-écrit avec des chercheurs de l’université de Pennsylvanie et de Yale, et prévoit de diffuser la technologie en open source.

Ce dispositif coche la case réglementaire sans engager l’entreprise sur la fiabilité. Les règles de transparence de l’AI Act, en vigueur depuis le 2 août, demandent un marquage lisible par machine : elles ne garantissent pas qu’il résiste à une reformulation.

L’API en option, Claude sans choix

Le déploiement varie d’abord selon la géographie. Dans l’Union européenne, ChatGPT et Codex sont marqués sur tous les forfaits. Ailleurs, rien ne change pour les utilisateurs finaux. Les clients de l’API, eux, peuvent activer le filigrane dans le monde entier sur certains modèles, y compris via des partenaires cloud comme Microsoft Azure dans les semaines à venir, mais le réglage est éteint par défaut.

Anthropic a retenu l’inverse il y a deux mois : un filigrane obligatoire pour Claude, partout, quel que soit l’accès, fondé sur SynthID de Google. Cette décision a provoqué des protestations d’utilisateurs, qui estimaient fournir « les instructions, le contexte, les décisions » et ne voyaient dans le modèle qu’un outil. Anthropic n’a pas publié de taux de détection pour son système, tout en assurant qu’il résiste bien aux modifications.

Pour un développeur qui intègre un modèle dans un produit, la différence est concrète : chez OpenAI, le marquage devient un paramètre à décider, à documenter et à assumer face à ses propres clients ; chez Anthropic, il est imposé. OpenAI avait déjà conçu un filigrane texte par le passé, sans le lancer, par crainte de voir les utilisateurs se tourner vers des concurrents qui n’en avaient pas. Les 17 % de détection après 25 % de synonymes laissent entrevoir l’autre issue : ceux que le marquage dérange pourront passer aux modèles ouverts, que personne n’oblige à marquer.

Anthropic, Google, Meta, Microsoft et OpenAI ont tous souscrit au code de bonnes pratiques européen sur les contenus générés. La première réponse chiffrée à ce texte vient donc d’un filigrane qu’on neutralise en changeant un mot sur quatre.

Mon avis

Un marquage qui s’efface avec soixante-quinze synonymes ne servira jamais de preuve, et OpenAI le dit elle-même en refusant d’ouvrir son détecteur. Je pense que le texte filigrané restera un indice statistique à usage de chercheurs, pendant que la responsabilité réelle se déplacera vers ceux qui publient : plateformes, éditeurs, entreprises clientes de l’API. Le jour où un client demandera pourquoi vous avez laissé l’option éteinte, le filigrane aura enfin une utilité, celle de désigner un choix.

Ils m’ont fait confiance

« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »

Évaluation client · projet WordPress · septembre 2026

5,0/5 sur 17 évaluations

Faire appel à mes services →

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *