
Un éditeur de presse veut savoir si ses articles ont servi à entraîner un grand modèle de langage. L’AI Act (le règlement européen sur l’intelligence artificielle) lui a promis un outil pour cela : le résumé public des contenus d’entraînement, avec une rubrique dédiée aux principaux sites collectés. Il ouvre les documents publiés à ce jour et n’y trouve aucun nom de domaine.
Le décompte arrêté au 25 septembre 2026 porte sur 24 résumés accessibles. Vingt et un comportent bien la rubrique prévue par la Commission européenne. Aucun n’y cite un site. Les trois derniers, publiés par DeepSeek, ne reprennent même pas la rubrique.

Complétez votre site, carte par carte
J’ai conçu TresoRank pour détecter ce qui manque à votre visibilité SEO & GEO : contenus, enrichissements, maillage ou optimisations techniques. Chaque opportunité devient une carte à activer.
Analyser mon site gratuitement →Une case prévue pour des noms, remplie avec des catégories
L’article 53, paragraphe 1, point d) de l’AI Act oblige les fournisseurs de modèles d’IA à usage général à publier un résumé « suffisamment détaillé » de leurs données d’entraînement. Le formulaire de la Commission découpe ces données en trois familles : jeux de données publics, données obtenues auprès de tiers, contenus collectés directement sur internet par le fournisseur ou pour son compte.
Les ayants droit regardent d’abord la troisième, puisqu’elle recouvre le crawl (la collecte automatisée de pages web). La section 2.3 du formulaire y réclame une liste de domaines de premier et deuxième niveaux, du type exemple.com, couvrant les 10 % les plus importants de l’ensemble des domaines collectés, classés par volume de contenu extrait. Les PME bénéficient d’un seuil adapté. La liste peut tenir dans un fichier téléchargeable ou derrière un lien.
Ce que les fournisseurs ont inscrit à la place : des catégories. Plateformes web, hébergeurs de code, dépôts académiques, encyclopédies en ligne, portails régionaux. Parfois une extension, comme .com. Rien qui permette à un titulaire de droits de reconnaître son propre site.
Onze documents d’Ant Group, plus de la moitié des rubriques
Avant d’en tirer une conclusion, il faut regarder qui signe ces 21 rubriques. Onze viennent d’Ant Group, pour ses familles de modèles Ling, Ring et Ming, et ont été mises en ligne le 24 septembre dans le dépôt inclusionAI/AI-Transparency sur Hugging Face. Les dix autres se partagent entre OpenAI (deux résumés, pour GPT-6 Astra et GPT-5.5), ByteDance (quatre), MiniMax (deux), Mistral AI (un) et Z.AI (un).
Chez Ant, les onze réponses partent de la même introduction. Sept reprennent ensuite un texte identique, les quatre autres ne changent que les types de contenus mentionnés. Un tiers des 21 rubriques examinées recopie donc un même paragraphe.
Deux lectures s’imposent. D’un côté, le score de 21 rubriques vides sur 21 surpondère un seul acteur et gonfle l’impression d’un bloc uniforme. De l’autre, les dix résumés restants, signés par cinq fournisseurs répartis entre les États-Unis, l’Europe et la Chine, aboutissent au même résultat : zéro domaine nommé. Mistral AI, seul Européen du lot, fait comme les autres.
Le corpus ne prétend pas recenser tous les résumés disponibles. Mais quand six fournisseurs indépendants rendent la même réponse vide, l’échantillon suffit à décrire une pratique.
Le secret d’affaires, porte de sortie ménagée par la notice
Les fournisseurs n’ont pas forcé une serrure. La notice du formulaire évoque elle-même une « forme descriptive et synthétisée » pour ménager les secrets d’affaires. Les réponses en catégories se glissent dans cet interstice.
La même notice rappelle pourtant, dans sa note 16, que la section attend bien une liste de noms de domaine. La FAQ de la Commission va dans le même sens : cette liste figure parmi les informations censées aider les titulaires de droits à identifier l’origine des contenus d’entraînement, sans devoir interroger chaque fournisseur un par un.
Le gabarit européen porte donc deux consignes qui tirent en sens inverse. Les fournisseurs ont choisi la plus confortable. Et tant qu’aucune autorité ne tranche, remplir la case avec « plateformes encyclopédiques » vaut, en pratique, conformité.
Des copies rendues alors que les sanctions étaient déjà possibles
L’obligation s’applique depuis le 2 août 2025 aux modèles nouvellement mis sur le marché européen. Ceux commercialisés avant cette date ont jusqu’au 2 août 2027. Entre les deux, le 2 août 2026, les pouvoirs de sanction de la Commission sont entrés en vigueur.
Ce calendrier alourdit le relevé de septembre. Une partie des résumés examinés, dont les onze d’Ant Group, ont été publiés alors que la Commission pouvait déjà sanctionner. Les fournisseurs savaient que leur copie serait lisible par le régulateur, et ils ont rendu des catégories.
Le stock de modèles antérieurs à août 2025 reste, lui, à documenter d’ici 2027. Si personne ne corrige la pratique d’ici là, ces modèles arriveront à leur tour avec la même rubrique vide.
Journaux serveur et archives, faute de liste officielle
Pour un détenteur de fonds documentaires, le résumé AI Act ne permet pas, en l’état, de savoir si ses pages ont nourri un modèle. Il indique au mieux la nature des sources, rarement leur identité. L’identification sans démarche auprès de chaque fournisseur, promise par la FAQ de la Commission, reste pour l’instant théorique.
Plusieurs réflexes restent à la portée des équipes :
- archiver les résumés publiés par les fournisseurs qui comptent pour votre secteur, pour documenter l’écart entre la section 2.3 et ce qui y figure ;
- croiser ces résumés avec vos propres journaux serveur, qui révèlent quels robots d’indexation ont visité vos pages et à quel rythme ;
- guetter la première décision ou la première clarification de la Commission sur la note 16 : elle dira si « portails régionaux » suffit ou si un nom de domaine est exigible.
Côté fournisseurs, et pour les entreprises qui affinent ou déploient des modèles sur le marché européen, la leçon est inverse. La conformité actuelle repose sur une tolérance de la Commission, qui peut durcir son interprétation à tout moment. Un modèle dont le résumé ne cite aucun domaine se retrouvera alors exposé.
Le formulaire européen a été pensé comme un instrument de contrôle entre les mains des ayants droit. Vingt-quatre documents plus tard, il fonctionne surtout comme une attestation que le fournisseur a répondu. La transparence exigée par l’article 53 se mesurera au premier résumé qui osera publier, en clair, la liste des sites qu’il a le plus aspirés.
Sources
Ils m’ont fait confiance
« Il ne se contente pas de corriger les symptômes, il cherche à comprendre l'origine des problèmes et à sécuriser les modifications effectuées. J'ai réellement le sentiment d'avoir trouvé un développeur qui comprend à la fois la technique et les enjeux globaux du projet. »
Évaluation client · projet WordPress · septembre 2026
5,0/5 sur 17 évaluations
Faire appel à mes services →