Décryptage Société

Tes contenus entraînent-ils l'IA ? Ce que ton entreprise peut exiger

Des procès sur les données d'entraînement de l'IA se multiplient en 2026 : livres piratés, données internes rachetées en faillite, résumés publics obligatoires. Voici ce qu'une PME peut exiger, sans attendre une décision de justice.

📅 23 septembre 2026 🔗 35 sources citées Par 🔄 Mis à jour le 26 septembre 2026
Livre fermé en céramique blanche, scellé par un cachet de cire ambré, métaphore des contenus soustraits à l'entraînement de l'IA

Un accord à 1,5 milliard de dollars entre Anthropic et des auteurs, les données internes d'une compagnie aérienne en faillite rachetées par Google : les procès sur l'entraînement des IA ne sont plus une affaire de studios américains. Ce décryptage traduit ce que ces dossiers changent concrètement pour ce que tu publies, ce que tu signes et ce que tu tapes.

En août 2026, un livre rare a été détruit dans un centre logistique Amazon pour nourrir un modèle d'IA, selon l'enquête de 404 Media. Ce décryptage analyse trois terrains où une entreprise peut agir face à l'entraînement des modèles : la publication en ligne (réservation TDM, blocage côté serveur, Cloudflare depuis le 15 septembre 2026), les contrats fournisseurs (rachat des données internes de Spirit Airlines par Google pour 10 millions de dollars, clauses de non-entraînement à négocier) et les outils du quotidien (politiques par défaut d'OpenAI, Anthropic et Mistral). Le terrain contractuel reste le moins encadré, malgré le Data Act européen qui organise la portabilité des données sans interdire leur usage pour l'entraînement.

En bref

L'entraînement d'une IA désigne l'utilisation de textes, d'images ou de données internes pour ajuster les paramètres d'un modèle. En 2026, l'accord Anthropic homologué à 1,5 milliard de dollars, le droit de réservation européen et les obligations de transparence de l'AI Act donnent aux entreprises des leviers concrets pour encadrer cet usage, dans leurs publications comme dans leurs contrats fournisseurs.

Un livre éventré pour nourrir une IA : et si c'était tes contenus ?

Un livre rare, équipé d'un traceur, part dans un colis vers un centre logistique Amazon près de Las Vegas. Sur place, sa reliure est tranchée pour que les pages défilent plus vite sous un scanner. 404 Media a suivi ce trajet à la trace et résume la scène en une phrase : « Le livre imprimé est détruit dans le processus. » L'objet physique disparaît, son contenu rejoint un jeu de données d'entraînement.

Ce livre n'a rien signé. Ton entreprise non plus, la plupart du temps. Tes articles de blog, tes fiches produit, les messages internes de ta messagerie professionnelle, tout cela peut prendre le même chemin sans que tu l'aies décidé. Depuis le début de l'année 2026, une série de procès et de décisions donne enfin des repères à une question restée floue trop longtemps : qui a le droit d'utiliser quoi pour entraîner un modèle. Qu'est-ce que tu peux exiger en retour ?

Ce décryptage traite trois terrains distincts, dans cet ordre de poids. D'abord ce que tu publies en ligne, le terrain le mieux couvert par le droit européen. Ensuite tes contrats avec les fournisseurs qui touchent tes données internes, l'angle le moins documenté et pourtant le plus risqué pour une PME. Enfin une question plus courte sur ce que tu tapes toi-même dans un outil d'IA au quotidien.

Que révèlent les procès en cours sur les données d'entraînement ?

Le dossier le plus lourd reste l'accord entre Anthropic et un collectif d'auteurs américains. Un tribunal fédéral californien a validé un règlement de 1,5 milliard de dollars, soit environ 3 000 dollars par livre piraté. Le tribunal justifie ce montant sans détour : « quatre fois le minimum légal prévu pour une contrefaçon ordinaire ». C'est le règlement le plus élevé connu dans ce type d'affaire.

En France, les éditeurs et les auteurs ont attaqué Meta sur le même fondement. Selon l'AFP, la procédure ciblerait en particulier Books3, une base de livres piratés qui réunit environ 183 000 titres. Aucune décision n'a été rendue : la procédure est en cours.

Côté musique, les éditeurs ont attaqué Anthropic pour 21 231 œuvres, en réclamant 150 000 dollars par titre, soit plus de 3 milliards. Ce montant correspond au plafond légal américain, pas à une somme déjà accordée : c'est une demande, pas un jugement.

Le dossier le plus politique oppose le New York Times à OpenAI. Le ministère de la Justice américain a pris position en faveur de la doctrine de l'usage loyal, au nom de la sécurité nationale, en estimant que ces considérations « l'emportent largement sur tout dommage concurrentiel ». Cet avis n'engage pas le tribunal : le procès n'est pas tranché.

Face à cette vague, un contre-argument mérite d'être posé : le problème n'est pas seulement américain. Une enquête de Mediapart montre que Mistral, le champion français de l'IA, restitue 58 % du texte du Petit Prince et le quart du Hobbit. L'entreprise a répondu en invoquant un « principe de réalité » : ces textes circulent partout sur Internet. Écrire ce décryptage comme si un camp défendait les créateurs et l'autre les pillait donnerait une image fausse du rapport de force.

2023 → 2026

Les affaires qui dessinent le droit de l'entraînement

Clique sur une date pour voir ce qui a été décidé et ce qui reste ouvert.

Statuts au 25 septembre 2026.

Ce que ça change pour toi

Ce que tu peux exiger sur ce que tu publies

Le droit européen te permet de réserver tes œuvres à l'entraînement, par un procédé lisible par une machine. Un site peut inscrire cette réservation dans son code. Attention à ne pas s'y fier aveuglément : TDMRep est une spécification de groupe communautaire du W3C, sans statut normatif. Elle exprime une intention ; aucun mécanisme technique ne l'impose à un opérateur de robot d'exploration. La réservation ne bloque donc rien mécaniquement : elle crée ton droit de t'opposer à la fouille de ce contenu, que le fournisseur doit ensuite respecter. Elle vaut pour la suite et ne fait pas sortir un contenu d'un jeu de données déjà constitué.

Les plateformes, elles, appliquent souvent la logique inverse. Twitch, propriété d'Amazon, a révélé que les flux de ses streamers servent par défaut à entraîner l'IA d'Amazon, en ajoutant le même jour une option de retrait dans les réglages de la chaîne. Son directeur produit l'assume : « Si l'accord devait être explicite, personne ne le donnerait. C'est honnêtement la réponse. » Sans réservation de tes droits, le silence vaut accord.

Le robots.txt, ce fichier placé à la racine d'un site qui demande aux robots de ne pas explorer certaines pages, ne suffit plus. De plus en plus d'éditeurs bloquent les aspirateurs d'entraînement directement au niveau du serveur. Cloudflare a durci le ton : depuis la mi-septembre, les robots d'entraînement et les agents sont bloqués par défaut sur les pages qui affichent de la publicité, la recherche restant autorisée. La règle ne couvre pas tous les sites qui passent par Cloudflare, seulement les nouveaux domaines, les nouveaux clients et les comptes gratuits existants. Le service de rémunération change aussi de logique : l'éditeur n'est plus payé à chaque passage de robot, mais quand son contenu est réellement utilisé.

Le règlement européen sur l'IA oblige les fournisseurs de modèles à usage général à publier un résumé des contenus qui ont servi à l'entraînement. Concrètement, tu peux aller le consulter pour vérifier ce qu'un fournisseur déclare avoir utilisé. L'obligation s'applique aux modèles récents depuis août 2025 et s'étendra aux plus anciens en 2027. En cas de manquement, l'amende peut atteindre 15 millions d'euros ou 3 % du chiffre d'affaires mondial.

Le Sénat a adopté à l'unanimité un texte qui inverse la charge de la preuve : dès qu'un indice rend l'usage vraisemblable, l'œuvre est présumée utilisée par le fournisseur d'IA. Il attend maintenant l'Assemblée nationale.

Deux jugements européens disent l'inverse l'un de l'autre. La justice britannique a rejeté l'essentiel des demandes de Getty Images contre Stability AI, au motif que les modèles ne contenaient aucune copie d'œuvre. Le tribunal de Munich a au contraire donné raison à la GEMA contre OpenAI : mémoriser des paroles de chansons dans un modèle, c'est une reproduction. OpenAI a fait appel. Les deux dossiers sont déjà traités dans notre comparatif Europe contre États-Unis sur la régulation de l'IA, nous ne les reprenons pas ici.

Ce que tu peux exiger dans tes contrats

La faillite de Spirit Airlines a exposé un cas que peu de dirigeants imaginent. Quand ses actifs ont été mis en vente, Google a raflé le lot de données internes pour 10 millions de dollars, face à une offre à 7,5 millions. Le lot comprend 100 millions d'e-mails, 500 millions de messages internes, des documents RH et financiers. Google promet de retirer les données personnelles par un prestataire tiers.

Le syndicat des hôtesses de l'air s'y oppose : maintenir la cohérence de l'ensemble permettrait, selon lui, de réidentifier des personnes malgré l'anonymisation annoncée. Une start-up a depuis annoncé son intention de surenchérir à 12,5 millions de dollars. À ce jour, aucune décision n'est intervenue.

Ce dossier montre ce qu'une faillite, une cession ou un simple changement de fournisseur peut faire de tes propres données si ton contrat ne l'interdit pas explicitement. Trois clauses méritent d'être négociées, sans jargon d'avocat :

  • interdiction d'entraînement sans accord écrit : ton fournisseur ne peut pas utiliser tes données pour entraîner ou améliorer un modèle sans une acceptation explicite de ta part, jamais une case cochée par défaut ;
  • restitution puis suppression à la résiliation : à la fin du contrat, tu récupères tes données, puis le fournisseur les supprime avec une attestation écrite, y compris les copies dérivées ou les versions transformées ;
  • données non cessibles sans ton accord : en cas de faillite, de cession ou de changement de contrôle du fournisseur, tes données ne font pas partie des actifs vendables sans ton autorisation préalable.

Le règlement européen sur les données t'aide à récupérer et transférer tes données chez un autre fournisseur. Il n'interdit pas à ton fournisseur de les utiliser pour entraîner un modèle : cette interdiction relève du contrat que tu signes et du RGPD dès qu'il y a des données personnelles. Cette section n'est pas un conseil juridique : fais relire tes clauses par ton avocat avant signature.

Ce que tu tapes dans un outil d'IA

Une seule question mérite d'être posée ici : le texte que tu écris dans un outil d'IA sert-il à entraîner le modèle ? Le mathématicien Tristan Buckmaster a versé tous les brouillons de son projet dans Codex, l'outil de programmation d'OpenAI. Début septembre, OpenAI lui annonce qu'un de ses modèles internes a démontré un résultat sur les équations de Navier-Stokes. Buckmaster y reconnaît la voie même qu'il explorait avec son collaborateur, une lecture qu'il présente lui-même comme son interprétation. On lui assure que le modèle n'a pas consulté de données d'utilisateurs. Sur l'entraînement, sa déclaration est sans ambiguïté : « J'ai redemandé, mais je n'ai pas eu de réponse. » Il ajoute toutefois : « Je ne sais pas si nos données ont été utilisées, je n'accuse personne de rien. » Il pose une question, il ne formule pas d'accusation.

OpenAI a répondu sans trancher : « Bien que ce soit peu probable, nous ne pouvons pas exclure que des données dé-identifiées issues de leur usage de nos produits aient contribué à améliorer nos modèles. » Un autre chercheur a soulevé la même question pour ses propres conversations. Vingt-cinq lauréats de la médaille Fields, dont Terence Tao et Cédric Villani, ont signé une déclaration sur les questions d'attribution et de plagiat, sans accuser personne sur l'entraînement.

Les trois fournisseurs ne traitent pas de la même façon une conversation personnelle et une conversation professionnelle. Le tableau ci-dessous détaille chaque cas.

Tes réglages

Choisis ton outil et ton offre.

Fournisseur
Offre

Politiques publiées par les éditeurs, vérifiées le 23 septembre 2026. Elles changent souvent : revérifie avant de t'y fier.

Le reste des questions contractuelles, notamment la sous-traitance des données personnelles et les transferts hors Union européenne, est déjà traité dans notre décryptage sur l'IA et les données comptables. Nous ne le reprenons pas ici pour ne pas refaire le même travail deux fois.

L'oeil de Shift IA : le procès se joue au tribunal, le contrat se joue dans l'ombre

Nous allons être directs : la bataille judiciaire américaine sur le droit d'auteur occupe toute la place médiatique, mais elle ne couvre qu'une partie du problème.

L'accord validé entre Anthropic et le collectif d'auteurs règle une seule affaire sur des dizaines en cours devant les tribunaux américains. L'audience sur la vente des données de Spirit Airlines n'a débouché sur aucune décision publique. La Cour de justice de l'Union européenne doit encore trancher sa toute première affaire d'IA générative, dont l'avis attendu de l'avocat général n'a pas été publié : l'affaire ne figure pas parmi les conclusions lues par la Cour.

Nous en tirons une conclusion tranchée. Le rapport de force ne se joue pas uniquement devant les tribunaux, il se joue aussi, discrètement, dans les clauses de tes propres contrats fournisseurs. Le terrain de la publication est déjà balisé : le droit européen te donne la réservation de tes droits et, désormais, le blocage côté serveur pratiqué par Cloudflare. Le terrain contractuel, lui, reste largement laissé à la bonne volonté du fournisseur tant qu'aucune clause explicite ne l'encadre. La faillite de Spirit Airlines l'a montré crûment : sans clause qui interdit leur cession, des millions d'e-mails et de messages internes peuvent changer de propriétaire au même titre qu'un serveur ou un stock.

Notre recommandation est simple à mettre en œuvre. Une PME qui relit ses conditions générales avant de signer et qui négocie les trois clauses détaillées plus haut change concrètement son exposition. Elle n'a besoin ni d'attendre l'arrêt de la Cour de justice européenne ni l'issue des procès américains pour agir : ces leviers contractuels dépendent d'elle seule, aujourd'hui.

Les points clés

Le règlement Anthropic-auteurs est le plus élevé connu à ce jour dans ce type d'affaire. 1,5 milliard de dollars, soit environ 3 000 dollars par œuvre, homologués le 20 juillet 2026 pour des livres issus de Library Genesis et Pirate Library Mirror.

Le silence vaut accord tant que tu n'as pas activé de retrait explicite. Twitch entraîne l'IA d'Amazon avec les flux de ses streamers par défaut. Les comptes grand public d'OpenAI ou de Mistral suivent la même logique.

Le blocage doit désormais se faire au niveau du serveur, pas seulement dans le robots.txt. Depuis le 15 septembre 2026, Cloudflare bloque par défaut les robots d'entraînement sur les pages qui affichent de la publicité, pour les nouveaux domaines et les comptes gratuits.

La faillite de Spirit Airlines a montré que tes données internes peuvent être vendues comme un actif. Google a remporté pour 10 millions de dollars un lot de 100 millions d'e-mails, 500 millions de messages Teams et des documents RH et financiers.

Les politiques par défaut sur ce que tu tapes dans un outil d'IA varient fortement d'un fournisseur à l'autre. Les comptes grand public d'OpenAI et de Mistral entrent par défaut dans l'entraînement, alors qu'Anthropic exige un choix explicite depuis le 28 août 2025.

Ce décryptage laisse volontairement de côté deux dossiers sans lien avec les données d'entraînement. Le premier est le litige qui oppose Anthropic au Pentagone, qui porte sur une étiquette de risque pour la sécurité nationale. Le second est la sanction de 5 000 dollars infligée à un avocat du Nouveau-Mexique pour des témoins et des témoignages inventés par ChatGPT, qui relève des hallucinations. Les données RH et salariales, ainsi que la protection juridique des contenus générés par une IA, sont des sujets distincts à traiter séparément.

Texte relu, corrigé et amendé avec l'aide de Claude Code

Le chiffre choc
1,5 milliard $
montant de l'accord homologué entre Anthropic et des auteurs américains Tribunal fédéral N.D. Cal., juillet 2026
10 millions $ prix payé par Google pour les données internes de Spirit Airlines (100 M d'e-mails, 500 M de messages Teams) CNN Business, août 2026
183 000 livres taille du jeu de données Books3 issu d'ouvrages piratés, que l'assignation contre Meta en France ciblerait selon l'AFP The Atlantic, 2023
15 M€ ou 3 % sanction maximale que l'AI Office peut infliger depuis le 2 août 2026 pour non-respect du résumé public des contenus d'entraînement AI Act, art. 53, Commission européenne
150 000 $ montant réclamé par œuvre par des éditeurs musicaux contre Anthropic, pas encore accordé par un tribunal Reuters, janvier 2026

Ce qu'il faut retenir

L'accord de 1,5 milliard de dollars homologué le 20 juillet 2026 entre Anthropic et des auteurs, soit environ 3 000 dollars par livre, fixe un premier prix aux contenus utilisés sans autorisation pour entraîner une IA, mais il ne protège en rien les données qu'une entreprise confie à ses fournisseurs.

Sources

Vocabulaire utile

Réservation TDM (opt-out)

Mécanisme prévu par l'article 4 de la directive européenne 2019/790 qui permet à un titulaire de droits de s'opposer à l'utilisation de ses contenus pour la fouille de textes et de données, par un procédé lisible par une machine comme le protocole TDMRep.

Résumé des contenus d'entraînement

Document public que l'AI Act oblige un fournisseur de modèle à usage général à publier, décrivant les catégories de contenus utilisées pour l'entraînement de son modèle.

Clause de non-entraînement

Clause contractuelle qui interdit explicitement à un fournisseur d'utiliser les données d'un client pour entraîner ou améliorer un modèle d'IA, sauf accord écrit préalable.

Opt-out entraînement

Option de confidentialité qui permet de refuser que ses conversations avec une IA soient utilisées pour améliorer les modèles futurs. Sur ChatGPT, cette option est désactivée par défaut et doit être activée manuellement dans les paramètres.

Questions fréquentes

01 Comment savoir si mes contenus publiés en ligne ont servi à entraîner une IA ?

Aucun outil ne te donne cette certitude aujourd'hui. Depuis le 2 août 2025, l'AI Act oblige les fournisseurs de nouveaux modèles à usage général à publier eux-mêmes un résumé de leurs contenus d'entraînement (au 2 août 2027 pour les modèles plus anciens). Ce résumé décrit des catégories et des sources, pas une liste d'œuvres. Tu peux aussi réserver tes droits via le protocole TDMRep : ce refus lisible par machine, le fournisseur doit ensuite le respecter pour tes contenus futurs, sans pouvoir invoquer l'exception de fouille.

02 Le Data Act m'autorise-t-il à interdire l'entraînement d'une IA sur mes données ?

Non. Le règlement européen sur les données (Data Act, applicable depuis le 12 septembre 2025) organise la récupération et la portabilité de tes données chez un fournisseur, pas l'interdiction de les utiliser pour entraîner un modèle. Cette interdiction doit être écrite dans ton contrat. Elle s'appuie aussi sur le RGPD (article 28) dès que des données personnelles sont concernées.

03 Que dois-je exiger dans un contrat avec un fournisseur d'IA pour protéger mes données internes ?

Trois clauses concrètes : une interdiction d'utiliser tes données pour entraîner ou améliorer un modèle sans ton accord écrit, la restitution puis la suppression de tes données à la résiliation avec une attestation, ainsi que l'exclusion de tes données des actifs cessibles en cas de faillite ou de changement de contrôle du fournisseur.

04 Ce que je tape dans ChatGPT ou Claude sert-il à entraîner le modèle ?

Cela dépend de l'offre. Chez OpenAI, les comptes grand public alimentent l'entraînement sauf désactivation manuelle, tandis que Business, Enterprise, Edu et l'API en sont exclus par défaut. Chez Anthropic, Free, Pro et Max demandent un choix explicite depuis août 2025, tandis que Team, Enterprise et l'API restent exclus par défaut.