Pouvoir & systèmes

OpenAI, Google, Anthropic : pompiers pyromanes du scraping

5 min de lecture

OpenAI, Anthropic et Google forment une coalition anti-scraping, alors qu'ils ont construit leurs modèles en scrapant le web entier. Le contorsionnisme est spectaculaire.

La newsletter IA gratuite
OpenAI, Google, Anthropic : pompiers pyromanes du scraping

Le 6 avril 2026, trois entreprises qui se font une guerre commerciale totale ont fait quelque chose d'inhabituel : elles ont formé une coalition de renseignement. OpenAI, Anthropic et Google partagent désormais des informations via le Frontier Model Forum pour détecter ce qu'ils appellent la "distillation adversariale". Autrement dit : des concurrents qui extraient systématiquement les réponses de leurs modèles pour entraîner les leurs sans payer.

Ce qu'ils veulent protéger ? Exactement ce qu'ils ont construit en pillant le reste du web.

Ce qui se passe concrètement

La technique est simple à comprendre. Tu crées 24 000 faux comptes (le chiffre documenté par Anthropic seul). Tu interroges GPT-4 ou Claude des millions de fois. Tu enregistres chaque échange. Tu utilises ensuite cette base de données pour entraîner ton propre modèle, en absorbant des années de RLHF, d'alignement, et de fine-tuning, sans avoir payé un centime, sans avoir obtenu une autorisation.

Anthropic dit avoir documenté 16 millions de ces échanges non autorisés, provenant de trois entreprises chinoises : DeepSeek, Moonshot AI, et MiniMax. L'ordre de grandeur est suffisamment sérieux pour que les trois rivaux américains mettent temporairement leur guerre commerciale en pause.

Le mécanisme de partage ? Le Frontier Model Forum, un organisme créé en 2023 par OpenAI, Anthropic, Google et Microsoft pour "promouvoir la sécurité de l'IA". En pratique, c'est un cartel auto-régulé qui décide lui-même des règles, sans mandat légal externe. Mais on y reviendra.

La contradiction que personne ne nomme

Il y a un détail intéressant dans cette histoire.

Ces mêmes entreprises sont actuellement poursuivies en justice par des journaux (New York Times, Chicago Tribune), des auteurs, des musiciens, et des éditeurs, pour avoir scrapé leurs oeuvres sans permission pour entraîner leurs modèles. Zéro compensation. Zéro autorisation. Juste : "c'est de la recherche, c'est du fair use".

Le New York Times a documenté des milliers de ses articles reproduits presque mot pour mot dans les outputs de GPT-4. La procédure est toujours en cours.

Donc voici la position officielle des Big Three en avril 2026 :

  • Scraper des données d'auteurs humains pour construire des modèles à plusieurs milliards de dollars : fair use, innovation, liberté de la recherche.
  • Scraper les outputs de leurs modèles pour construire des modèles concurrents : vol, violation des CGU, acte hostile nécessitant une réponse coordonnée internationale.

La distinction est juridiquement défendable : les CGU sont des contrats, le copyright des données d'entraînement est une question séparée. Mais moralement, le contorsionnisme est spectaculaire.

Le FMF : l'arbitre qui joue aussi dans l'équipe

Ce qui rend l'histoire encore plus intéressante, c'est la structure choisie pour cette "coalition".

Le Frontier Model Forum n'est pas un régulateur. Ce n'est pas une institution indépendante. C'est un organisme créé et contrôlé par les quatre plus grandes entreprises d'IA au monde, qui s'attribue le rôle d'arbitre de l'accès à l'IA. Aucun mandat démocratique. Aucune supervision externe. Des règles édictées par les bénéficiaires directs.

Le FMF va maintenant partager des "renseignements" sur les acteurs qui tentent de distiller leurs modèles. En pratique : décider qui peut accéder à leurs APIs et qui ne le peut pas. Un bannissement coordonné par trois acteurs qui contrôlent une part massive de l'infrastructure IA mondiale.

Pour les startups européennes ou les chercheurs académiques qui utilisent les APIs de ces trois labs, c'est une information à retenir : les règles d'accès sont désormais décidées par un cartel privé, en fonction de critères géopolitiques autant que contractuels.

L'effet de second ordre qu'on oublie

La réaction immédiate est compréhensible. Si DeepSeek aspire les réponses de Claude pour entraîner son propre modèle, c'est un problème réel, pas seulement éthique, mais concurrentiel. Un modèle entraîné sur les outputs d'un modèle aligné, sans le travail d'alignement, c'est potentiellement dangereux.

Mais les contre-mesures annoncées vont au-delà de la détection des acteurs malveillants. Une API plus fermée, c'est aussi :

  • Des coûts d'accès plus élevés pour les développeurs indépendants
  • Des limites de débit plus strictes pour la recherche académique
  • Une barrière à l'entrée plus haute pour les acteurs non-US

Le résultat pratique : une concentration accrue du pouvoir autour des acteurs qui ont les ressources pour entraîner des modèles sans dépendre des APIs des Big Three.

L'ironie est totale. En réponse à la distillation adversariale, les grands labs vont probablement rendre leurs APIs plus restrictives. Ce qui favorise exactement les acteurs capables de s'en passer (Mistral, des modèles open-source sérieux, Meta). Et qui pénalise les petits joueurs qui construisaient des produits légitimes sur leurs APIs.

Ce que ca dit sur la régulation

Il y a un vide juridique béant ici.

La distillation adversariale à grande échelle n'est, à ce jour, pas illégale dans la plupart des juridictions. C'est une violation des Conditions Générales d'Utilisation : un contrat civil, pas une infraction pénale. Le seul levier actuel reste l'exclusion de l'API et le bannissement des comptes.

Mais si ces techniques permettent effectivement de contourner des années de travail sur la sécurité et l'alignement pour créer des modèles dangereux, alors c'est une question de sécurité nationale, pas juste de propriété intellectuelle. Et une question de sécurité nationale ne peut pas être gérée par un cartel d'entreprises privées qui se régule elles-mêmes.

L'UE a l'AI Act. Les États-Unis ont des mémos non-contraignants et le FMF. Pendant ce temps, la course continue.

Ce qu'il faut retenir

OpenAI, Anthropic et Google se protègent contre exactement ce qu'ils ont fait pour arriver là où ils sont. Ce n'est pas un scoop moral : les entreprises défendent leurs intérêts, c'est leur métier.

Ce qui est intéressant, c'est la structure qu'ils ont choisie pour le faire : un cartel auto-régulé, sans mandat légal, qui prend des décisions avec des conséquences globales sur l'accès à l'IA.

Le FMF n'est pas fait pour garantir un accès juste et sûr à l'IA. Il est juge et partie.


Sources : Bloomberg (6 avr. 2026), The Japan Times (7 avr. 2026), Built In, MIT Technology Review, Euronews

Sujets abordés :

RéglementationOpenAIAnthropic

Questions fréquentes

Qu'est-ce que la distillation adversariale ?
La distillation adversariale consiste à interroger massivement un modèle d'IA via de faux comptes, enregistrer ses réponses, puis utiliser ces données pour entraîner un modèle concurrent. Anthropic a documenté 16 millions d'échanges non autorisés de ce type.
Pourquoi OpenAI, Google et Anthropic forment-ils une coalition anti-scraping ?
Ces trois labs partagent désormais des renseignements via le Frontier Model Forum pour détecter et bloquer les acteurs qui extraient systématiquement leurs outputs pour entraîner des modèles concurrents, notamment des entreprises chinoises.
En quoi cette coalition est-elle contradictoire ?
Ces mêmes entreprises sont poursuivies par des éditeurs et des auteurs pour avoir scrapé leurs oeuvres sans permission pour construire leurs propres modèles. Elles réclament maintenant la protection qu'elles n'ont pas accordée aux créateurs.
Qu'est-ce que le Frontier Model Forum ?
Le Frontier Model Forum est un organisme créé en 2023 par OpenAI, Anthropic, Google et Microsoft. Ce n'est pas un régulateur indépendant : c'est un cartel auto-régulé, sans mandat légal externe, contrôlé par ses membres fondateurs.
Quelles sont les conséquences pour les développeurs indépendants ?
Des APIs plus fermées signifient des coûts d'accès plus élevés, des limites de débit plus strictes pour la recherche académique, et une barrière à l'entrée plus haute pour les acteurs non-américains.
Alexandre Noto

Alexandre Noto

Co-fondateur & Expert Tech

Alexandre est dans la tech depuis plus de 20 ans. Entrepreneur, architecte logiciel et passionné d'intelligence artificielle, il traduit les concepts complexes en explications accessibles. Chez Declic Media, il est la voix technique qui rend l'IA compréhensible pour tous.

Tous les articles de Alexandre →
La newsletter IA gratuite