⚡ L’essentiel
Sur 24 résumés de conformité AI Act examinés, 21 ne nomment aucun site web spécifique dans la rubrique prévue pour lister les sources d’entraînement. Les fournisseurs comme Ant Group (11 résumés) utilisent des catégories génériques, rendant impossible pour les éditeurs de vérifier si leurs contenus ont été collectés. Cette pratique, révélée par Actu IA, crée une zone grise juridique qui pourrait vider de sa substance l’obligation de transparence du règlement européen.
Une transparence en trompe-l’œil
Le formulaire officiel de la Commission européenne ne laisse pourtant place à aucune ambiguïté : les fournisseurs de modèles d’IA à usage général doivent indiquer « la liste des principaux domaines moissonnés » pour entraîner leurs systèmes. Pourtant, selon une analyse d’Actu IA publiée le 25 septembre 2026, 21 résumés sur 24 contournent cette exigence en fournissant des catégories génériques plutôt que des noms de sites concrets.
Concrètement, au lieu de lire « lemonde.fr, wikipedia.org, reddit.com », les éditeurs découvrent des formulations évasives comme « sites d’actualités, encyclopédies en ligne, forums de discussion ». C’est comme si quelqu’un vous disait avoir acheté « des fruits dans des commerces » au lieu de préciser « des pommes chez Carrefour ». La différence ? Impossible de vérifier si vos contenus ont été utilisés sans autorisation.
Ant Group et DeepSeek en première ligne
L’analyse porte sur sept fournisseurs de modèles d’IA, dont deux sont nommément identifiés. Ant Group, la filiale technologique du géant chinois Alibaba, a publié à elle seule 11 résumés le 24 septembre 2026 – tous adoptant cette stratégie d’opacité sélective. Le timing interpelle : cette publication groupée suggère une coordination, voire une observation préalable des pratiques concurrentes pour adopter le niveau minimal de conformité acceptable.
Cas encore plus problématique : DeepSeek, autre acteur chinois, a soumis trois documents qui omettent complètement cette rubrique. Pas de catégories génériques, pas de liste – rien. Cette absence totale pourrait refléter une différence culturelle et juridique sur la notion même de propriété intellectuelle des données web, concept moins ancré dans le cadre réglementaire chinois.
Un angle mort technique et juridique
Cette situation révèle un problème plus profond que la simple mauvaise volonté. Selon les experts, les systèmes de collecte automatisée sont devenus si massifs et complexes que les entreprises ont peut-être réellement perdu la traçabilité précise de leurs sources. Quand un modèle est entraîné sur des milliards de pages web collectées par des robots pendant des années, maintenir une liste exhaustive et à jour devient un défi technique considérable.
Cette hypothèse soulève une question dérangeante : l’AI Act a-t-il été conçu en partant du principe que les fournisseurs savaient exactement ce qu’ils avaient collecté ? Si tel est le cas, le règlement pourrait exiger quelque chose de techniquement impossible sans refonte complète des architectures de collecte de données. Ce n’est plus seulement un problème de transparence, mais d’infrastructure technique.
Conséquences pour l’écosystème du contenu
Pour les éditeurs de presse, blogueurs, photographes et autres créateurs de contenus en ligne, cette opacité a des implications concrètes et immédiates. Impossible de vérifier si vos articles, images ou vidéos ont été utilisés pour entraîner une IA. Impossible donc de négocier une compensation, d’exercer un droit d’opposition, ou même de déposer une plainte ciblée.
Cette situation crée ce que certains analystes appellent un « marché de l’incertitude ». Paradoxalement, elle pourrait favoriser l’émergence d’accords globaux de type « blanket licenses » : plutôt que de négocier au cas par cas, les fournisseurs d’IA paieraient une redevance générale redistribuée ensuite aux créateurs de contenus. Un modèle qui rappelle celui des sociétés de gestion collective des droits d’auteur dans la musique, mais appliqué à l’ensemble du web.
Normalisation par le bas ou précédent isolé ?
Le risque majeur identifié par les observateurs : que cette pratique devienne le standard de facto de l’industrie avant même que la Commission européenne n’ait le temps de réagir. Si les premiers acteurs à publier leurs résumés adoptent tous la même stratégie minimaliste, les suivants n’auront aucune incitation à faire mieux. C’est la logique du « nivellement par le bas » : pourquoi être plus transparent que ses concurrents si cela révèle des informations stratégiques ?
Selon l’analyse d’Actu IA, ce constat « porte sur cette rubrique et ne suffit pas à établir une infraction ». Autrement dit : juridiquement, il n’est pas encore certain que cette pratique viole l’AI Act. Tout dépend de l’interprétation de l’expression « liste des principaux domaines moissonnés ». Les fournisseurs peuvent arguer qu’ils ont bien listé des « domaines » – au sens de catégories de sources – même s’ils n’ont pas nommé de sites spécifiques.
Que faire maintenant ?
Plusieurs scénarios se dessinent pour les prochains mois. Scénario 1 – Durcissement : La Commission européenne rejette ces résumés, exige des listes détaillées et impose des amendes. Les fournisseurs doivent alors choisir entre révéler leurs sources ou se retirer du marché européen.
Scénario 2 – Statu quo : La Commission accepte les catégories génériques comme conformes, créant un précédent d’opacité légale. Les contentieux se déplacent alors vers les tribunaux nationaux sur la base du droit d’auteur classique.
Scénario 3 – Compromis : Création d’un système à deux niveaux : divulgation publique par catégories et liste détaillée confidentielle accessible aux autorités et ayants-droit sous accord de non-divulgation. Cette solution protégerait à la fois le secret industriel et les droits des créateurs.
Pour les acteurs concernés, plusieurs actions s’imposent. Les éditeurs et ayants-droit devraient se regrouper pour déposer des demandes formelles d’accès aux informations complètes auprès des fournisseurs d’IA et exiger des clarifications de la Commission. Les développeurs d’IA encore en phase de préparation de leurs résumés feraient bien d’attendre la réaction officielle de Bruxelles avant de soumettre leurs documents. Les investisseurs, quant à eux, doivent intégrer ce risque réglementaire dans leurs valorisations : entre amendes potentielles et obligation future de réentraîner les modèles avec des données licenciées, les coûts pourraient exploser.
Un test pour la régulation européenne
Au-delà du cas spécifique de ces 24 résumés, cette affaire teste la capacité de l’Europe à réguler efficacement les géants technologiques. L’AI Act était présenté comme un modèle d’« effet Bruxelles » : imposer des standards européens qui deviendraient de facto mondiaux, comme ce fut le cas avec le RGPD pour la protection des données.
Mais la situation actuelle révèle les limites de cette ambition. Comment contraindre des acteurs non-européens comme Ant Group ou DeepSeek à respecter des normes qui n’existent pas dans leurs juridictions d’origine ? Comment vérifier la conformité sans capacité d’audit technique approfondi ? Comment éviter que les entreprises ne jouent sur les ambiguïtés rédactionnelles pour vider les obligations de leur substance ?
La réponse de la Commission européenne dans les prochains mois sera déterminante. Si elle laisse passer cette interprétation minimaliste, l’AI Act risque de rejoindre la longue liste des réglementations ambitieuses sur le papier mais inefficaces dans la pratique. Si elle durcit le ton, elle devra assumer un bras de fer avec des acteurs qui peuvent menacer de limiter leurs services en Europe – un risque politique et économique non négligeable.
Conclusion : transparence ou secret industriel ?
Cette affaire cristallise une tension fondamentale de l’ère numérique : jusqu’où peut-on exiger la transparence sans tuer l’innovation ? Les fournisseurs d’IA arguent que révéler précisément leurs sources d’entraînement reviendrait à divulguer leur « recette secrète », donnant un avantage décisif aux concurrents. Les créateurs de contenus rétorquent qu’on ne peut pas bâtir des empires commerciaux sur le dos de leur travail sans compensation ni même reconnaissance.
La solution passera probablement par un compromis, mais lequel ? Et surtout, qui aura le pouvoir de l’imposer : les régulateurs européens, les tribunaux, ou les acteurs eux-mêmes par des accords volontaires ? Une chose est certaine : les 21 résumés opaques d’aujourd’hui préfigurent les batailles juridiques de demain. Le web que nous connaissons – ouvert, librement accessible aux robots d’indexation – pourrait bien être en train de muter vers un écosystème de contenus licenciés, de paywalls anti-IA et de batailles juridiques permanentes. Reste à savoir si c’est un progrès ou une régression.





