IA et droit d’auteur : plus de débats que de clarté
Simon Geiregat
Le Prof. Dr. Simon Geiregat est maître de conférences à l’université de Gand et à l’université de Tilburg. Il est spécialisé dans les droits de propriété intellectuelle. Son expertise porte principalement sur le droit d’auteur, les droits voisins et le droit des marques, avec un intérêt particulier pour l’impact de la numérisation et de l’intelligence artificielle sur le droit privé. Outre ses activités académiques de recherche et d’enseignement, il est expert auprès de la VAIA, l’Académie flamande de l’IA, et un conférencier très demandé sur les questions juridiques d’actualité liées à l’IA, aux données et à la propriété intellectuelle.
Changement de paradigme : de l’output vers l’input
En 2024, lors de notre entretien avec Dirk Visser, de nombreuses questions relatives au droit d’auteur dans le cadre de l’IA générative restaient en suspens. À la question : avons-nous aujourd’hui plus de repères juridiques concernant l’IA générative et le droit d’auteur ? Simon Geiregat répond sans détour : « Non. Tout est encore aussi incertain qu’il y a deux ans. » La jurisprudence fait son apparition. « De nombreuses affaires sont en cours, notamment aux États-Unis, mais il faudra encore attendre quelques années avant d’y voir clair. »
Une chose se dégage toutefois déjà : le débat change de perspective. Alors que l’output était au cœur des premiers questionnements (qui est l’auteur de ce qui est créé grâce à l’IA ?), aujourd’hui, c’est l’input (livres, articles et photos utilisés pour entraîner les modèles d’IA) qui monopolise l’attention.
L’AI Act apporte davantage de transparence, mais, selon Simon Geiregat, il ne modifie pas fondamentalement les règles en matière de droit d’auteur. « Les nouvelles technologies ne nécessitent pas automatiquement une nouvelle législation. Avec l’AI Act, le législateur européen a fait ce qu’il devait faire. La question de l’autorisation de l’AI-training doit être tranchée dans le cadre du droit d’auteur déjà en vigueur. »
C’est dans ce contexte qu’intervient l’exception européenne relative à la fouille de textes et de données (TDM). Celle-ci permet, sous certaines conditions, d’analyser de manière automatisée des contenus protégés, les ayants droit pouvant, dans certains cas, s’y opposer par le biais d’un opt-out. Cette réglementation date toutefois d’avant l’essor de l’IA générative. « Le concept de fouille de textes et de données existe depuis les années 90. À l’origine, il visait des applications telles que les statistiques Web et la recherche médicale. » Nous ne savons pas encore si cette exception s’applique également à l’entraînement des IA génératives. « C’est à la Cour de justice qu’il appartiendra de trancher cette question, mais pour l’instant, rien n’est sûr », a déclaré Simon Geiregat, en faisant référence à l’affaire Like Company contre Google Ireland en cours.
Trois zones d’ombre dans le débat sur l’IA
Outre le débat sur l’entraînement de l’IA, Simon Geiregat identifie trois autres questions de droit d’auteur moins médiatisées.
La première est étonnamment pratique : comment prouver que vous n’avez pas utilisé d’IA ? « Grâce à l’IA, on peut créer l’esquisse d’un tableau, puis sortir les pinceaux. Le résultat final ne donne pas forcément à voir quels choix créatifs ont été faits par un être humain. » Son conseil aux artistes et créatifs est donc clair : documentez le processus de création. Les croquis et les versions ‘in progress’ peuvent aider, a posteriori, à démontrer la genèse d’une œuvre.
Un deuxième aspect souvent négligé concerne les droits voisins. Ceux-ci peuvent offrir une protection aux contenus audio et vidéo générés par l’IA là où le droit d’auteur classique ne pourrait pas le faire. « En ce qui concerne les extraits audio ou les vidéos générés par l’IA, la question de la protection au titre du droit d’auteur n’est pas pertinente : une protection au titre des droits voisins s’applique de toute façon, depuis au moins cinquante ans. » Pour le texte et les images, ce filet de sécurité n’existe pas. « Cette question est sur la table, mais très peu abordée. »
Enfin, il y a les droits moraux. Alors que le débat sur l’IA porte principalement sur les droits patrimoniaux et l’entraînement des modèles, le droit à la mention du nom de l’auteur et le droit à l’intégrité d’une œuvre sont bien moins populaires. « Ces droits moraux sont pourtant très intéressants. Si un système d’IA tronque un texte ou en déforme le sens, ils vous donnent un argument de poids pour vous y opposer. Or, on n’y pense trop rarement. »
La personne qui écrit a son importance
Outre la question de savoir qui est autorisé à reproduire un texte, l’identité de l’auteur est également importante. Simon Geiregat insiste, connaître l’identité de la personne qui a rédigé un texte influe sur la lecture et le poids d’un point de vue, a fortiori juridique.
« Un avocat qui représente un client présente ses arguments sous un angle différent de celui d’un professeur qui n’est pas impliqué dans l’affaire. Le droit est une discipline argumentative. Il faut donc savoir qui a écrit quoi et depuis quelle position. »
C’est précisément cette visibilité qui est remise en cause dans le cas des outils d’IA générative. « Je crains que les noms des auteurs perdent leur réputation dans ce genre de systèmes d’IA. Et un auteur qui choisit de ne pas autoriser ces outils à traiter ses textes risque, à son tour, de devenir invisible. C’est le même paradoxe qu’avec Google : si vous n’êtes pas référencé, c’est comme si vous n’existiez pas, pour une grande partie du monde. »
C’est précisément pour cette raison qu’il est et reste essentiel qu’une réponse générée par l’IA puisse être rattachée à son auteur et à sa source d’origine.
Qui veille à la qualité ?
Pour pouvoir vérifier ses sources, il faut également un filtre de qualité. Selon Simon Geiregat, les éditeurs juridiques ont un rôle important à jouer, comparable à celui du journaliste professionnel.
« Face à la montée en puissance des fake news, les médias traditionnels restent d’essentiels garants de la qualité et de la vérité. La même logique s’applique aux éditeurs juridiques : leur rôle évolue, mais ce contrôle de la qualité reste absolument indispensable. Si les modèles d’IA n’indexent que des blogs publics et des sources internet non vérifiées, leur fiabilité s’en trouve sérieusement compromise. »
Néanmoins, une base de connaissances de qualité ne fait pas tout. Même au sein de sources fiables, il peut y avoir un biais de consensus, l’IA ayant tendance à accorder plus d’importance à l’opinion la plus répandue. « L’aspect humain reste essentiel. » Supposons que deux auteurs défendent le point de vue A et qu’un seul auteur défende le point de vue B. Dans ce cas, un système d’IA doit mettre en évidence ces différentes visions, au lieu de présenter automatiquement le point de vue dominant comme la bonne réponse. L’opinion minoritaire pourrait très bien être la plus solide sur le plan juridique. »
C’est là que réside l’intérêt d’un contenu juridique vérifié : non seulement dans la qualité des sources, mais aussi dans le fait de mettre en évidence les différents auteurs et arguments avancés.
L’auteur reste la référence
Deux ans après notre entretien avec Dirk Visser, les questions relatives au droit d’auteur dans le contexte de l’IA sont toujours d’actualité. Et elles deviennent plus concrètes. Pour les professionnels du droit, il devient donc de plus en plus important de savoir ce qui se cache derrière une réponse générée par l’IA : qui a créé ces informations, sur quelles sources et quels arguments s’appuient-elles, et comment leur qualité a-t-elle été contrôlée
L’IA permet d’accéder plus rapidement aux connaissances juridiques, mais cela ne rend pas pour autant l’auteur, la source et le contrôle de qualité moins importants. Au contraire : ces éléments déterminent le degré de confiance que mérite une réponse générée par l’IA. La véritable valeur ajoutée apparaît lorsque la technologie est associée à un contenu juridique fiable et à l’expertise humaine, de sorte que les sources et le raisonnement qui sous-tendent la réponse restent visibles et vérifiables.
Questions fréquemment posées
L’entraînement des modèles d’IA relève-t-il de l’exception relative à la fouille de textes et de données ?
La question est en suspens. L’exception TDM est antérieure à l’essor de l’IA générative et avait initialement été conçue pour des applications telles que les statistiques Web et la recherche médicale. Dans l’affaire Like Company contre Google Ireland, la Cour de justice doit se prononcer sur l’application de cette exception à l’entraînement de l’IA.
Qui est l’auteur d’un contenu généré par l’IA ?
Il n’y a pas encore de sécurité juridique à ce sujet. La question n’est plus qui est l’auteur des résultats générés par l’IA, mais si l’utilisation de contenus protégés pour l’entraînement de l’IA est autorisée. Ces deux questions doivent trouver une réponse dans le cadre du droit d’auteur déjà en vigueur. L’AI Act ne modifie pas fondamentalement les règles du jeu.
Les œuvres audio et vidéo générées par l’IA bénéficient-elles de la protection du droit d’auteur ?
C’est souvent le cas, par le biais des droits voisins, même lorsque le droit d’auteur classique ne s’applique pas. Les extraits audio et les vidéos générés par l’IA bénéficient de toute façon d’une protection au titre des droits voisins depuis au moins cinquante ans. Pour le texte et les images, ce filet de sécurité n’existe pas.
Comment prouver qu’une œuvre a été créée sans recourir à l’IA ?
En documentant le processus de création. Le résultat final ne révèle pas nécessairement les choix créatifs opérés par un être humain, en particulier lorsque l’IA n’a servi que d’aide à la conception. Les croquis et les versions ‘in progress’ peuvent aider, a posteriori, à démontrer la genèse d’une œuvre.
Les droits moraux prennent-ils de l’importance dans le débat sur l’IA ?
Oui, et ils sont encore trop souvent négligés. Alors que le débat porte principalement sur les droits patrimoniaux et l’entraînement des modèles, le droit à la mention du nom de l’auteur et le droit à l’intégrité constituent des arguments de poids lorsqu’un système d’IA tronque un texte ou en déforme le sens.