Divulgation des données d'entraînement de l'IA

Titre complet:
Loi CLEAR

Résumé#

Ce projet de loi (la Loi CLEAR) obligerait les personnes qui utilisent des ensembles de données d'entraînement pour construire ou publier des modèles d'intelligence artificielle générative (IA) à déposer un avis auprès du Registre des droits d'auteur énumérant les œuvres protégées par le droit d'auteur utilisées dans cet ensemble de données. L'avis doit inclure un résumé détaillé de chaque œuvre protégée par le droit d'auteur et, si l'ensemble de données est disponible publiquement, l'URL de l'ensemble de données. Le projet de loi crée une base de données en ligne publique de ces avis, donne aux propriétaires de droits d'auteur un droit privé de poursuivre en cas de non-dépôt, et fixe des pénalités civiles et d'autres recours.

  • Changement principal : Quiconque utilise un ensemble de données d'entraînement pour entraîner ou publier un modèle d'IA générative doit déposer un avis auprès du Bureau des droits d'auteur décrivant les œuvres protégées par le droit d'auteur dans l'ensemble de données.
  • Calendrier : Pour les modèles utilisés ou publiés pour la première fois à partir de la date d'entrée en vigueur de la loi, l'avis doit être déposé au moins 30 jours avant l'utilisation ou la publication commerciale (l'utilisation commerciale inclut l'utilisation interne au sein de l'organisation). Pour les modèles déjà en usage avant l'entrée en vigueur de la loi, les avis doivent être déposés dans les 30 jours suivant l'émission des règles d'application par le Registre. La loi entre en vigueur 180 jours après son adoption.
  • Application : Les propriétaires de droits d'auteur peuvent poursuivre les utilisateurs qui ne déposent pas. Les tribunaux peuvent imposer une pénalité civile d'au moins 5 000 $ par manquement, ordonner des injonctions arrêtant l'utilisation de l'œuvre jusqu'à ce qu'un avis soit déposé, et accorder des frais d'avocat. Il y a un plafond de 2,5 millions de dollars par personne par an sur le total des pénalités civiles.
  • Base de données publique : Le Bureau des droits d'auteur doit créer et maintenir une base de données en ligne publique de tous les avis déposés.
  • Règlements : Le Registre doit émettre des règles dans les 180 jours suivant l'entrée en vigueur de la loi pour établir le formulaire et les procédures de dépôt.

Ce que cela signifie pour vous#

  • Entreprises et développeurs d'IA : Vous devez préparer et déposer un avis qui énumère et résume chaque œuvre protégée par le droit d'auteur dans tout ensemble de données d'entraînement que vous utilisez pour entraîner ou publier un modèle d'IA générative. Si l'ensemble de données est disponible publiquement en ligne, vous devez fournir son URL. Vous devez déposer l'avis au moins 30 jours avant l'utilisation ou la publication commerciale. Ne pas déposer peut entraîner des poursuites, des pénalités, des injonctions et des frais juridiques.
  • Entreprises qui utilisent l'IA en interne : Les utilisations commerciales internes comptent. Si votre organisation utilise un modèle en interne, vous devez tout de même déposer l'avis 30 jours avant cette utilisation commerciale interne.
  • Propriétaires de droits d'auteur (créateurs et titulaires de droits) : Vous obtenez un droit privé de poursuivre les utilisateurs qui ne déposent pas les avis requis. Si vous gagnez, le tribunal peut arrêter l'utilisation contrefaisante et vous accorder des frais d'avocat.
  • Membres du public / chercheurs : Une base de données publique énumérera les avis concernant les œuvres protégées par le droit d'auteur utilisées dans les ensembles de données d'entraînement, ce qui pourrait accroître la transparence sur les sources d'entraînement des modèles.
  • Bureau des droits d'auteur (Registre) : Doit créer des formulaires de dépôt et des règles et gérer une base de données en ligne publique. Le Registre recevra des pénalités civiles payées pour compenser les coûts d'exploitation.
  • Date de début : La loi entre en vigueur 180 jours après son adoption. Les modèles déjà en usage avant cette date ont besoin d'avis après que le Registre ait émis des règlements (dans le calendrier fixé par la loi).

Dépenses#

Aucune information disponible publiquement.

  • Le projet de loi dirige les pénalités civiles payées par les contrevenants vers le Bureau des droits d'auteur pour compenser ses coûts d'exploitation.
  • Le Bureau des droits d'auteur doit créer et maintenir une base de données en ligne publique et rédiger des règles d'application ; ces actions auraient des coûts administratifs (personnel, informatique). Le projet de loi n'inclut pas d'estimation formelle des coûts.
  • Les entreprises feront face à des coûts de conformité : préparation de résumés "suffisamment détaillés", suivi des contenus et des URL des ensembles de données, révision juridique, et éventuellement des retards dans les publications.
  • Les propriétaires de droits d'auteur peuvent encourir des coûts de litige pour faire respecter l'exigence de dépôt ; les plaignants gagnants peuvent récupérer des frais d'avocat.

Point de vue des partisans#

  • Le projet de loi semble destiné à accroître la transparence sur les œuvres protégées par le droit d'auteur utilisées pour entraîner des modèles d'IA générative.
  • Cela pourrait donner aux créateurs un avis plus clair lorsque leurs œuvres enregistrées sont utilisées dans l'entraînement et un moyen de demander des recours si les avis ne sont pas déposés.
  • Une base de données publique pourrait faciliter la tâche du public, des chercheurs et des décideurs pour voir les sources d'entraînement communes et surveiller les pratiques.
  • Les pénalités payées au Bureau des droits d'auteur pourraient aider à couvrir les coûts de fonctionnement du Bureau pour gérer la base de données et traiter les avis.
  • Exiger un avis avant la publication ou l'utilisation commerciale pourrait encourager une meilleure tenue de dossiers et responsabilité de la part des constructeurs de modèles.

Point de vue des opposants#

  • Une préoccupation est le fardeau administratif et le coût : les entreprises doivent préparer des résumés détaillés pour chaque œuvre protégée par le droit d'auteur enregistrée dans un ensemble de données, ce qui pourrait être long et coûteux.
  • Le projet de loi ne définit pas "résumé suffisamment détaillé", donc les normes de conformité ne sont pas claires jusqu'à ce que le Registre émette des règles. Cela crée une incertitude pour les déposants.
  • La date limite de dépôt (30 jours avant l'utilisation ou la publication commerciale) pourrait retarder les lancements de produits ou imposer des frictions opérationnelles, en particulier pour le développement itératif de modèles.
  • L'application dépend des propriétaires de droits d'auteur qui intentent des poursuites, ce qui pourrait entraîner de nombreuses poursuites privées et un risque juridique accru pour les constructeurs de modèles.
  • La définition légale de "œuvre protégée par le droit d'auteur" ne couvre que les œuvres qui sont enregistrées (ou programmées sous une section de code spécifiée), donc les œuvres non enregistrées utilisées dans l'entraînement ne seraient pas couvertes ; cela crée une portée inégale.
  • La publicité des URL des ensembles de données et des résumés peut soulever des préoccupations concernant l'exposition d'ensembles de données propriétaires ou de secrets commerciaux ; le projet de loi ne précise pas de protections pour les informations confidentielles.
  • Il n'est pas clair comment les tribunaux appliqueront la pénalité minimale de 5 000 $ par manquement dans des cas complexes (par exemple, lorsque de nombreuses œuvres sont impliquées), et comment le plafond annuel de 2,5 millions de dollars affectera la dissuasion et les recours.