Extracting Training Data from Large Language Models

Item

Titre (article, livre complet, chapitre de livre, publication réseaux sociaux, pageWeb, SiteWeb complet, etc.)
Extracting Training Data from Large Language Models
Auteur de la référence bibliograpique
Nicholas Carlini, Florian Tramèr, Eric Wallace, Matthew Jagielski, Ariel Herbert-Voss, Katherine Lee, Adam Roberts, Tom Brown, Dawn Song, Úlfar Erlingsson, Alina Oprea, Colin Raffel
Date de publication (AAAA ou AAAA-MM-JJ)
2021-08
Résumé
Cet article démontre que les grands modèles de langue mémorisent et divulguent des exemples individuels de leurs données d'entraînement, et que ces exemples peuvent être extraits par simple interrogation du modèle.

Les auteur·rices partent d'une croyance répandue qu'ils entendent défaire. La fuite de renseignements est habituellement associée au surapprentissage, c'est-à-dire à l'écart entre l'erreur d'entraînement et l'erreur de test. Comme les grands modèles sont entraînés sur d'immenses corpus dédoublonnés, souvent en une seule époque, ils ne présentent guère de surapprentissage, d'où l'idée qu'ils ne mémoriseraient aucun exemple en particulier. L'article établit le contraire : même sans surapprentissage moyen, certains exemples d'entraînement présentent des pertes anormalement basses et sont effectivement mémorisés.

Les auteur·rices proposent une définition mesurable. Une chaîne est mémorisée de façon eidétique au rang k lorsqu'elle peut être extraite du modèle et qu'elle apparaît dans au plus k exemples des données d'entraînement. La mémorisation est d'autant plus forte que k est petit. Cette définition permet de traiter la mémorisation comme un continuum : retenir l'orthographe d'un mot courant est sans gravité, retenir le nom et le numéro de téléphone d'une personne qui n'apparaissent que dans quelques documents constitue une atteinte à la vie privée.

L'attaque procède en deux temps. Un grand nombre d'échantillons est d'abord généré selon trois stratégies d'échantillonnage, dont l'une consiste à amorcer le modèle avec des extraits collectés sur le web. Ces échantillons sont ensuite triés selon six métriques qui estiment leur vraisemblance en la comparant à celle d'un modèle de référence, de façon à repérer ceux dont la vraisemblance est anormalement élevée.

Sur 1 800 échantillons retenus pour examen manuel, 604 se révèlent être des extraits mot pour mot des données d'entraînement, soit un taux de réussite global de 33,5 %, et de 67 % pour la meilleure configuration. Les contenus mémorisés comprennent des articles de presse, des journaux d'erreurs, des licences, des adresses web valides, du code source, des textes religieux, ainsi que des renseignements permettant d'identifier des personnes : 78 exemples de noms, numéros de téléphone, adresses et comptes de médias sociaux. Certains éléments à forte entropie, notamment des identifiants uniques, ne figurent que dans un seul document d'entraînement.

Deux résultats structurent la conclusion. D'abord, les modèles plus grands mémorisent davantage : dans une expérience contrôlée, le modèle à 1,5 milliard de paramètres restitue toutes les adresses insérées au moins 33 fois, le modèle à 345 millions la moitié, et le modèle à 117 millions aucune. Ensuite, la mémorisation dépend fortement du contexte : la même chaîne se restitue ou non selon l'amorce fournie, de sorte que les auteur·rices estiment sous-évaluer largement la quantité réelle de contenu mémorisé.

L'article examine enfin les stratégies d'atténuation. L'entraînement différentiellement privé offre des garanties théoriques solides, mais les auteur·rices signalent qu'il réduit généralement l'exactitude parce qu'il empêche les modèles de capter les queues longues de la distribution des données, et qu'il allonge les temps d'entraînement. Ils recommandent également un dédoublonnage plus fin que celui pratiqué au niveau du document, une sélection soignée des sources, et l'audit systématique des modèles pour mesurer empiriquement le degré de protection qu'ils offrent.
Maison d'édition / Nom de la revue scientifique / Nom du site Web / Nom de l'institution universitaire (thèses) / Institution d'un rapport, etc.
USENIX Association
Nom de l'événement (colloque, journée d'études, etc.)
30th USENIX Security Symposium, 11 au 13 août 2021
Titre du livre (pour chapitre de livre)
Proceedings of the 30th USENIX Security Symposium
Intervalles des pages (articles)
2633-2650
Nombre de pages (livres)
18
Format, type de document (ex: image, publication textuelle, vidéo, etc.)
Article en ligne, PDF
Quel type de publication sur réseau social (ex: statut Facebook, statut Twitter, etc.)
Communication de colloque
a comme concept
978-1-939133-24-3

Linked resources

Items with "contenu scientifique: Extracting Training Data from Large Language Models"
Title Class
RAISE Health Symposium 2025

Annotations

There are no annotations for this resource.