Anonimizzare prima dell'IA, il gesto che quasi nessuno fa
77%. È la quota di lavoratori che incolla dati aziendali sensibili dentro ChatGPT o in un altro chatbot, secondo la telemetria dei browser raccolta da LayerX nel 2025. Non è una stima da questionario, è la misura di quello che le persone fanno davvero mentre lavorano. Ogni dipendente esegue in media quattordici operazioni di incolla al giorno verso un'interfaccia di IA, e almeno tre contengono informazioni riservate.
Il punto interessante non è il numero in sé, ma dove passa. Non passa da un caricamento di file, che i sistemi aziendali di prevenzione della perdita di dati sanno intercettare. Passa da un copia-incolla dentro una finestra del browser, spesso da un account personale. Nello stesso studio l'82% di quegli incolla arriva da account non gestiti dall'organizzazione. È una falla che non ha bisogno di un attacco per aprirsi, si apre da sola ogni giorno alle nove del mattino. In questo articolo dell'Osservatorio proviamo a spiegare perché anonimizzare un testo prima di darlo a un modello linguistico non è una precauzione da paranoici, è la condizione minima perché quel gesto resti lecito. Si tratta di materiale informativo e divulgativo, non di consulenza legale.
Non è un problema di strumenti, è un problema di gesto
Il quadro diventa più chiaro se metti la telemetria accanto ai comportamenti dichiarati. Lo studio globale condotto nel 2025 dall'Università di Melbourne insieme a KPMG, su 48.340 persone in 47 paesi, racconta un'organizzazione media che ha adottato l'IA molto più in fretta di quanto abbia imparato a governarla.
Il 58% dei dipendenti usa strumenti di IA in modo intenzionale e regolare, ma solo il 47% ha ricevuto una qualche forma di formazione. Il 70% usa strumenti gratuiti e pubblicamente accessibili, mentre appena il 42% usa soluzioni fornite dal datore di lavoro. Quasi la metà di chi usa strumenti pubblici, tra il 48% e il 49%, dichiara di avervi condiviso informazioni aziendali riservate, ovvero dati finanziari, anagrafiche clienti, cifre di vendita. Il 41% dice che la propria organizzazione non ha fornito alcuna indicazione interna sull'uso dell'IA, e il 56% ammette di averla usata al lavoro senza sapere se fosse permesso.
La superficie di rischio, quindi, non sta nel modello. Sta nell'intervallo di tre secondi tra il momento in cui selezioni un verbale e il momento in cui lo incolli in una casella di testo su un server che non è tuo.
La superficie di rischio dell'IA al lavoro. Telemetria reale dei browser e indagini sull'uso non gestito. Fonti LayerX 2025 e Università di Melbourne con KPMG 2025.
Cosa succede quando quel testo esce
Chi obietta che il rischio sia teorico ha smesso di leggere le cronache nel 2023.
A fine luglio 2025 migliaia di conversazioni di ChatGPT sono diventate raggiungibili dai risultati di Google. Non per un attacco, ma per una funzione di condivisione la cui portata gli utenti non avevano capito. Nelle conversazioni indicizzate sono comparsi codici fiscali, curricula, dati bancari, contenuti sanitari e documenti aziendali riservati. OpenAI ha disattivato l'indicizzazione dopo il caso, ma il materiale era già stato scansionato. E non è un episodio isolato, visto che nel gennaio 2025 i ricercatori di Wiz avevano trovato un database di DeepSeek esposto senza autenticazione, con milioni di righe di log contenenti trascrizioni di chat e credenziali interne, e poche settimane dopo la piattaforma OmniGPT aveva perso oltre 30.000 record di utenti con il contenuto integrale delle conversazioni.
C'è poi un rischio più sottile, che riguarda la natura stessa dei modelli. I modelli linguistici possono memorizzare porzioni dei dati su cui sono addestrati e riprodurle in generazione, e la letteratura documenta intere famiglie di attacchi che sfruttano questa proprietà, dalle inferenze di appartenenza fino all'estrazione diretta di informazioni personali con prompt costruiti ad arte. Un dato che entra in un sistema del genere non è un dato che hai prestato. È un dato che hai consegnato, e che quel sistema non sa disimparare.
Un modello non dimentica su richiesta. L'unico dato veramente al sicuro è quello che non gli hai mai dato.
Le regole non ti chiedono di rinunciare all'IA
Qui si tende a fare confusione, come se la conformità fosse un divieto. Non lo è. Sia il GDPR sia l'AI Act ti chiedono la stessa cosa, cioè di non far uscire più dati di quanti ne servano.
Il principio di minimizzazione dell'articolo 5.1.c del GDPR impone che i dati trattati siano adeguati, pertinenti e limitati a quanto necessario. L'articolo 25 aggiunge la protezione fin dalla progettazione e per impostazione predefinita, quindi non basta comportarsi bene, devi organizzare il processo perché il comportamento sbagliato sia difficile. L'articolo 32 chiede misure tecniche adeguate al rischio, e cita esplicitamente la pseudonimizzazione fra queste. Sul versante AI Act, l'articolo 10 pone obblighi di governance dei dati e l'articolo 78 tutela la riservatezza, mentre l'articolo 4 sull'alfabetizzazione resta in vigore anche dopo la riscrittura operata dall'AI Omnibus, come abbiamo raccontato nell'articolo su cosa cambia con il Regolamento (UE) 2026/1744.
Se un verbale ti serve riassunto, al modello serve la struttura del verbale, non il codice fiscale di chi c'era. Togliere quel codice fiscale non è una limitazione del tuo lavoro, è esattamente ciò che la norma intende per necessario.
In Italia il tema è già uscito dalla fase teorica. Con il provvedimento del 30 dicembre 2025 il Garante per la protezione dei dati personali ha approvato il piano ispettivo del primo semestre 2026, circa quaranta ispezioni condotte con il Nucleo speciale privacy della Guardia di Finanza, e tra i settori prioritari ha inserito esplicitamente gli strumenti di intelligenza artificiale utilizzati in ambito scolastico, insieme ai data breach e alle tecniche di anonimizzazione usate dalle società di telecomunicazioni. Se lavori in una scuola, in una pubblica amministrazione o in uno studio professionale, il perimetro dell'osservazione ti comprende già.
Anonimo non vuol dire che hai tolto il nome
Questa è la parte che viene sottovalutata più spesso, e vale la pena essere precisi.
Il GDPR distingue due cose. L'anonimizzazione rimuove o sostituisce i dati identificativi in modo che il collegamento alla persona diventi impossibile, e il risultato esce dal campo di applicazione del regolamento. La pseudonimizzazione, definita dall'articolo 4(5), sostituisce i dati ma conserva altrove la chiave per risalire, quindi resta un trattamento di dati personali. In pratica, da "Mario Rossi vive a Milano" ottieni "[NOME] [COGNOME] vive a [CITTÀ]" se anonimizzi, oppure "Filippo Verdi vive a Roma" se pseudonimizzi.
Il criterio per capire se hai davvero anonimizzato non è il buon senso, sono le tre domande fissate dal Gruppo di lavoro Articolo 29 nel parere 05/2014 e riprese dall'European Data Protection Board. È ancora possibile isolare un individuo dentro il dato? È ancora possibile collegare fra loro record riferiti alla stessa persona? È ancora possibile dedurre informazioni su di lei? Solo se tutte e tre le risposte sono negative il dato può dirsi anonimo. Che la soglia sia alta lo conferma il parere 28/2024 dell'EDPB del 17 dicembre 2024, secondo cui un modello addestrato su dati personali non può mai essere considerato anonimo in assoluto, e la valutazione va fatta caso per caso e documentata.
Che il rischio di re-identificazione non sia accademico lo aveva già mostrato Latanya Sweeney nel 2002, dimostrando che una porzione larghissima della popolazione statunitense era identificabile univocamente con la sola combinazione di CAP, data di nascita e sesso. Da qui una conseguenza pratica. Un'anonimizzazione fatta a mano, in fretta, cercando i nomi con la funzione trova e sostituisci, non è anonimizzazione. È una rassicurazione che ti dai.
I tre criteri cumulativi dell'EDPB per l'anonimato legale ex Considerando 26 GDPR. Fonti Gruppo Articolo 29 Parere 05/2014 ed EDPB Parere 28/2024.
E gli strumenti automatici funzionano?
Fino a poco tempo fa la risposta onesta era "solo in parte". I sistemi basati su espressioni regolari e dizionari individuano bene ciò che ha un formato rigido, come un IBAN o un indirizzo email, e falliscono su tutto il resto, con molti falsi positivi. I modelli di riconoscimento delle entità nominate hanno alzato l'asticella, ma restano fragili di fronte all'ambiguità della lingua naturale. Un approccio ibrido documentato da Mishra e colleghi nel 2025 su documenti finanziari arriva a una precisione del 94,7% e a un richiamo dell'89,4%, valori alti ma con ancora un'entità sensibile su dieci che sfugge.
I modelli linguistici hanno cambiato il quadro, perché portano nel compito ciò che mancava, ovvero la comprensione del contesto. Un modello capisce che in "il dirigente ha convocato Bianchi" c'è un cognome e in "i fogli erano bianchi" no. Una regola scritta a mano no.
Il timore che blocca tutti, ovvero "se tolgo i dati l'IA risponde peggio"
È l'obiezione che si sente più spesso, e merita una risposta con dei numeri, non con una rassicurazione.
Su questo esistono dati sperimentali italiani. La tesi magistrale di K. Prenga, discussa nel 2025 nel corso di laurea magistrale in Human-Centered Artificial Intelligence dell'Università degli Studi di Milano, ha progettato e valutato un sistema che fa esattamente questo, cioè intercetta il testo prima che raggiunga il modello in cloud, lo maschera in locale e poi ripristina i dati reali nella risposta. Il filtro è un modello compatto specializzato su 5.040 esempi distribuiti in sei settori, ovvero sanità, legale, finanza, risorse umane, consulenza e istruzione.
Sul riconoscimento delle entità sensibili l'anonimizzazione ha ottenuto una precisione media del 94,5%, un richiamo del 93,1% e un'accuratezza del 97,4%. La pseudonimizzazione è risultata sistematicamente inferiore, in particolare sul richiamo, fermo all'84,8%, con quasi un'entità su cinque non individuata. Se devi scegliere, mascherare conviene più che sostituire.
Confronto prestazionale tra anonimizzazione con segnaposto e pseudonimizzazione su 5.040 esempi in sei settori. Fonte tesi magistrale di K. Prenga 2025.
Ma il dato che conta di più per chi lavora è l'altro. Le risposte prodotte dal modello in cloud a partire dai prompt anonimizzati, una volta ripristinati i dati reali, sono state confrontate con le risposte agli stessi prompt in chiaro. La somiglianza semantica media è risultata del 92%, senza mai scendere sotto l'89%, e un modello indipendente usato come giudice, su una scala da 1 a 10, ha assegnato 9,67 alle risposte partite da testo mascherato contro 9,81 a quelle partite dal testo originale, senza differenze statisticamente significative.
Valutazione dell'impatto qualitativo dell'anonimizzazione sulle risposte dell'IA. Somiglianza semantica e punteggio del modello giudice. Fonte tesi magistrale di K. Prenga 2025.
Tradotto, il costo in qualità dell'anonimizzazione è vicino allo zero. La ragione è intuitiva. Quando chiedi a un modello di riscrivere un verbale in forma più formale, quello lavora sulla struttura del discorso, non sull'identità delle persone citate. Toglierla non lo disturba.
Cinque regole pratiche da adottare domani
- Considera pubblico tutto ciò che incolli in uno strumento gratuito con account personale, non perché lo sia ma perché non hai modo di dimostrare il contrario.
- Anonimizza prima di inviare, non dopo. La conformità si valuta sul dato che è uscito, non sulle intenzioni.
- Preferisci l'anonimizzazione con segnaposto alla sostituzione con nomi di fantasia, perché è più affidabile e perché il testo mascherato resta riconoscibile come tale.
- Rileggi sempre il testo mascherato. Nessun sistema automatico arriva al 100%, e il controllo critico resta un compito umano.
- Metti per iscritto una regola interna, anche breve. Il 41% dei lavoratori non ne ha nessuna, ed è da lì che nasce la maggior parte dei problemi.
Uno strumento gratuito che fa questo lavoro
Da questa ricerca è nato l'Anonimatizzatore Retoria, un'applicazione desktop per macOS e Windows che mettiamo a disposizione gratuitamente come strumento di pubblica utilità.
Funziona interamente in locale, quindi nessun file e nessun testo lascia il tuo computer per raggiungere un nostro server o quello di terzi. Riconosce automaticamente 23 tipologie di dati personali, dai nomi ai codici fiscali, dagli IBAN alle partite IVA, fino ai dati catastali e ai codici di protocollo. Legge PDF, scansioni cartacee tramite riconoscimento ottico, immagini, file audio di riunioni e lezioni, e può trascrivere e anonimizzare una registrazione dal vivo mentre parli. E fa anche il percorso inverso, cioè quando incolli la risposta prodotta dall'IA rimette al loro posto i nomi e i dati reali, così ottieni il documento finale completo senza aver mai esposto nulla.
È in versione beta e si basa su modelli di intelligenza artificiale, quindi può commettere imprecisioni. Il controllo del testo prima della condivisione spetta sempre a te.
Da dove conviene partire
Uno strumento risolve il gesto, non l'abitudine. Se nella tua organizzazione nessuno sa quali dati non devono uscire, un'app di anonimizzazione sposta il problema di qualche metro e basta. Per questo il nostro lavoro parte sempre dalla diagnosi. L'AI Readiness Report fotografa il livello reale della tua scuola, del tuo ente o della tua azienda, misura dove si concentrano i rischi e ti dice da dove conviene cominciare, con una rilevazione prima e dopo il percorso formativo che ti lascia un documento utile anche per rendicontare fondi pubblici. Scrivici per una valutazione, oppure leggi il nostro manifesto per capire come lavoriamo e la nostra guida ad AI Act e formazione per inquadrare il tema normativo.
Intanto scarica l'Anonimatizzatore e provalo sul primo documento che avresti incollato oggi in un chatbot. È il modo più rapido per capire quanti dati stavi per far uscire senza accorgertene.
Nota metodologica
Questo articolo ha finalità informative e divulgative e non costituisce consulenza legale. Per decisioni specifiche rivolgiti ai tuoi consulenti legali e al tuo Responsabile della protezione dei dati.
I dati sull'uso dell'IA al lavoro provengono da due fonti con metodologie diverse, che vanno lette come complementari e non come confermative l'una dell'altra. Il rapporto LayerX 2025 si basa su telemetria reale dei browser di utenti aziendali e non su questionari, quindi misura comportamenti ma su un campione autoselezionato di organizzazioni clienti, non rappresentativo della popolazione lavorativa. Lo studio Università di Melbourne e KPMG 2025 si basa invece su 48.340 questionari in 47 paesi raccolti tra novembre 2024 e metà gennaio 2025, quindi è più rappresentativo ma misura ciò che le persone dichiarano di fare, con il consueto rischio di sottostima dei comportamenti percepiti come scorretti.
I risultati sperimentali citati provengono dalla tesi magistrale di K. Prenga, corso di laurea magistrale in Human-Centered Artificial Intelligence dell'Università degli Studi di Milano, anno accademico 2024/2025, e vanno letti come validazione di un prototipo dimostrativo, non come verifica di un prodotto in produzione. Il dataset di addestramento e quello di test sono sintetici, generati e controllati da revisione umana, quindi riproducono scenari realistici ma non dati aziendali reali. Il corpus di test è composto da 42 prompt per un totale di 4.225 parole, e i confronti sulla qualità delle risposte si basano su sei gruppi di documenti, quindi con una numerosità ridotta che impone cautela. L'assenza di differenze statisticamente significative fra risposte da testo originale e da testo anonimizzato indica che il test non ha rilevato una degradazione, non dimostra che una degradazione sia impossibile.
Le percentuali di riconoscimento riportate si riferiscono a un modello compatto specializzato su sei domini. Prestazioni su lingue, settori o formati diversi da quelli testati possono variare, e nessun sistema automatico di anonimizzazione oggi disponibile raggiunge la copertura totale.
Fonti
- LayerX, Enterprise AI and SaaS Data Security Report 2025, telemetria dei browser aziendali (2025).
- Gillespie, N., Lockey, S., Ward, T., Macdade, A., Hassed, G., University of Melbourne e KPMG, Trust, attitudes and use of artificial intelligence. A global study 2025, 48.340 rispondenti in 47 paesi (2025).
- European Data Protection Board, Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models, adottato il 17 dicembre 2024.
- Gruppo di lavoro Articolo 29, Parere 05/2014 sulle tecniche di anonimizzazione, WP216 (2014).
- Regolamento (UE) 2016/679, GDPR, in particolare articoli 4(5), 5, 25 e 32.
- Regolamento (UE) 2024/1689, AI Act, in particolare articoli 4, 10 e 78, come modificato dal Regolamento (UE) 2026/1744.
- Garante per la protezione dei dati personali, provvedimento n. 797 del 30 dicembre 2025, piano ispettivo per il primo semestre 2026.
- Garante per la protezione dei dati personali, comunicato stampa del 9 luglio 2026 sulla sanzione a Character Technologies.
- Federprivacy, Conversazioni private di ChatGPT visibili su Google, impatti sul GDPR e rischi di violazioni della privacy (2025).
- Wiz Research, Wiz Research Uncovers Exposed DeepSeek Database (gennaio 2025).
- Surfshark, analisi comparativa sulla raccolta dati delle dieci app di chatbot IA più diffuse (marzo 2025).
- Sweeney, L., k-anonymity. A model for protecting privacy (2002).
- Mishra e altri, approccio ibrido per il rilevamento e l'anonimizzazione di dati personali su documenti finanziari sintetici (2025).
- Prenga, K., Enterprise and personal data protection through anonymization and pseudonymization: a privacy-by-design AI solution in the age of the AI Act, tesi di laurea magistrale in Human-Centered Artificial Intelligence, Università degli Studi di Milano, anno accademico 2024/2025.