Alla scoperta delle norme dedicate all’intelligenza artificiale

 

Sviluppo e utilizzo dell’AI. Si può usare il legittimo interesse?

 

Recentemente il Board europeo dei Garanti Privacy è intervenuto con un’opinione che definisce, in modo piuttosto stringente, alcuni requisiti di legittimità del trattamento dei dati personali coinvolti o utilizzati nell’ambito della progettazione e dello sviluppo (development), ma anche dell’utilizzo (deployment), dei modelli di intelligenza artificiale.

 

 

Fame di dati e web scraping

Il fatto che un dato sia pubblicamente disponibile non significa, per sé solo, che ci si possa fare quello che si vuole. Per “trattare” dati in modo corretto, secondo le norme europee, ci vuole una base giuridica che ne renda lecito l’utilizzo.

Spesso le grandi aziende utilizzano una delle sei “possibilità” che l’art. 6 del Gdpr prevede: l’interesse legittimo; giustificano, in altre parole, “l’utilizzo” dei dati qualificandolo come “necessario per il perseguimento del loro legittimo interesse*”.

L’addestramento dei modelli di intelligenza artificiale comporta la necessità dell’utilizzo di una quantità elevatissima di dati e informazioni che, spesso, più è massiccia più consente ai sistemi di essere performanti. 

La raccolta avviene attraverso dati pubblici, database, interazioni con gli utenti ma soprattutto con varie metodologie di web scraping**: “Mentre nei primi anni 2010 i dati provenivano da fonti eterogenee (enciclopedie, trascrizioni parlamentari, report meteo), con l’avvento dei modelli di trasformatori (introdotti nel 2017) e la crescente importanza della scala dei dati, la tendenza è cambiata drasticamente. Oggi, gran parte dei dati viene estratta in modo indiscriminato dal web.***” 

Come si può leggere nel provvedimento del nostro Garante destinato a fornire ai titolari di siti internet indicazioni e consigli per proteggere i dati consultabili sulle pagine web, “nell’anno 2023, il 49,6% di tutto il traffico Internet è stato generato dai bot con un aumento pari al 2,1% rispetto all’anno precedente, aumento che è stato parzialmente ricondotto alla diffusione di sistemi di intelligenza artificiale e, in particolare, dei modelli linguistici di grandi dimensioni (di seguito anche “LLM” – Large Language Model) sottesi all’intelligenza artificiale generativa.****”

Durante lo sviluppo, i modelli vengono “addestrati” su questi dati, imparando a riconoscere pattern e a fare previsioni. Questo processo iterativo richiede spesso aggiustamenti e raffinamenti del modello, basati sui risultati ottenuti ma, in sostanza, più dati (di qualità) vengono forniti, più accurate e affidabili saranno le prestazioni del modello.

Poiché è praticamente impossibile avere una relazione contrattuale o, addirittura, uno specifico consenso degli individui i cui i dati sono presenti in rete, l’interesse legittimo può sembrare, a prima vista, uno strumento “comodo” e utile per giustificarne la raccolta.

 Il punto focale, però, è che tale giustificazione non è, per sé sola sufficiente (e, quindi, non basta “richiamarla”), giacché la norma richiede espressamente che sussista anche la “condizione che non prevalgano gli interessi o i diritti e le libertà fondamentali dell’interessato …”, in particolare se questi è un minore” (art. 6, 1, lett. f del Gdpr).

 

* L’individuazione di una idonea base giuridica ai sensi dell’art. 6 del Gdpr deve infatti essere effettuata sulla base di una valutazione di idoneità che il titolare deve essere in grado di comprovare, in base al principio di accountability.

** Per una interessante ricerca: https://github.com/Data-Provenance-Initiative/Data-Provenance-Collection

*** https://www.ingenio-web.it/articoli/da-dove-provengono-i-dati-che-alimentano-l-intelligenza-artificiale/ 

**** https://www.garanteprivacy.it/home/docweb/-/docweb-display/docweb/10019984

 

 

Il parere dell’EDPB

Quando i dati sono anonimi

L’opinion si concentra, innanzitutto, sul concetto di dato anonimo.

Se un dato è anonimo, infatti, il suo trattamento non è soggetto alle norme, sostanzialmente perché, non potendo essere in alcun modo riferibile ad alcuno, non c’è nessuno che potrebbe subire conseguenze negative dall’uso che di tale dato possa essere fatto.

Anche in relazione a tale questione, peraltro, le “soluzioni” non sono semplici.

Un dato è realmente anonimo, infatti, solo se:

  • non consente il c.d. “single out”, ossia la possibilità di estrapolare una persona da un gruppo più ampio; 
  • non consente di collegare (il dato stesso) ad altre informazioni riferibili ad una persona identificata (“unlinkability”) e, ancora, 
  • non permette di dedurre, inferendole, altre o nuove informazioni relative ad una persona (“inference”); ulteriormente, e non per ultimo, 
  • tali possibilità dipendono, evidentemente, dal caso specifico, dalla ragionevolezza e dalle concrete possibilità che un soggetto possa avere, o non avere, di procedere alla ulteriore individuazione (per essere in grado, per potenza di calcolo o quantità di ulteriori informazioni disponibili o, come nel parere in questione, operare “malevolmente” per estrarre le informazioni richieste),

l’EDPB ritiene che soltanto a seguito di un esame da condurre caso per caso e analiticamente, sia possibile, di volta in volta, escludere (o meno) se un dato utilizzato nello sviluppo o nella progettazione sia realmente anonimo o meno.

Nello specifico il Board ritiene che i modelli addestrati con dati personali non possano, in generale, essere considerati utilizzare dati anonimi*. 

Dovrebbero, infatti, essere del tutto escluse:

  • sia la probabilità di estrazione diretta (anche probabilistica) di dati riguardanti soggetti i cui dati sono stati utilizzati per sviluppare il modello, 
  • sia la probabilità di ottenere, intenzionalmente o meno, tali dati personali da query (e altre tecniche di attacco o comunque intrusive) al sistema; le probabilità dovrebbero essere insignificanti, anche in tal caso tenendo conto di tutti i mezzi ragionevolmente utilizzabili.

Lo sviluppatore dovrebbe quindi, caso per caso, poter dimostrare all’Autorità di controllo tutta una serie di documenti, analisi e fatti idonea a convincerla della ragionevole e verosimile impossibilità di nuova o ulteriore reidentificazione.

Difficile, costoso, complicato.

* L’Autorità di protezione dei dati di Amburgo, lo scorso anno, aveva pubblicato uno studio secondo il quale, sostanzialmente, i Large Language Models non trattano o archiviano dati personali: https://dirittoaldigitale.com/2024/09/16/autorita-dati-personali/

 

Il legittimo interesse

La seconda e terza parte dell’Opinion si concentrano sulla possibilità, per i progettisti e gli sviluppatori in primo luogo, ma anche per i successivi utilizzatori, di fondare i propri trattamenti sul legittimo interesse.

Richiamando il proprio orientamento, rinnovato proprio lo scorso anno, sul punto, il Board ricorda come tale base giuridica rimanga una delle sei disponibili e, soprattutto, che essa sia costituita da tre fondamentali e ineliminabili elementi:

Per poter applicare tale base devono essere soddisfatte e documentate, prima dell’inizio del trattamento (accountability) tre condizioni cumulative:

  • il titolare deve documentare il perseguimento di un scopo (interesse) che sia legittimo;
  • deve dimostrare la necessità di procedere in tal senso;
  • deve eseguire un test di bilanciamento che dimostri che il proprio interesse non è superato dall’interesse o dalle libertà fondamentali degli individui i cui dati saranno trattati.

Il primo requisito impone di identificare e documentare che l’interesse è legittimo; devono essere indicati con precisioni benefici, vantaggi, liceità ed eticità dell’interesse in questione, che non deve essere in contrasto con le norme ed essere articolato in modo chiaro e preciso per garantire un giusto equilibrio con i diritti degli interessati. Deve, inoltre, essere reale e attuale, ossia presente ed effettivo al momento del trattamento e non speculativo. 

Il secondo requisito riguarda il test sulla necessità del trattamento: si deve considerare, in modo onesto e obiettivo, se l’interesse legittimo possa essere perseguito con mezzi meno invasivi che non incidano sui diritti dell’interessato. Se ciò fosse possibile, l’interesse in questione non sarebbe considerato legittimo.

Infine, il terzo requisito impone di effettuare un test di bilanciamento, ossia di soppesare il loro legittimo interesse rispetto ai diritti e alle libertà dell’interessato. In questa fase è necessario analizzare il rischio del trattamento, per esempio valutando quali dati saranno trattati, quale impatto il trattamento potrebbe avere, quali siano le effettive aspettative dell’interessato in merito al trattamento (ragionevolmente: se lo aspetta?) e, infine, prendere una decisione che sia il più obiettiva possibile.

Fermo quanto sopra, il Board conferma come sia complicato applicare una tale base giuridica in relazione alla difficoltà di bilanciare i contrapposti interessi (e diritti) e di poterla giustificare correttamente e ragionevolmente, con eventuali garanzie aggiuntive a tutela degli impatti dei trattamenti sugli interessati.

Ad esempio, in relazione al ruolo delle ragionevoli aspettative degli interessati da esaminare nel test di bilanciamento, l’EDPB sottolinea quanto questo aspetto sia rilevante a causa della complessità delle tecnologie utilizzate dai modelli e del fatto che potrebbe essere difficile per gli interessati comprendere la varietà dei loro potenziali utilizzi, nonché le diverse attività di elaborazione coinvolte.

 

 

Altre questioni

Il parere si sofferma su ulteriori altre questioni (misure di mitigazione come il mascheramento dei dati, la trasparenza, ecc.) e anche su casi esemplificativi, in particolare esaminando contesti specifici (diagnosi mediche, analisi dei curriculum) ma anche ipotesi quali:

  • il trattamento illecito dei dati personali per sviluppare il modello con conservazione degli nel modello stesso e successivo utilizzo da parte dello stesso titolare nel contesto dell’implementazione;
  • elaborazione illecita per sviluppare il modello (con conservazione dei dati identificativi) ma utilizzo e implementazione successive da parte di altro titolare;
  • elaborazione illecita da parte dello sviluppatore ma reale anonimizzazione dei dati conservati con successivo utilizzo e implementazione (dei citati dati divenuti anonimi) da parte di altri.

 

Conclusioni

Un’Opinion ferma e rigorosa, che comporta sforzi di non poco conto per le imprese, in un contesto tra l’altro in evoluzione vertiginosa e velocissima.

Come sempre, norme e linee guida faticano a tenere il passo della tecnologia e delle imprese che la vogliono sfruttare.

Per approfondire: https://www.agendadigitale.eu/sicurezza/privacy/come-addestrare-i-modelli-di-ai-tutelando-i-dati-il-parere-delledpb/ 

 

👾 👾 👾

Per oggi abbiamo finito.

Ci vediamo la prossima settimana!

Questa newsletter si propone di esaminare le principali disposizioni in arrivo con un linguaggio semplice e chiaro, accompagnato il più possibile da esempi concreti.

Se sei interessato, iscriviti. 👾