Secondo un documento del 2025 del Stanford Institute for Human-Centered Artificial Intelligence, molti modelli linguistici di grandi dimensioni funzionano male in lingue diverse dall'inglese. Questo divario nasce perché il mondo online è dominato dall'inglese e molti sviluppatori si basano su dati prevalentemente anglofoni. La concentrazione di aziende e dati in aree più ricche, come la Silicon Valley, ha ampliato la frattura.
I problemi sono pratici e culturali. Testate come Wired hanno riportato che chiedere a ChatGPT di scrivere una e-mail in tamil può generare una bozza confusa in inglese. Il MIT Technology Review ha trovato che molti testi in lingue a bassa risorsa raccolti dal web contengono errori di traduzione; contributori benintenzionati spesso non hanno le competenze per verificarli, e questi contenuti entrano nei dati di addestramento consolidando gli errori. Osservatori, tra cui The Atlantic, hanno avvertito che gli output dell'IA riflettono norme e valori anglofoni, rendendo invisibili prospettive non inglesi e lasciando milioni di parlanti di lingue come il curdo e lo swahili in secondo piano.
Esperti e commentatori propongono passi concreti per ridurre i danni e migliorare l'equità. Tra le raccomandazioni principali ci sono:
- Lavorare con le comunità locali e i leader di AI sul territorio.
- Validare e pulire i dati multilingue prima dell'addestramento.
- Collaborare con sviluppatori della base e creare partnership rispettose delle differenze culturali.
Queste misure mirano a includere input locali, verificare accuratezza e autenticità degli output e costruire sistemi più utili per utenti non anglofoni.
Parole difficili
- modello linguistico — programma che genera o analizza testimodelli linguistici
- divario — differenza significativa tra gruppi o situazioni
- anglofono — che usa principalmente la lingua ingleseanglofoni
- addestramento — processo di preparazione dei modelli con dati
- contributore — persona che pubblica o aggiunge contenuti onlinecontributori
- validare — controllare se dati o informazioni sono corretti
- frattura — separazione o divario profondo tra gruppi
- autenticità — qualità di essere reale e non falso
Suggerimento: passa il mouse o tocca le parole evidenziate nell’articolo per vedere definizioni rapide mentre leggi o ascolti.
Domande di discussione
- In che modo la predominanza dell'inglese online può influire sull'accesso alle informazioni per persone che parlano altre lingue?
- Quali passi pratici pensi siano più efficaci per coinvolgere le comunità locali nello sviluppo di AI multilingue?
- Quali difficoltà potrebbero incontrare i ricercatori nel validare e pulire dati multilingue raccolti dal web?
Articoli correlati
Intelligenza artificiale aiuta a rilevare il melanoma
Ricercatori della University of Missouri testano l'AI per individuare il melanoma analizzando immagini cutanee 3D. Hanno usato 400.000 immagini e tre modelli: insieme hanno superato il 92% di accuratezza; l'AI è uno strumento di supporto.
TikTok e i clan in Somalia
Una ricerca mostra che TikTok sta amplificando il clannismo in Somalia, con battaglie online, donazioni digitali e maggiore polarizzazione. La piattaforma è molto popolare e gli esperti chiedono moderazione, alfabetizzazione digitale e collaborazione comunitaria.
AI e disinformazione nelle elezioni in Bangladesh
Il 12 febbraio il Bangladesh ha tenuto un'elezione dopo una grande sollevazione studentesca del luglio 2024. Durante la campagna l'intelligenza artificiale ha generato immagini e video falsi che hanno diffuso notizie e citazioni inventate.
Indagine globale sul giornalismo scientifico durante la pandemia
Un rapporto di SciDev.Net analizza le condizioni di lavoro dei giornalisti scientifici in tutto il mondo. Il sondaggio mostra aumento del carico di lavoro, uso di materiale non revisionato e opinioni contrastanti sulla professione.
Perché l'intelligenza artificiale produce risultati ingiusti
Una ricerca dell'University of Texas at Austin indica che molti bias nell'intelligenza artificiale nascono perché i modelli non catturano la complessità del mondo reale. Lo studio individua tre fattori che aumentano il rischio di risultati ingiusti.