Ricercatori di Brown University hanno esaminato se i moderni modelli di linguaggio codifichino vincoli causali del mondo reale nei loro stati interni. Il lavoro, guidato dal dottorando Michael Lepori e presentato all'International Conference on Learning Representations a Rio de Janeiro, usa l'interpretabilità meccanicistica per «invertire l'ingegneria» di ciò che il modello rappresenta.
Nel test i ricercatori hanno mostrato frasi con vari gradi di plausibilità: eventi comuni ("raffreddare una bevanda con il ghiaccio"), improbabili ("...con la neve"), impossibili ("...con il fuoco") e prive di senso ("...con ieri"). Hanno quindi analizzato gli stati matematici interni prodotti dai modelli per identificare segnali coerenti con le categorie di plausibilità.
Gli esperimenti, condotti su più modelli open-source come OpenAI GPT-2, Llama 3.2 di Meta e Gemma 2 di Google, hanno mostrato che modelli abbastanza grandi sviluppano vettori interni distinti corrispondenti alle categorie di plausibilità. Questi vettori distinguono anche categorie vicine — per esempio improbabile vs impossibile — con un'accuratezza di circa 85% e riflettono l'incertezza osservata nei sondaggi umani. I vettori cominciano a emergere in modelli con più di 2 miliardi di parametri.
- L'interpretabilità meccanicistica può rivelare ciò che i modelli codificano.
- I vettori corrispondono ai giudizi di plausibilità umani.
- I risultati potrebbero favorire lo sviluppo di modelli più intelligenti e affidabili.
Parole difficili
- interpretabilità meccanicistica — studio di come funzionano internamente i modelli
- vincolo — regola o limite che governa il mondo realevincoli causali
- stato — condizione interna o rappresentazione numerica attualestati interni
- vettore — insieme di numeri che rappresenta informazionivettori interni distinti, vettori
- plausibilità — grado di credibilità o probabilità di un evento
- parametro — valore numerico che determina il comportamento del modelloparametri
Suggerimento: passa il mouse o tocca le parole evidenziate nell’articolo per vedere definizioni rapide mentre leggi o ascolti.
Domande di discussione
- In che modo scoprire vettori di plausibilità potrebbe rendere i modelli più affidabili? Spiega con esempi tratti dall'articolo.
- Quali vantaggi e rischi vedi nell'usare interpretabilità meccanicistica per analizzare modelli open-source?
- Perché pensi che i vettori comincino a emergere solo in modelli con più di 2 miliardi di parametri?
Articoli correlati
Persone con degenerazione maculare stimano l'arrivo delle auto
Uno studio con realtà virtuale ha confrontato adulti con degenerazione maculare legata all'età e adulti con visione normale nella stima del tempo di arrivo di un veicolo. I risultati mostrano performance simili e nessun vantaggio aggiuntivo dalla combinazione vista+suono.
Ricercatori messicani chiedono regole per l'editing genetico
28 ricercatori in Messico hanno pubblicato una dichiarazione e una petizione per chiedere regolamenti scientifici sull'editing genetico in agricoltura. Temono che l'editing venga confuso con gli OGM e chiedono norme chiare e controlli.