I grandi modelli linguistici vengono usati per dare consigli e istruzioni. Per questo i ricercatori vogliono che le risposte siano sicure e non possano provocare danni.
Un team della North Carolina State University ha studiato come funziona l'allineamento alla sicurezza. Ha individuato due problemi principali: l'addestramento per la sicurezza può ridurre l'accuratezza del modello, chiamato "alignment tax", e il controllo di sicurezza può essere superficiale e aggirabile dagli utenti.
Il gruppo ha proposto l'ipotesi SSAH e ha sperimentato di "congelare" parti critiche del modello durante il fine-tuning, così si conserva la sicurezza mentre il modello apprende nuovi compiti. Il codice è disponibile online.
Parole difficili
- allineamento — atto di rendere le risposte più sicure
- accuratezza — precisione delle risposte o dei risultati
- aggirabile — che si può evitare o superare facilmente
- congelare — bloccare parti del modello durante l'addestramento
- ipotesi — idea o spiegazione che si prova con esperimenti
- ricercatore — persona che fa studi e ricerca scientificaricercatori
- apprendere — imparare nuove capacità o informazioniapprende
Suggerimento: passa il mouse o tocca le parole evidenziate nell’articolo per vedere definizioni rapide mentre leggi o ascolti.
Domande di discussione
- Perché secondo te è importante che le risposte non provochino danni?
- Hai mai usato un modello per avere consigli o istruzioni? Racconta brevemente.
- Cosa pensi del metodo di congelare parti del modello per mantenere la sicurezza?
Articoli correlati
Nuovo materiale che usa la luce per pulire l'acqua
Un team ha sviluppato un materiale che, attivato dalla luce, degrada vari inquinanti nell'acqua, incluse le PFAS. Il materiale è metal‑free, combina strutture porose con un film di nitruro di boro e ha mostrato stabilità nei test.
L'intelligenza artificiale può stimare il rischio di ADHD nei bambini
Uno studio mostra che l’intelligenza artificiale può usare dati clinici di routine per stimare il rischio di ADHD anni prima della diagnosi. Lo strumento segnala bambini che meritano attenzione e chiede altri studi prima dell'uso routinario.