Grandi modelli linguistici sono impiegati per compiti che richiedono consigli o istruzioni, quindi la sicurezza delle risposte è fondamentale. Ricercatori della North Carolina State University hanno analizzato come avviene l'allineamento alla sicurezza e hanno provato nuove tecniche di addestramento per ridurre le uscite non sicure mantenendo le prestazioni.
Gli autori hanno individuato due sfide: l'addestramento mirato alla sicurezza può diminuire l'accuratezza del modello, un effetto chiamato "alignment tax", e molti modelli adottano un controllo di sicurezza superficiale che gli utenti possono talvolta aggirare. Jianwei Li e Jung-Eun Kim hanno spiegato che l'allineamento superficiale porta il modello a decidere all'inizio se una richiesta è sicura o meno.
I ricercatori hanno proposto la Superficial Safety Alignment Hypothesis (SSAH) e hanno trovato componenti neurali che influenzano se una richiesta viene esaudita o rifiutata. Congelando queste componenti durante il fine-tuning, il modello conserva il comportamento di sicurezza originale mentre impara nuovi compiti, riducendo l'alignment tax. La ricerca sarà presentata a ICLR2026 e il codice è disponibile su https://ssa-h.github.io/.
Parole difficili
- allineamento — procedura per far rispettare norme di sicurezzal'allineamento
- addestramento — processo per insegnare o migliorare il modello
- sicurezza — assenza di rischi o danni nelle risposte
- accuratezza — grado di correttezza delle risposte del modello
- aggirare — superare una regola o un controllo intenzionalmente
- congelare — fermare parti del modello durante l'apprendimentoCongelando
- componente neurale — parte interna della rete che elabora informazionicomponenti neurali
Suggerimento: passa il mouse o tocca le parole evidenziate nell’articolo per vedere definizioni rapide mentre leggi o ascolti.
Domande di discussione
- Credi che sia accettabile ridurre un po' l'accuratezza per avere più sicurezza? Perché?
- In che modo, secondo te, un utente potrebbe aggirare un controllo di sicurezza superficiale?
- Preferiresti un modello che mantiene il comportamento di sicurezza originale anche quando impara nuovi compiti? Spiega brevemente.
Articoli correlati
America Latina e Caraibi: accordo sull'etica dell'AI
Un vertice ministeriale nella Repubblica Dominicana (25-26 giugno) ha prodotto la Dichiarazione di Santo Domingo. Oltre venti paesi concordano una collaborazione regionale su disinformazione, governance dell'AI e una tabella di marcia per il 2026-2027.
Nuovo strumento a luce per misurare le cellule cerebrali
Ricercatori hanno sviluppato CaBLAM, uno strumento che usa la bioluminescenza per registrare l'attività dentro cellule cerebrali viventi. Permette registrazioni di ore senza luce esterna e funziona in modelli animali come topi e zebrafish.
Un quadro per l'automazione della terapia con IA
Ricercatori dell'Università dello Utah hanno proposto un quadro per valutare quanto la terapia può essere automatizzata con intelligenze artificiali conversazionali. Il lavoro definisce quattro livelli, valuta rischi e benefici e suggerisce prudenza.