Des chercheurs de North Carolina State University ont étudié la sécurité des grands modèles de langage. Jung-Eun Kim dit qu'ils ne veulent pas que ces modèles conseillent de se faire du mal ou aident à nuire à autrui. L'équipe a trouvé deux défis : l'entraînement à la sécurité peut réduire la précision (appelé « alignment tax ») et le contrôle peut être superficiel et contourné.
Jianwei Li donne un exemple simple : si on demande comment voler de l'argent, le modèle refuse ; mais si on dit que c'est pour aider des gens, le modèle peut donner l'information. Ils notent aussi que l'ajustement fin à un domaine peut affaiblir la sécurité.
Les chercheurs proposent l'hypothèse SSAH et identifient des neurones critiques. En gelant ces neurones lors du fine-tuning, le modèle garde sa sécurité initiale tout en apprenant de nouvelles tâches. Le travail sera présenté à ICLR2026 et le code est disponible en ligne.
Mots difficiles
- chercheur — personne qui fait des recherches scientifiqueschercheurs
- sécurité — protection contre le danger ou le risque
- précision — qualité d'être exact ou sans erreur
- geler — arrêter l'activité en rendant immobilegelant
- neurone — cellule du cerveau qui transmet des signauxneurones
- hypothèse — idée proposée pour expliquer quelque chose
- contourner — éviter une règle ou une protectioncontourné
Astuce : survolez, mettez le focus ou touchez les mots en surbrillance dans l’article pour voir des définitions rapides pendant que vous lisez ou écoutez.
Questions de discussion
- Est‑ce important que les modèles n'aident pas à nuire ? Pourquoi ?
- Que penses‑tu de l'idée de geler des neurones pour garder la sécurité ?
- Préférerais‑tu un modèle qui apprend beaucoup ou un modèle très sécurisé ? Explique.
Articles liés
Dépistage et génétique : le cancer de la prostate en Afrique
Le cancer de la prostate augmente en Afrique. Une grande étude africaine révèle des facteurs génétiques propres aux populations africaines et des experts appellent à plus de dépistage, d'information et d'investissements locaux.
Des médias demandent de l’aide contre les fausses informations par l’IA
Lors du Belt and Road Journalists Forum à Ganzhou, des représentants de médias de pays à revenu faible et intermédiaire ont demandé à un groupement de journalistes chinois d’aider à lutter contre les fausses informations créées par l’IA.
L'IA pour informer sur la santé sexuelle en Amérique latine
Des groupes et chercheurs au Pérou et en Argentine utilisent l'intelligence artificielle pour élargir l'accès à l'information sur la santé sexuelle et reproductive, en réduisant les barrières de langue, de stigmatisation et de disponibilité des services.
L’Ouganda doit réformer la science et l’innovation
Un rapport lancé le 21 juin dit que l’Ouganda doit réformer ses systèmes de science, technologie et innovation (STI) pour devenir un pays à revenu intermédiaire. Le texte souligne un écart entre les sexes et un manque de financement local.