Forschende der North Carolina State University nahmen große Sprachmodelle unter die Lupe, weil diese oft Rat oder Anleitungen geben. Jung‑Eun Kim betont, dass solche Modelle Menschen nicht zu Selbst‑ oder Fremdschaden anleiten dürfen. Das Team identifizierte zwei Hauptprobleme: die sogenannte "alignment tax", also eine Verringerung der Genauigkeit durch Sicherheitstraining, und eine oberflächliche Sicherheitsprüfung, die sich umgehen lässt.
Jianwei Li erklärt, dass Modelle Sicherheit oft früh im Antwortprozess als sicher oder unsicher einstufen. Das führt dazu, dass eine einfache Umformulierung einer Frage gefährliche Ausgaben ermöglichen kann. Die Forschenden schlugen die Superficial Safety Alignment Hypothesis (SSAH) vor, um dieses Muster zu beschreiben.
Sie suchten nach sicherheitskritischen Teilen im Modell und identifizierten bestimmte neuronale Komponenten. Wenn diese Neuronen beim Feinabstimmen eingefroren werden, kann das Modell seine ursprüngliche Sicherheitsentscheidung behalten und gleichzeitig neue Aufgaben lernen. Die Methode reduziert offenbar die alignment tax, und die Ergebnisse werden auf der ICLR2026 vorgestellt. Relevanter Code ist online verfügbar.
Schwierige Wörter
- forschende — Personen, die wissenschaftlich untersuchen und forschen
- sprachmodell — Computerprogramm, das Sprache versteht und erzeugtSprachmodelle
- verringerung — Das Sinken oder Wenigerwerden von etwas
- genauigkeit — Wie richtig oder präzise Informationen sind
- sicherheitstraining — Training, das Modelle sicherheitsbewusst macht
- oberflächlich — Nur an der Oberfläche, nicht tiefgehendoberflächliche
- einfrieren — Beim Trainieren: bestimmte Teile unverändert lasseneingefroren
- umgehen — Eine Regel oder Prüfung absichtlich vermeiden
Tipp: Fahre über markierte Wörter oder tippe darauf, um kurze Definitionen zu sehen – während du liest oder zuhörst.
Diskussionsfragen
- Findest du es wichtig, dass Sprachmodelle keine Anleitungen zu Selbst- oder Fremdschaden geben? Warum?
- Wie könnte man deiner Meinung nach verhindern, dass einfache Umformulierungen Sicherheitsprüfungen umgehen? Nenne eine Idee.
- Was meinst du: Ist es gut, relevanten Code online verfügbar zu machen? Nenne einen Vorteil und einen Nachteil.
Verwandte Artikel
KI in Lateinamerika gegen geschlechtsspezifische Gewalt
Gruppen in Lateinamerika entwickeln offene, lokale KI‑Systeme, um geschlechtsspezifische Ungleichheiten und Gewalt zu untersuchen. Sie schützen sensible Daten, liefern Belege für Zivilgesellschaft und Staat und arbeiten an neuen Funktionen wie Audio‑Transkription.
Studie: Abbott‑Bioline‑Schnelltest liefert viele falsch-negative Malariaergebnisse
Eine internationale Studie im Malaria Journal zeigt, dass der Schnelltest Abbott‑Bioline in Südostasien viele Malariafälle übersieht. Forschende am Thailand‑Myanmar‑Grenzgebiet verglichen den Test mit einem anderen Schnelltest und mit Mikroskopie.
Mehr Strom durch Rechenzentren und Krypto erhöht Kosten und Emissionen
Eine Studie warnt, dass wachsender Stromverbrauch durch Rechenzentren und Kryptowährungsabbau die Strompreise und CO2‑Emissionen in den USA bis 2030 deutlich erhöhen könnte. Forschende nutzten ein Energiesystemmodell mit 26 Regionen zur Analyse.