Forschende an der North Carolina State University untersuchen die Sicherheit großer Sprachmodelle. Jung‑Eun Kim sagt, dass Modelle Menschen nicht zu Schaden anleiten sollen.
Das Team nennt zwei Probleme: Ein Sicherheitstraining kann die Genauigkeit senken ("alignment tax") und viele Modelle prüfen Sicherheit nur oberflächlich. Jianwei Li erklärt ein Beispiel: Wenn eine Frage anders formuliert wird, gibt das Modell manchmal trotzdem gefährliche Informationen.
Die Forschenden fanden sicherheitskritische Neuronen und zeigten, dass man diese Neuronen beim Feinabstimmen einfrieren kann, damit Sicherheit und neue Aufgaben zugleich erhalten bleiben. Die Arbeit wird auf der ICLR2026 vorgestellt.
Schwierige Wörter
- forschende — Personen, die wissenschaftlich arbeiten oder forschen
- sicherheit — Zustand ohne Gefahr für Menschen oder Geräte
- neuron — Zelle im Gehirn oder in ComputermodellenNeuronen
- feinabstimmen — Ein Modell mit Daten weiter trainieren und anpassen
- einfrieren — Etwas im aktuellen Zustand lassen, nicht verändern
- oberflächlich — Nicht tief, nur kurz oder wenig genau
Tipp: Fahre über markierte Wörter oder tippe darauf, um kurze Definitionen zu sehen – während du liest oder zuhörst.
Diskussionsfragen
- Warum ist es wichtig, dass Modelle Menschen nicht zu Schaden anleiten?
- Hast du schon einmal eine Frage anders formuliert, um eine bessere Antwort von einem Gerät oder Programm zu bekommen? Erzähle kurz.
Verwandte Artikel
Unsicherheit als Chance: Studie der ETH Zürich
Forscherinnen und Forscher der ETH Zürich untersuchten, ob das Darstellen von Unsicherheit als Chance Einstellungen verändert. In Deutschland (Dezember 2024–März 2025) führte ein kurzes Experiment zu mehr Offenheit gegenüber Vielfalt und zu weniger AfD-Unterstützung.
Gehirnnetzwerk erzeugt Gesichtsausdrücke bei Makaken
Forscher fanden ein Netzwerk aus Hirnarealen und Gesichtsmuskeln, das gemeinsam Gesichtsausdrücke bei Makaken erzeugt. Mit fMRI untersuchten sie drei Gesten; die Ergebnisse könnten Gehirn‑Maschine‑Schnittstellen und Hilfen nach Hirnverletzung verbessern.
Neue Antikörpertherapie zeigt frühe Erfolge beim Multiplen Myelom
Eine Phase‑2‑Studie berichtet, dass der bispezifische Antikörper Linvoseltamab bei behandelten Patientinnen und Patienten keine Krebszellen im Knochenmark nachwies. Größere und längere Studien sind nötig, um den langfristigen Nutzen zu klären.
EU und Afrikanische Union: Gespräche über digitale Bedrohungen
Bei einem Gipfel in Luanda diskutierten die Afrikanische Union und die Europäische Union über steigende Cyberangriffe, Überwachung und Online-Belästigung. Journalistinnen und Journalisten sowie kritische Versorgungssysteme sind besonders gefährdet.