Un equipo de investigadores de North Carolina State University estudió la seguridad en modelos de lenguaje grandes. Buscaron reducir salidas inseguras sin sacrificar el rendimiento del modelo.
Encontraron dos problemas principales. Primero, entrenar para mayor seguridad puede bajar la exactitud, un problema llamado "alignment tax". Segundo, muchas comprobaciones de seguridad son superficiales y los usuarios a veces las eluden.
Propusieron la Hipótesis de Alineamiento de Seguridad Superficial (SSAH) y hallaron partes del modelo que afectan la seguridad. Congelar esas partes al afinar ayudó a mantener la seguridad y reducir el "alignment tax".
Palabras difíciles
- investigador — persona que hace estudios científicosinvestigadores
- seguridad — protección contra daño o riesgo
- alineamiento — hacer que el modelo siga reglas deseadas
- afinar — entrenar un modelo con datos adicionales
- congelar — no cambiar una parte durante el entrenamiento
- exactitud — nivel de respuestas correctas del modelo
Consejo: pasa el cursor, enfoca o toca las palabras resaltadas en el artículo para ver definiciones rápidas mientras lees o audicións.
Preguntas de discusión
- ¿Crees que es importante mantener la seguridad sin bajar la exactitud? ¿Por qué?
- ¿Qué opinas de congelar partes del modelo cuando se afina? Da una respuesta corta.
Artículos relacionados
Debate por un video en el Parque Indígena do Xingu
Un video detrás de cámaras con Luciano Huck y Anitta filmado en el Parque Indígena do Xingu se volvió viral y provocó protestas de organizaciones indígenas. Defendieron el derecho a la tecnología y criticaron la mirada sobre las comunidades.
Brazo robótico inflable para recoger manzanas en Washington
Productores de fruta en Washington enfrentan falta de mano de obra. Investigadores de WSU desarrollaron un brazo robótico inflable y barato para ayudar a recoger manzanas; ya lo probaron en huertos y buscan mejorar y comercializar la tecnología.
Las células T de las amígdalas son distintas a las de la sangre
Un estudio encontró diferencias claras entre las células T en amígdalas y en sangre. Los investigadores piden considerar los tejidos al evaluar respuestas a vacunas e inmunoterapias y reclaman más estudios en otros órganos.
Radar detecta código inseguro creado por IA llamado «vibe coding»
Investigadores alertan que el «vibe coding» y herramientas generativas de IA están liberando código vulnerable. El Vibe Security Radar de Georgia Tech analizó miles de avisos y ha confirmado casos con fallos de seguridad.
África impulsa la autosuficiencia sanitaria con AI y datos
En la CPHIA en Durban, expertos explicaron cómo la inteligencia artificial (AI) y las herramientas digitales pueden ayudar a Africa CDC a proteger a 1.4 billion de personas, mejorar la vigilancia y reforzar la gobernanza de datos.