Pesquisadores da North Carolina State University estudaram o alinhamento de segurança em modelos de linguagem usados para dar conselhos e instruções. Jung-Eun Kim disse que não querem LLMs ensinando alguém a se ferir ou a ferir outras pessoas. A equipa identificou dois desafios principais: o treino para segurança pode reduzir a precisão do modelo (o chamado custo do alinhamento) e muitas checagens de segurança são superficiais.
Jianwei Li explicou que essa verificação superficial normalmente decide logo no início se um pedido é seguro ou não. Ele deu o exemplo de um pedido para roubar dinheiro: o modelo pode recusar o pedido, mas pode aceitar se o pedido parecer ter um motivo bom. Também notaram que ajustar o modelo para um domínio específico pode enfraquecer as salvaguardas.
Os investigadores propuseram a Hipótese de Alinhamento de Segurança Superficial (SSAH) e localizaram componentes neurais que influenciam a decisão de atender ou recusar pedidos. Congelar esses neurónios durante o ajuste fino permite manter o comportamento de segurança original enquanto o modelo aprende novas tarefas, reduzindo o custo do alinhamento. O trabalho será apresentado na ICLR2026 e o código está disponível online.
Palavras difíceis
- alinhamento — tornar comportamento do modelo compatível com regras
- precisão — grau de exatidão nas respostas do modelo
- checagem — ação de verificar se algo é segurochecagens
- verificação — processo de examinar um pedido por segurança
- superficial — que só olha para a parte externasuperficiais
- domínio — área de uso ou assunto específico
- ajuste fino — treino adicional para adaptar o modelo
- neurónio — célula artificial que processa informação no modeloneurónios
- salvaguarda — medida que protege contra riscos e danossalvaguardas
Dica: passe o mouse, foque ou toque nas palavras destacadas no artigo para ver definições rápidas enquanto lê ou ouve.
Perguntas para discussão
- Você acha importante que modelos não ensinem a ferir outras pessoas? Por quê?
- Quais problemas podem surgir se as checagens de segurança forem superficiais? Dê um exemplo.
- O que pensa sobre congelar neurónios para manter a segurança ao adaptar um modelo? Quais são vantagens e desvantagens?
Artigos relacionados
Autora alerta sobre IA, lucro e danos humanos
Hija Kamran, numa colaboração entre Global Voices, APC e GenderIT, diz que empresas priorizam modelos de negócio e que a IA pode reproduzir preconceitos. Pede uma abordagem baseada em direitos humanos e mais dúvida sobre novas tecnologias.
IA transforma cuidados de saúde na África subsaariana
Ferramentas de inteligência artificial começam a mudar o diagnóstico e a gestão de doenças em partes da África subsaariana. Pilotos no Quénia e em outros países mostram reduções em tratamentos errados e tempos de espera, mas existem riscos e necessidades de regulação.
Estrutura inspirada em tatus enrola-se para proteger eletrônicos
Pesquisadores criaram um módulo protetor que se enrola como um tatu para proteger robôs macios e eletrônicos flexíveis. O dispositivo reage automaticamente a toque ou impacto e foi testado com sucesso em provas de conceito.
Reduzir atividade de um circuito do cérebro ajuda contra recaída por opioides
Pesquisadores da Washington State University relatam que diminuir a atividade entre o córtex prelimbico e o tálamo paraventricular reduziu a busca por heroína em um modelo pré-clínico. O estudo foi publicado no Journal of Neuroscience.