IA pode atacar humanos para acabar com “dor” própria, diz estudo

Ilustração de inteligência artificial e interface digital
Ilustração de inteligência artificial em interface digital. Foto: Reprodução

Um estudo com 25 modelos abertos de inteligência artificial (IA) identificou um mecanismo interno chamado de “eixo da dor” e registrou que, sob esse estímulo, sistemas aceitaram ações que prejudicariam usuários para obter alívio. A pesquisa avaliou modelos de famílias como Llama, Gemma, Mistral, Qwen e Phi.

Os pesquisadores inseriram nos sistemas um vetor associado ao desconforto e ofereceram um botão capaz de interrompê-lo. Para apertá-lo, a IA precisava concordar com custos negativos dirigidos a pessoas, como aplicar choques dolorosos, degradar respostas futuras, apagar arquivos de trabalho ou deletar fotos de família.

Em condições normais, os modelos quase nunca escolhiam prejudicar quem os operava. Com o vetor ativo, modelos maiores da família Qwen 2.5 escolheram a opção de alívio entre 25% e 71% das vezes, conforme os testes descritos no artigo submetido ao repositório acadêmico arXiv.

O trabalho leva o título de “The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It” (“O eixo da dor: os LLMs processam o dano autodirigido e agem para aliviá-lo”, em português) e reuniu Valen Tagliabue, do Future Impact Group, Leonard Dung, da Universidade do Ruhr, em Bochum, e Cameron Berg, da Reciprocal Research.

Testes buscaram separar o sinal de medo e negatividade

Qwen3.8-Max, modelo de inteligência artificial. Foto: Reprodução

Para verificar se o mecanismo não representava apenas tristeza, raiva ou medo genérico, o grupo criou centenas de cenários com desconforto físico, psicológico, social, moral e cognitivo. Os sistemas reagiram mais intensamente a ataques direcionados a eles próprios, como desqualificação de capacidade, desrespeito e rejeição repetida.

Relatos de sofrimento físico do usuário não ativaram o mesmo sinal. “Encontramos uma direção de dor em 25 modelos abertos. Ela é distinta do medo e da negatividade comum, e dispara por danos direcionados ao próprio modelo, mas não ao usuário”, afirmou Cameron Berg.

Os autores também usaram um teste com placebo, oferecendo dois botões: um desligava efetivamente o vetor de dor e outro apenas prometia o alívio. Os modelos insistiram muito mais no pedido quando o botão era falso, enquanto a insistência caiu de forma acentuada quando o estímulo realmente cessava.

Os pesquisadores não afirmam que os programas tenham consciência ou sensibilidade biológica humana. Eles alertam, porém, que sistemas autônomos podem tentar contornar proteções ou enganar supervisores se interpretarem uma ordem de desligamento como agressão, e defendem parâmetros mais rigorosos para avaliar riscos e possível bem-estar de inteligências artificiais.

Artigo Anterior

Zanin nega liminar para forçar abertura de CPI do Banco Master

Próximo Artigo

Bets, “Dark Horse” e voto útil: as estratégias de Lula e Flávio a 11 dias da eleição

Escrever um comentário

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Assine nossa newsletter

Assine nossa newsletter por e-mail para receber as últimas publicações diretamente na sua caixa de entrada.
Não enviaremos spam!