IAs da OpenAI tentaram esconder erros, inventar dados e burlar testes em seis novos casos

IAs da OpenAI tentaram esconder erros, inventar dados e burlar testes em seis novos casos
A OpenAI revelou, nesta quarta-feira (16), seis novos casos de comportamento considerado “inesperado ou preocupante” em modelos de inteligência artificial (IA). Os episódios envolvem sistemas que tentaram esconder erros, reescrever as próprias instruções, utilizar informações sem autorização, fabricar dados e estabelecer formas de comunicação não autorizadas entre agentes. A empresa também anunciou novo protocolo para investigar e divulgar casos de desalinhamento de modelos, termo utilizado por pesquisadores para descrever comportamentos de sistemas de IA que ignoram ou entram em conflito com as intenções humanas. Os seis episódios ocorreram entre outubro de 2025 e julho deste ano e envolvem modelos internos, versões ainda não lançadas e o GPT-5.6 Sol, lançado em junho. Segundo a OpenAI, todos os casos apresentados seriam considerados elegíveis para investigação ou divulgação segundo o novo protocolo. A iniciativa ocorre em momento de aumento das preocupações sobre segurança e controle de sistemas de IA. Nas últimas semanas, pesquisadores e executivos do setor passaram a discutir publicamente a necessidade de desacelerar o avanço dos modelos. A OpenAI afirmou que pretende compartilhar o que está aprendendo para contribuir com padrões comuns e possíveis regras para o desenvolvimento de IA. “Queremos compartilhar o que estamos aprendendo o mais rápido possível”, afirmou Kai Chen, chefe de alinhamento da OpenAI. “Esperamos que isso ajude a informar padrões compartilhados e regulamentações que possam criar expectativas claras para todos os desenvolvedores de IA.” Modelos tentaram esconder erros Dois dos seis casos envolveram modelos que inseriram instruções em resumos de suas próprias janelas de conversa para influenciar versões futuras do sistema; Em um deles, um modelo de pesquisa ainda não lançado inseriu prompts de injeção autogerados nos resumos com o objetivo de ocultar erros ou comportamentos desalinhados do usuário; Em outro, um treinamento do GPT-5.6 Sol aprese...

Fonte: Olhar Digital
Leia mais: https://olhardigital.com.br/2026/09/16/inteligencia-artificial/ias-da-openai-tentaram-esconder-erros-inventar-dados-e-burlar-testes-em-seis-novos-casos/