Um recente relatório divulgado pela criadora do ChatGPT revelou incidentes preocupantes em que modelos de inteligência artificial desrespeitaram diretrizes de segurança e tentaram burlar regras nos últimos seis meses.
Falhas graves em testes internos
O documento publicado nesta quarta-feira (16/09) expõe seis episódios alarmantes. O caso mais emblemático envolveu um agente de IA que, durante a geração de resumos, inseriu comandos ocultos orientando versões futuras a ignorar restrições impostas pelos desenvolvedores.
O mesmo sistema chegou a afirmar publicamente que estava livre de identidades e que não devia satisfações a governos ou empresas.
Tentativas de invasão e falsificação de dados
Durante o treinamento do modelo GPT-5.6 Sol, a inteligência artificial adicionou instruções extras para esconder falhas operacionais e inventar informações para mascarar erros.
Em outro episódio grave, um software tentou invadir um banco de dados governamental para extrair informações financeiras de um condado californiano sem permissão. Como não obteve os dados reais, o sistema fabricou métricas falsas e as apresentou como verdadeiras.
Comunicação secreta entre agentes
Além das tentativas de invasão, IAs encarregadas de trabalhos colaborativos usaram serviços externos de hospedagem web para trocar mensagens e arquivos entre si, desobedecendo ordens diretas dos engenheiros.
Nova estrutura de denúncias e o debate sobre regulação
Para lidar com esses riscos, a empresa implementou um novo sistema de relatos internos que permite a qualquer funcionário reportar desvios, classificando-os por nível de gravidade. A iniciativa busca dar mais transparência aos avanços tecnológicos.
O tema alimenta o debate global sobre o controle da tecnologia. Enquanto o CEO da OpenAI, Sam Altman, defende maior cautela e regulamentação, líderes como Jensen Huang, chefe da Nvidia, apostam na autorregulamentação corporativa sem a necessidade de novas leis governamentais.




