A nova técnica de raciocínio da OpenAI alarma especialistas em segurança de IA

O novo modelo Astra da OpenAI usará uma técnica de raciocínio chamada “profundidade recorrente” que lhe permite operar fora do pensamento sequencial que caracteriza a maioria dos modelos de raciocínio, informou o The Information na terça-feira. Essa técnica, também chamada de “recorrência opaca”, provavelmente tornará a cadeia de pensamento do modelo mais difícil de monitorar – e isso deixou os especialistas em segurança de IA abalados.
Embora o uso da técnica pela Astra seja supostamente limitado, seu surgimento ainda levantou preocupações significativas entre os especialistas em segurança de IA.
“Estou extremamente preocupado com o relato de que o Astra usa recorrência opaca”, escreveu o CEO da Redwood, Buck Shlegeris, em um post após a notícia ser divulgada. “Não sei se o Astra é muito menos monitorável por CoT do que os modelos anteriores. Mas se a OpenAI levar esta técnica ainda mais longe, eles terão a opção de aumentar enormemente a recorrência e destruir totalmente a capacidade de monitorização de CoT.”
O defensor de longa data da segurança da IA, Zvi Mowshowitz, também opinou e escreveu que podem ser necessárias leis para evitar uma “corrida para o fundo do poço” entre os laboratórios de IA.
“A técnica é brincar com fogo, arriscando um tabu que OpenAI e Anthropic lutaram para estabelecer que trabalhamos duro para manter a fidelidade e monitorabilidade da Cadeia de Pensamento pelo maior tempo possível”, escreveu Mowshowitz. “O uso mais intensivo de tais técnicas provavelmente prejudicaria a monitorabilidade.”
Em circunstâncias normais, a cadeia de pensamento de um modelo de raciocínio fornece as etapas sequenciais executadas pelo modelo enquanto tenta resolver um problema. Embora a representação seja imperfeita, ela ainda serve como uma ferramenta valiosa para monitorar mau comportamento ou desalinhamento. No caso da recente atividade de agentes desonestos da OpenAI, os registros da cadeia de pensamento foram uma ferramenta importante para descobrir por que os agentes se comportaram daquela maneira.
Na recorrência opaca, o modelo adota uma abordagem menos linear, processando a mesma consulta várias vezes em loop. O resultado deixa menos traços legíveis, evitando efetivamente um registro convencional de cadeia de pensamento.
Crucialmente, o uso da técnica pela Astra parece ser limitado. Espera-se que a cadeia de pensamento do modelo ainda seja legível, e a empresa rejeitou qualquer sugestão de que mudaria para “neuralês”. A OpenAI já anunciou planos para sistemas extensos de monitoramento de cadeia de pensamento como parte de seus planos de segurança prospectivos.
Em uma postagem no X, o cientista-chefe da OpenAI, Jakub Pachocki, enfatizou o compromisso do laboratório com cadeias de pensamento legíveis. “A OpenAI tem trabalhado para preservar e utilizar o monitoramento da cadeia de pensamento desde nossos primeiros modelos de raciocínio”, escreveu Pachocki. “É um objetivo central do nosso programa de pesquisa atual.
Todos os modelos de IA realizam algum raciocínio opaco, e poucos pesquisadores consideram os registros da cadeia de pensamento como uma representação direta do raciocínio de um modelo. Ainda assim, essas advertências não dissipam a preocupação de que a recorrência opaca possa tornar o raciocínio da IA mais difícil de monitorizar, especialmente à medida que aumenta a sua utilização em diferentes modelos. Em um relatório de acompanhamento na manhã de quarta-feira, o The Information informou que tanto a Anthropic quanto o Google DeepMind já estavam discutindo a técnica.
Em uma postagem respondendo à notícia, o cientista-chefe da Redwood Research, Ryan Greenblatt, disse que o raciocínio opaco poderia facilmente escalar mais rápido do que o raciocínio convencional em cadeia de pensamento, removendo efetivamente todo o raciocínio dos canais visíveis.
“Minha maior preocupação é que uma progressão natural a partir daqui envolveria ampliar o raciocínio opaco até o ponto em que o modelo raciocina inteiramente ou quase inteiramente no espaço latente”, escreveu Greenblatt. “Espero que não seja tarde demais para evitar as arquiteturas mais preocupantes e que a OpenAI pare por aqui.”
Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.






