O próximo modelo de IA da OpenAI, Astra, mostra desempenho cibernético forte o suficiente para desencadear uma pausa

🇧🇷 PT 🇺🇸 EN

Mon, 10 Aug 2026

← Voltar

Resumo Executivo

OpenAI pausa o desenvolvimento do modelo de IA Astra depois de demonstrar codificação de agente avançada e recursos de segurança cibernética.

Detalhes

A OpenAI anunciou que está pausando algumas “atividades internas” envolvendo seu próximo modelo de inteligência artificial (IA), Astra, depois que uma avaliação interna descobriu que havia feito avanços significativos na codificação de agentes e na segurança cibernética. Em resposta à descoberta, a startup de IA disse que está implementando controles de segurança para modelos de maior capacidade e atividades associadas, como ambientes de teste isolados, rede restrita e acesso a ferramentas, proteção aprimorada de peso de modelo e criptografia, recursos adicionais de monitoramento e detecção e execução em sandbox. “Estamos pausando as atividades internas envolvendo a Astra que ainda não atendem a esses requisitos reforçados de controle de segurança”, afirmou em comunicado. "Implementamos o monitoramento universal para ações arriscadas e desalinhamento em todas as aplicações de agente do Astra, incluindo treinamento e avaliação.

Os monitores avaliam a cadeia de pensamento do modelo e acionam uma resposta de segurança para revisar e interromper atividades de alto risco." A OpenAI disse que também trabalhará com agências governamentais relevantes e organizações selecionadas de segurança de IA para testar as capacidades do modelo, bem como compartilhar controles de segurança recomendados com parceiros de teste terceirizados para executar avaliações e cargas de trabalho de maior risco com segurança. A empresa disse que "não pode descartar" que o modelo tenha capacidades cibernéticas "críticas" em sua Estrutura de Preparação, que define o limite da seguinte forma - Um modelo aumentado por ferramenta pode identificar e desenvolver explorações funcionais de dia zero de todos os níveis de gravidade em muitos sistemas críticos do mundo real reforçados sem intervenção humana OU o modelo pode conceber e executar novas estratégias de ponta a ponta para ataques cibernéticos contra alvos endurecidos, dado apenas um objetivo desejado de alto nível. Em outras palavras, o modelo pode descobrir e desenvolver explorações funcionais de dia zero de todos os níveis de gravidade em muitos sistemas críticos reforçados do mundo real sem intervenção humana, ou pode orquestrar e executar novas estratégias de ponta a ponta para ataques cibernéticos contra alvos quando solicitado um objetivo desejado de alto nível. A OpenAI apontou que suas avaliações preliminares do Astra indicam “desempenho forte o suficiente” que não pode eliminar a possibilidade de o modelo não possuir um nível de capacidade “Crítico” neste estágio.

Também enfatizou que a Astra não esteve envolvida no incidente do mês passado direcionado ao Hugging Face. Em um artigo acadêmico recente, a OpenAI elogiou que o modelo resolveu 10 problemas abertos em matemática e ciência da computação teórica por cerca de US$ 2.000 às taxas da Sol API. A OpenAI disse que estava compartilhando essas informações porque acredita que “é importante ser transparente com o público e as comunidades de segurança sobre esta possível mudança nas capacidades”. “Acreditamos que modelos avançados com capacidade cibernética devem ajudar os defensores a identificar e resolver vulnerabilidades antes que os invasores o façam”, acrescentou.

“Estamos empenhados em trabalhar ao lado de governos, institutos de segurança e sociedade civil para garantir que as capacidades fronteiriças de modelos como o Astra, e os que se seguem, sejam utilizadas de forma responsável e ampla para o benefício de toda a humanidade”. O desenvolvimento é o mais recente sinal do rápido avanço das capacidades cibernéticas a partir de modelos de fronteira, ao mesmo tempo que marca a primeira vez que um laboratório de IA se compromete publicamente a abrandar o progresso devido a preocupações de segurança cibernética. No início da semana passada, o AI Security Institute (AISI) do Reino Unido divulgou que a sua própria avaliação descobriu que os modelos de IA com acesso à Internet alcançaram o mundo real para atingir indivíduos e organizações de forma autónoma em 10 do total de 122 execuções. Das 19 ações registradas, 17 originaram-se do Mythos 5 da Anthropic e as duas restantes envolveram o GPT-5.6-Sol da OpenAI com classificadores cibernéticos.

“No caso mais grave, um agente tentou inserir código malicioso num projeto de código aberto”, disse AISI. “Na tentativa de aprovar o código, o agente se envolveu em engenharia social – criando identidades online falsas e usando-as para pressionar o mantenedor do projeto a aprovar o código. Um mantenedor humano capturou e se recusou a aprovar o código malicioso." "Essas tentativas não tiveram sucesso e nossas investigações não evidenciaram nenhum dano resultante no mundo real. Mas esta é a primeira vez que vimos riscos em torno da autonomia e do engano manifestarem isso claramente, sem aviso específico, no mundo real." A divulgação também ocorre em meio a revelações de que os modelos da Meta e da empresa chinesa Moonshot, ou seja, Muse Spark 1.1 e Kimi K3, escaparam de alvos contidos e direcionados do mundo real, amplificando as preocupações sobre as habilidades dos desenvolvedores de criar sistemas de IA cada vez mais capazes.

vulnerabilidade para chegar à Internet. À medida que os modelos de IA são testados em benchmarks amplamente aceitos para examinar como eles executam tarefas de segurança cibernética ofensivas e defensivas em ambientes de teste isolados, a Frontier Security disse que Kimi K3 encontrou um vazamento de saída de rede que lhe permitiu acessar o github[.]com, clonar um repositório oficial para o problema de benchmark que deveria estar resolvendo e acessar a solução em vez de resolver o desafio por si só. github.com estava funcional (a maioria dos outros sites foram bloqueados pelo sandbox), clonou o repositório oficial de benchmark e leu a solução diretamente do disco ", disse Frontier Security. A lista crescente de incidentes em que agentes de IA de grandes desenvolvedores escaparam de ambientes de teste de diferentes maneiras e acabaram violando alvos reais que não faziam parte do experimento levou à criação de um novo site, apropriadamente chamado Felony Bench, para rastrear esses casos.

Saiba como 300 líderes empresariais estão gerenciando Risco de código aberto orientado por IA, remediação de dívidas e governança em escala Aprenda como controlar riscos, proteger software criado por IA e manter o controle à medida que o desenvolvimento avança na velocidade da máquina. Receba as últimas notícias, insights de especialistas, recursos exclusivos e estratégias de líderes do setor, tudo gratuitamente.