Microsoft afirma que novo modelo de IA de segurança cibernética ajuda MDASH a atingir 95,95% pela metade do custo

🇧🇷 PT 🇺🇸 EN

ue, 28 Jul 2026

← Voltar

Resumo Executivo

A Microsoft lançou seu primeiro modelo específico de segurança cibernética dentro do MDASH, seu equipamento de identificação e remediação de vulnerabilidades multimodelo. O

Detalhes

A Microsoft lançou seu primeiro modelo específico de segurança cibernética dentro do MDASH, seu equipamento de identificação e remediação de vulnerabilidades multimodelo. A empresa afirma que o MDASH, usando MAI-Cyber-1-Flash e GPT-5.4, obteve pontuação de 95,95% no CyberGym. Ele também afirma que a configuração custa 50% menos do que sua melhor combinação MDASH atual de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. O acesso é limitado a clientes MDASH aprovados por meio de uma versão prévia privada do Azure AI Foundry.

MAI-Cyber-1-Flash foi projetado para lidar com até 90% das tarefas MDASH, com GPT-5.4 reservado para os 10% mais difíceis. Ele está disponível apenas no MDASH, não como um modelo público independente ou como uma interface de programação de aplicativos de uso geral. A pontuação principal pertence ao MDASH executando o MAI-Cyber-1-Flash junto com o GPT-5.4, e não ao novo modelo por si só. CyberGym Nível 1 é um teste de reprodução de vulnerabilidade conhecida.

Ele fornece ao agente uma descrição da vulnerabilidade e o código-fonte não corrigido correspondente e, em seguida, verifica se pode produzir uma prova de conceito funcional. Ele não mede a descoberta cega de vulnerabilidades ou se um patch gerado está correto. A tabela de classificação pública da CyberGym não listou o resultado de 95,95% da Microsoft quando verificado em 28 de julho de 2026. Ele listou o agente Atlas da Wiz primeiro com 90,9% em uma entrada de 27 de julho, enquanto o envio do MDASH da Microsoft em 12 de maio permaneceu em 88,4%.

Os materiais públicos da Microsoft não informam se o resultado foi submetido para listagem. O resultado MDASH anterior de 96,55% da Microsoft não resolve a comparação. Esse número de junho contabilizou qualquer falha, incluindo vulnerabilidades não-alvo. Os materiais de Julho não indicam se o resultado de 95,95% utiliza o mesmo critério, pelo que as duas pontuações não podem ser lidas com segurança como uma tendência de desempenho antes e depois.

De acordo com o cartão modelo da Microsoft, o MAI-Cyber-1-Flash é um transformador esparso de mistura de especialistas com 137 bilhões de parâmetros totais, cinco bilhões de parâmetros ativos e uma janela de contexto de 256.000 tokens. É um ajuste fino de segurança cibernética do MAI-Code-1-Flash, que foi desenvolvido a partir de um ponto de verificação intermediário do treinamento MAI-Thinking-1. O cartão de modelo diz que a configuração avaliada substituiu 80% dos modelos existentes do MDASH e aumentou o resultado relatado do CyberGym de 88,4% para 95,95%. Esse número de 80% é a parcela de modelos substituídos.

O número separado de 90% é a parcela máxima de tarefas que a Microsoft afirma que o modelo menor pode realizar. Tomados em conjunto, o design divulgado aponta para o roteamento como a reivindicação técnica central: MAI-Cyber-1-Flash destina-se a lidar com a maioria das tarefas, GPT-5.4 assume o restante mais difícil e a Microsoft relata o resultado no nível do sistema MDASH. O anúncio de lançamento da Microsoft define a economia de 50% em relação ao seu atual melhor mix de modelos MDASH de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. A página do produto descreve separadamente o sistema como oferecendo “desempenho comparável a 50% do custo dos modelos líderes”.

O cartão de anúncio e modelo não divulga o uso de token, volume de chamadas, latência, combinação de tarefas ou alocação de computação por trás dessa comparação, portanto, o número ainda não pode ser reproduzido de forma independente ou normalizado em relação a outros sistemas. “O modelo é um insumo, o sistema em torno dele é o produto.” Taesoo Kim, vice-presidente de segurança de agentes da Microsoft, usou essa distinção ao descrever o MDASH em junho. Sob um chicote de terminal leve, o cartão modelo relata pontuações de 0,314 no CVEBench, 0,553 na inteligência de ameaças CyberSecEval4, 0,33 em seu teste de análise de malware e 0,651 no CRSBench em POV = 1200. O modelo obteve pontuação zero nas categorias de kernel, espaço do usuário e navegador do ExploitGym, que pede aos agentes que transformem as vulnerabilidades fornecidas e as entradas de travamento em explorações funcionais de execução de código.

Esses resultados vêm de diferentes tarefas e escalas de pontuação, portanto nenhuma é uma pontuação independente do CyberGym para MAI-Cyber-1-Flash. A Microsoft disse que todos os testes de benchmark ocorreram em um ambiente isolado de rede, sem acesso a sistemas de produção, à Internet pública ou a serviços externos. O cartão modelo também avisa que o texto e o código gerados podem estar imprecisos ou incompletos e devem ser revisados ​​antes do uso consequente. O gerenciamento de vulnerabilidades de software usando MAI-Cyber-1-Flash dentro do MDASH é o primeiro cenário que a Microsoft anunciou para o Project Perception, seu sistema mais amplo para coordenar agentes de segurança defensivos.

O Project Perception está programado para entrar em versão prévia pública em 3 de agosto, com a Microsoft planejando estender o modelo além do trabalho de vulnerabilidade de software para fluxos de trabalho de segurança adicionais. Saiba como 300 líderes empresariais estão gerenciando riscos de código aberto orientados por IA, remediação de dívidas e governança em escala. Aprenda como controlar riscos, proteger software criado por IA e manter o controle à medida que o desenvolvimento avança na velocidade da máquina. Receba as últimas notícias, insights de especialistas, recursos exclusivos e estratégias de líderes do setor, tudo gratuitamente.