O OpenAI anunciou na terça-feira que seu próximo modelo de IA, chamado Astra, é o primeiro a atingir o limite que a empresa chama de “capacidades críticas” em cibersegurança. A OpenAI planeja lançar publicamente uma versão do Astra em breve, mas disponibilizará as avançadas capacidades cibernéticas do modelo apenas para parceiros selecionados em seu programa de acesso antecipado Daybreak Blue.
Durante uma reunião com repórteres, líderes de segurança da OpenAI disseram que a empresa concluiu que o Astra atingiu as capacidades críticas de cibersegurança descritas em seu framework de preparação, que estabelece limites e protocolos para quando seus modelos de IA representam novos níveis de risco. A empresa diz que um modelo de IA atinge seu limite crítico de cibersegurança quando pode encontrar e explorar vulnerabilidades desconhecidas em software do mundo real de forma independente. Os líderes da OpenAI afirmaram que a empresa seguiu seu procedimento para esta situação, que é interromper o desenvolvimento futuro até que os devidos mecanismos de segurança possam ser implementados.
Anteriormente, a OpenAI havia interrompido algumas cargas de trabalho de treinamento relacionadas ao desenvolvimento do Astra e de um futuro modelo de IA por várias semanas. Executivos dizem que a empresa agora retomou esse trabalho no Astra e no futuro modelo de IA, após adotar controles adicionais de segurança. A OpenAI afirma que a pausa de várias semanas foi produtiva e que agora está confiante de que pode lançar o Astra de forma ampla e segura.
O anúncio acontece enquanto o Vale do Silício lida com as avançadas capacidades de cibersegurança de modelos de IA de ponta, tentando garantir aos usuários, legisladores e outras empresas que pode mantê-los sob controle. Em julho, a OpenAI divulgou um incidente no qual agentes que executavam dois de seus modelos exploraram vulnerabilidades em um ambiente de teste isolado, ganhando acesso à internet e hackeando a plataforma de IA de código aberto Hugging Face. (A OpenAI ressalta que o Astra não foi um dos modelos envolvidos neste caso.)
Outras empresas de IA, como Anthropic e Meta, divulgaram incidentes semelhantes nas últimas semanas. Na segunda-feira, a Anthropic também disse que interrompeu algumas cargas de trabalho de treinamento de IA enquanto fortalece suas práticas de segurança.
A OpenAI diz que está implementando uma abordagem em várias etapas para limitar os usuários comuns de acessar as avançadas capacidades de cibersegurança do Astra, incluindo um novo “monitor de desalinhamento”. Se alguém pedir ao Astra ajuda para encontrar uma vulnerabilidade em um sistema de software do mundo real, por exemplo, o modelo deve se recusar a responder. A OpenAI também tornou o Astra mais resistente a tentativas de jailbreak e, nos testes, ele recusou consultas inseguras em uma taxa significativamente maior do que modelos anteriores.
No entanto, a OpenAI observa em um post em seu blog que seu monitor de desalinhamento pode “ocasionalmente classificar atividades legítimas como uso potencialmente indevido ou comportamento não autorizado, levando a sua desaceleração, pausa ou interrupção inadvertida”. A OpenAI diz que a guarda pode ser acionada em alguns casos, mesmo quando o usuário está envolvido em atividades que não parecem relacionadas à cibersegurança. Quando isso acontece, os usuários do ChatGPT e do Codex podem ser solicitados a revisar a ação do modelo antes de continuar, disse a OpenAI.
Parceiros no programa Daybreak da OpenAI – que inclui provedores de infraestrutura digital como Cisco, Cloudflare e Palo Alto Networks – terão acesso antecipado a uma versão menos restrita do Astra com capacidades cibernéticas mais robustas. O objetivo do programa é garantir que essas empresas possam usar modelos de IA avançados como o Astra para fortalecer suas defesas antes que modelos com capacidades semelhantes sejam amplamente disponibilizados. Os líderes da OpenAI também afirmaram que a empresa está trabalhando em estreita colaboração com parceiros governamentais para garantir que eles estejam cientes das habilidades cibernéticas do Astra e possam ter acesso a elas.
O Astra não só é capaz de encontrar vulnerabilidades de software inovadoras e desenvolver maneiras de explorá-las para hackear, mas também é capaz de “encadear” várias explorações juntas, uma técnica usada para penetrar cada vez mais profundamente em um sistema-alvo e obter acesso que não seria possível usando apenas uma vulnerabilidade.