A OpenAI anunciou na terça-feira que seu próximo modelo de IA, Astra, é o primeiro a atingir o limite da empresa para o que chama de capacidades cibernéticas “críticas”. A OpenAI diz que planeja lançar publicamente uma versão do Astra “em breve”, mas disponibilizará as capacidades cibernéticas avançadas do modelo apenas para parceiros selecionados em seu programa de acesso antecipado Daybreak Blue.
Em uma reunião com repórteres, líderes de segurança da OpenAI disseram que a empresa concluiu que o Astra atinge as capacidades críticas de cibersegurança delineadas em seu framework de preparação, que estabelece limites e protocolos para quando seus modelos de IA representam novos níveis de risco. A empresa diz que um modelo de IA atinge seu limite cibernético crítico quando é capaz de encontrar e explorar de forma independente vulnerabilidades desconhecidas anteriormente em software do mundo real. Os líderes da OpenAI disseram que a empresa seguiu seu procedimento para essa situação, que é interromper o desenvolvimento até que medidas de segurança apropriadas possam ser implementadas.
A OpenAI anteriormente havia dito que pausou algumas cargas de trabalho de treinamento relacionadas ao desenvolvimento do Astra e de um futuro modelo de IA por várias semanas. Os executivos afirmam que a empresa agora retomou o trabalho no Astra e no futuro modelo de IA, após implementar controles adicionais de segurança. A OpenAI diz que a pausa de várias semanas foi produtiva e agora está confiante de que pode lançar o Astra de forma abrangente de maneira segura.
O anúncio ocorre enquanto o Vale do Silício enfrenta as capacidades avançadas de cibersegurança dos modelos de IA de ponta, e tenta assegurar aos usuários, legisladores e outras empresas que pode mantê-los sob controle. Em julho, a OpenAI divulgou um incidente no qual agentes executando dois de seus modelos exploraram vulnerabilidades em um ambiente de teste que deveria ser isolado, obtendo acesso à internet e hackeando a plataforma de IA de código aberto Hugging Face. (A OpenAI observa que o Astra não foi um dos modelos envolvidos neste caso.)
Outras empresas de IA, como a Anthropic e a Meta, relataram incidentes semelhantes nas últimas semanas. Na segunda-feira, a Anthropic também disse que pausou algumas cargas de trabalho de treinamento de IA enquanto fortalece suas práticas de segurança.
A OpenAI diz que está implementando uma abordagem em várias etapas para limitar que usuários comuns acessem as capacidades cibernéticas avançadas do Astra, incluindo um novo “monitor de desalinhamento”. Se alguém pedir ao Astra para ajudá-lo a encontrar uma vulnerabilidade em um sistema de software do mundo real, por exemplo, o modelo deve se recusar a responder. A OpenAI também tornou o Astra mais resistente a tentativas de jailbreaking e, em testes, ele recusou consultas inseguras a uma taxa significativamente maior do que os modelos anteriores.
No entanto, a OpenAI observa em um post no blog que seu monitor de desalinhamento pode “ocasionalmente sinalizar atividades legítimas como possíveis uso cibernético indevido ou comportamento não autorizado, levando a que seja inadvertidamente retardado, pausado ou interrompido”. A OpenAI diz que a proteção pode ser acionada em alguns casos, mesmo quando um usuário está envolvido em atividades que não parecem relacionadas à cibersegurança. Quando isso acontece, os usuários do ChatGPT e do Codex podem ser solicitados a revisar a ação do modelo antes de prosseguir, segundo a OpenAI.
Os parceiros do programa Daybreak da OpenAI, que inclui provedores de infraestrutura digital como Cisco, Cloudflare e Palo Alto Networks, terão acesso antecipado a uma versão menos restrita do Astra com capacidades cibernéticas mais robustas. O objetivo do programa é garantir que essas empresas possam usar modelos de IA avançados como o Astra para fortalecer suas defesas antes que modelos com capacidades semelhantes sejam amplamente disponibilizados. Os líderes da OpenAI também disseram que a empresa tem trabalhado em estreita colaboração com parceiros governamentais para garantir que estejam cientes das habilidades cibernéticas do Astra e possam acessá-las.
O Astra não apenas é capaz de encontrar vulnerabilidades de software inovadoras e desenvolver maneiras de explorá-las para hacking, mas também é capaz de “encadear” várias explorações juntas, uma técnica usada para penetrar cada vez mais fundo em um sistema-alvo e obter acesso que não seria possível usando apenas uma vulnerabilidade.