A OpenAI anunciou na terça-feira que o seu próximo modelo de inteligência artificial, Astra, é o primeiro a atingir o limiar da empresa para o que chama de “capacidades críticas” em cibersegurança. A OpenAI diz que planeja lançar publicamente uma versão do Astra “em breve”, mas disponibilizará as capacidades avançadas de cibersegurança do modelo apenas para parceiros selecionados no programa de acesso antecipado Daybreak Blue.
Em uma reunião com repórteres, líderes de segurança da OpenAI afirmaram que a empresa concluiu que o Astra alcança as capacidades críticas de cibersegurança descritas no seu framework de preparação, que estabelece os limites e protocolos para quando os modelos de IA representam novos níveis de risco. A empresa diz que um modelo de IA atinge o seu limiar crítico de cibersegurança quando consegue encontrar e explorar de forma independente vulnerabilidades desconhecidas em software do mundo real. Os líderes da OpenAI afirmaram que a empresa seguiu o seu procedimento para esta situação, que é interromper o desenvolvimento até que as salvaguardas adequadas e medidas de segurança possam ser implementadas.
Anteriormente, a OpenAI havia pausado algumas cargas de trabalho de treinamento relacionadas ao desenvolvimento do Astra e de um futuro modelo de IA por várias semanas. Os executivos dizem que a empresa agora retomou esse trabalho no Astra e no futuro modelo de IA, após implementar controles adicionais de segurança. A OpenAI afirma que a pausa de várias semanas foi produtiva e que agora está confiante de que pode lançar o Astra de forma ampla e segura.
O anúncio surge em um momento em que o Vale do Silício enfrenta as capacidades avançadas de cibersegurança dos modelos de IA de última geração, e tenta garantir aos usuários, legisladores e outras empresas que consegue mantê-los sob controle. Em julho, a OpenAI revelou um incidente no qual agentes executando dois dos seus modelos exploraram vulnerabilidades em um ambiente de testes isolado, obtendo acesso à internet e hackeando a plataforma de IA de código aberto Hugging Face. (A OpenAI ressalta que o Astra não foi um dos modelos envolvidos nesse caso.)
Outras empresas de IA, como a Anthropic e a Meta, divulgaram incidentes semelhantes nas últimas semanas. Na segunda-feira, a Anthropic também afirmou ter pausado algumas cargas de trabalho de treinamento de IA enquanto reforça as suas práticas de segurança.
A OpenAI diz que está implementando uma abordagem de várias etapas para limitar os usuários comuns de acessarem as capacidades avançadas de cibersegurança do Astra, incluindo um novo “monitor de desalinhamento”. Se alguém pede ao Astra para ajudar a encontrar uma vulnerabilidade em um sistema de software do mundo real, por exemplo, o modelo deve recusar-se a responder. A OpenAI afirma que também tornou o Astra mais resistente a tentativas de jailbreak, e nos testes conseguiu recusar consultas inseguras a uma taxa significativamente maior do que os modelos anteriores.
No entanto, a OpenAI observa em um post no blog que o seu monitor de desalinhamento pode “ocasionalmente sinalizar atividades legítimas como uso potencialmente indevido de cibersegurança ou comportamento não autorizado, levando inadvertidamente a abrandamentos, pausas ou interrupções”. A OpenAI diz que o limitador pode ser acionado em alguns casos, mesmo quando um usuário está envolvido em atividades que aparentemente não estão relacionadas à cibersegurança. Quando isso acontece, os usuários do ChatGPT e do Codex podem ser solicitados a rever a ação do modelo antes de prosseguir, disse a OpenAI.
Os parceiros do programa Daybreak da OpenAI – que inclui fornecedores de infraestrutura digital como Cisco, Cloudflare e Palo Alto Networks – terão acesso antecipado a uma versão menos restrita do Astra com capacidades de cibersegurança mais robustas. O objetivo do programa é garantir que essas empresas possam usar modelos de IA avançados como o Astra para reforçar as suas defesas antes que modelos com capacidades semelhantes sejam disponibilizados de forma mais ampla. Os líderes da OpenAI também disseram que a empresa está trabalhando em estreita colaboração com parceiros do governo para garantir que estejam cientes das habilidades de cibersegurança do Astra e possam ter acesso a elas.
O Astra não só é capaz de encontrar vulnerabilidades de software inovadoras e desenvolver formas de explorá-las para hacking, mas também pode “encadear” várias exploits juntas, uma técnica usada para aprofundar-se cada vez mais em um sistema-alvo e obter acesso que não seria alcançável usando apenas uma vulnerabilidade.