A OpenAI anunciou na terça-feira que seu próximo modelo de IA, Astra, é o primeiro a atingir o limite da empresa para o que chama de capacidades críticas de cibersegurança. A OpenAI planeja lançar publicamente uma versão do Astra em breve, mas disponibilizará as capacidades avançadas de cibersegurança do modelo apenas para parceiros selecionados em seu programa de acesso antecipado Daybreak Blue.
Em uma reunião com repórteres, os líderes de segurança da OpenAI afirmaram que a empresa concluiu que o Astra atinge as capacidades críticas de cibersegurança descritas em seu framework de preparação, estabelecendo limites e protocolos para quando seus modelos de IA representam novos níveis de risco. A empresa afirma que um modelo de IA atingiu seu limite crítico de cibersegurança quando pode encontrar e explorar independentemente vulnerabilidades previamente desconhecidas em software do mundo real. Os líderes da OpenAI afirmaram que a empresa seguiu seu procedimento para essa situação, que é interromper o desenvolvimento adicional até que salvaguardas e medidas de segurança apropriadas possam ser implementadas.
Anteriormente, a OpenAI havia pausado alguns aspectos de treinamento relacionados ao desenvolvimento do Astra e de um futuro modelo de IA por várias semanas. Os executivos afirmam que a empresa retomou esse trabalho no Astra e no futuro modelo de IA, após implementar controles adicionais de segurança. A OpenAI diz que a pausa de várias semanas foi produtiva e que agora está confiante de que pode lançar o Astra de forma ampla de maneira segura.
O anúncio ocorre enquanto o Vale do Silício enfrenta as avançadas capacidades de cibersegurança de modelos de IA de ponta e tenta assegurar aos usuários, legisladores e outras empresas que pode mantê-los sob controle. Em julho, a OpenAI divulgou um incidente no qual agentes rodando dois de seus modelos exploraram vulnerabilidades em um ambiente de testes que deveria ser isolado, ganhando acesso à internet e hackeando a plataforma de IA de código aberto Hugging Face. (A OpenAI ressalta que o Astra não foi um dos modelos envolvidos nesse caso.)
Outras empresas de IA, como Anthropic e Meta, também divulgaram incidentes semelhantes nas últimas semanas. Na segunda-feira, a Anthropic também afirmou ter pausado alguns aspectos de treinamento de IA enquanto fortalece suas práticas de segurança.
A OpenAI afirma estar implementando uma abordagem em diversas etapas para limitar que usuários comuns acessem as capacidades avançadas de cibersegurança do Astra, incluindo um novo “monitor de desalinhamento”. Se alguém pedir para o Astra ajudá-lo a encontrar uma vulnerabilidade em um sistema de software do mundo real, por exemplo, o modelo deve se recusar a responder. A OpenAI diz que também tornou o Astra mais robusto contra tentativas de jailbreaking e, em testes, ele recusou consultas inseguras a uma taxa significativamente maior do que modelos anteriores.