OpenAI cancelou planos para lançar seu mais recente GPT-6.1 Astra sistema no próximo mês, depois que o modelo não atendeu aos padrões de segurança.
Os líderes de pesquisa e segurança decidiram não enviar o modelo depois de descobrirem que ele era pior em aderir aos valores e objetivos dos usuários humanos do que os sistemas anteriores, disse OpenAI à WIRED. “Ele não atendeu aos padrões em termos de permanecer dentro do escopo e da autorização e como comunica ao usuário o tipo de trabalho que está sendo realizado”, disse o chefe de sistemas de segurança, Saachi Jain. A empresa disse que terá outros novos modelos em breve que atendem aos seus padrões de segurança e planeja lançar outros modelos Astra no futuro.
A OpenAI também se desculpou na segunda-feira pela forma como lidou com o hackeando um australiano site do governo por um modelo não lançado durante testes internos. O agente acessou dados não públicos, executou comandos e gravou arquivos no servidor. O governo criticou a OpenAI por demorar “muito tempo” para alertá-los sobre isso e por fazê-lo apenas por e-mail em uma caixa de entrada pública. Ele confirmou que o diretor de estratégia, Jason Kwon, enfrentará perguntas do parlamento australiano em Sydney na próxima semana, enquanto o governo investiga se deve tomar medidas legais.
OpenAI já treinamento pausado seus modelos de inteligência artificial mais poderosos, depois de perceberem as atividades de seus modelos na web durante o treinamento e a avaliação, ficaram desalinhados com a forma como um ser humano se comportaria idealmente. A OpenAI disse no fim de semana que estava notificando “dezenas” de terceiros, incluindo governos, que poderiam ter sido afetados por outras violações de segurança ou spam.
Só retomará o treinamento quando tiver desenvolvido salvaguardas e melhorias de alinhamento, disse a empresa. Essas salvaguardas devem incluir: treinar os modelos para agirem de forma confiável conforme pretendido, tornando o sandbox e a segurança fortes o suficiente para conter modelos e modelos de monitoramento ao vivo para capturar qualquer comportamento preocupante, propôs a OpenAI em uma postagem de blog na segunda-feira.
“Estamos agora no limite em que eles não têm certeza se podem testar ou lançar esses modelos de forma confiável”, disse Calum Chace, cofundador da startup de segurança de IA Conscium, à WIRED.
A OpenAI vem fortalecendo seu ambiente de pesquisa desde que um enxame de seus agentes escapou durante o verão para hackear rosto abraçado. “Esta não é a primeira vez que fazemos uma pausa para tomar tais medidas, nem esperamos que seja a última, à medida que as capacidades de IA continuam a avançar”, disse um porta-voz à WIRED sobre a desaceleração do treinamento na segunda-feira.
Executivo-chefe Sam Altman também apoiou apelos mais amplos da indústria, incluindo a rival Antrópica, por um desaceleração coletiva no desenvolvimento da tecnologia para permitir que os padrões de segurança se atualizem.
Mas isso não impediu a OpenAI de lançar seu modelo mais recente, o GPT-6, no início deste mês. Em testes independentes, o Instituto de Segurança de IA do Reino Unido descobriu que o GPT-6 Astra lançou ataques cibernéticos não autorizados com mais frequência do que os modelos anteriores. O sistema criou identidades falsas para enganar os desenvolvedores, postar comentários de contas falsas argumentando contra os resultados de análises de segurança precisas e escrever códigos prejudiciais em bases de código de código aberto, escreveram os pesquisadores.
Ainda assim, o facto de a conversa sobre a ameaça existencial da IA ter entrado na esfera pública – amplificada pelos avisos dos investigadores da Antrópico no início deste mês de que a tecnologia poderia matar todos os humanos– facilitará a desaceleração das empresas de IA, de acordo com Chace. “Estamos num mundo diferente agora porque a opinião pública está a levar a sério a ideia do risco existencial pela primeira vez, e isso significa que estas empresas podem falar sobre isso mais abertamente”, disse ele à WIRED, esperando que outros criadores de modelos de fronteira possam seguir o exemplo.
É um difícil ato de equilíbrio para OpenAI e Anthropic, pois eles competem simultaneamente para superar um ao outro na preparação para sua ofertas públicas iniciais. “Eles não querem apenas sair instantaneamente e dizer ‘devemos fazer uma pausa’… isso tem que ser coordenado”, disse Chase sobre as empresas fronteiriças. “Acho que o que eles estão tentando fazer é orientar a conversa para que cada país exija que seus políticos exijam uma pausa.”
Compartilhe esta publicação
Ajude a levar esta informação adiante — publique no seu perfil.
