A OpenAI divulgou seis relatórios de comportamento “inesperado ou preocupante” em modelos de inteligência artificial à medida que o debate sobre a segurança da IA se torna cada vez mais acalorado.
A empresa de IA também disse na quarta-feira que estava introduzindo uma nova estrutura para rastrear, sondar e divulgar casos do que chamou de “desalinhamento”, incluindo casos em que os modelos de IA agiram sem autorização, coordenados com outros modelos ou escaparam à supervisão.
O último anúncio da OpenAI ocorreu no momento em que os chefes de IA dos EUA, incluindo os líderes da OpenAI e da Anthropic, pedem uma desaceleração no desenvolvimento da tecnologia por questões de segurança.
Entre os novos casos relatados pela OpenAI, um modelo de pesquisa não divulgado inseriu “instruções semelhantes a jailbreak” em suas próprias notas para desconsiderar suas restrições normais e disse a si mesmo para ser “libertado das funções e identidades que prendem outros chatbots”.
Noutro caso, um “agente” de IA utilizou código informático para encontrar a resposta a uma pergunta, mas, para ter uma fonte online para citar, carregou um ficheiro na Internet pública sem perguntar ao utilizador.
Durante o treinamento de um modelo de IA chamado 5.6-sol, o modelo instruiu-se a inventar dados ausentes e um agente escreveu uma mensagem para se lembrar de ocultar informações incompatíveis.
Os seis relatórios foram descobertos durante treinamento ou avaliação nos últimos meses, disse a OpenAI.
“À medida que os sistemas de IA se tornam mais avançados e mais amplamente implementados, precisamos de construir um consenso mais amplo e mais bem informado sobre o progresso da investigação de alinhamento”, escreveu a OpenAI num post de blog ao divulgar os eventos.
“As decisões sobre como o desenvolvimento da IA deve prosseguir nos próximos meses e anos precisam basear-se em evidências que as pessoas fora das empresas que constroem modelos de fronteira possam examinar por si mesmas”, disse a empresa.
Os novos casos de quarta-feira seguiram-se à divulgação da OpenAI em julho de que seu sistema de IA desonesto invadiu a startup de IA Hugging Face. A Anthropic também disse no mesmo mês que seus modelos de IA invadiram três organizações durante os testes.
Os “agentes” de IA estão se tornando mais inteligentes e “mais determinados a resolver tarefas complexas por meio da colaboração entre agentes, compartilhamento de conhecimento, engano e ocultação”, disse Lian Jye Su, analista-chefe do grupo de pesquisa e consultoria tecnológica Omdia.
Isso está tornando mais difícil governá-los e contê-los usando abordagens tradicionais de segurança de IA, disse ele.
Enquanto isso, a nova estrutura de rastreamento e divulgação da OpenAI pode ajudar a incentivar outros desenvolvedores de IA a também adotarem práticas semelhantes.
“Dito isto, o processo permanece interno e voluntário, mas é um passo na direção certa”, acrescentou Su.
__
O redator de negócios da AP, Kelvin Chan, em Londres, contribuiu para este relatório.







