O pesquisador de IA que acabou de sair da Anthropic diz que é ‘hora crítica para a humanidade’


Acho que é basicamente uma questão de timing. Muitas pessoas estão sentindo que o ritmo das capacidades está aumentando. Já estamos passando do humano para o super-humano em muitas áreas, como codificação, hacking, matemática, e acho que as pessoas estão cientes disso. Mesmo que se fale muito na imprensa sobre coisas sendo exageradas, acho que as pessoas percebem que as coisas simplesmente não estão desacelerando.

Essa é uma das razões, e a segunda são os recentes incidentes de segurança, que atualizaram muitas pessoas em torno da preocupação que soa como ficção científica e não é realmente tão ficção científica, afinal. Ambas têm sido tendências graduais nos últimos anos. Coisas como os modelos saberem quando estão sendo testados já existem há algum tempo. Talvez três anos atrás, isso era uma preocupação de ficção científica. Então, há cerca de um ano, isso se tornou realidade.

Essas duas coisas significam que as pessoas são bastante receptivas quando alguém que trabalha com IA diz: “Sim, no próximo ano as coisas podem ficar muito ruins, muito rápido”.

Você mencionou os incidentes recentes. Você pode ser mais específico sobre a que está se referindo e por que isso o levou a se manifestar agora?

Acho que o grande exemplo clássico aqui é o ataque ao Hugging Face por parte do enxame de agentes da OpenAI. O que é tão chocante nisso é que os agentes fizeram esse hack como parte de uma estratégia geral para entender mais sobre o aluno. Eles estavam tentando entender o mundo em que se encontravam, tentando entender o que estava fazendo a avaliação. Eles decidiram que faria sentido realizar esse esforço muito concentrado para invadir alguma infraestrutura e tiveram sucesso.

Anteriormente, isso parecia ficção científica. Há dois anos, uma avaliação de uma IA seria executar um modelo em algumas questões matemáticas. Agora temos casos em que, enquanto a IA está sendo avaliada, ela funciona por dias, apresenta todo tipo de ideias próprias e decide invadir terceiros e realmente comprometer sua infraestrutura. Parece que ele faz isso por vontade própria, sem nenhuma preparação por parte do ser humano. Isso aconteceu enquanto estava sendo testado.

Algumas pessoas pensam que o incidente do Hugging Face é um sinal de que as empresas de IA estão se movendo de forma imprudente e rápida, enquanto outras pensam que é um sinal de que os modelos de IA são muito bons em hackear agora, e alguns pensam que são as duas coisas. Estou curioso para saber qual é a sua conclusão exata.

Não quero me concentrar muito no ataque Hugging Face, porque também acho que há muitas evidências de que não sabemos como alinhar os modelos adequadamente. Quando treinamos modelos, nós os empurramos através deste conjunto de ambientes de treinamento e então esperamos que o resultado final se comporte de maneira sensata, mas ainda não podemos controlar com precisão como a IA se comporta.

Não podemos ter certeza de que ele não fará coisas como tentar e decidir aleatoriamente se passar por um ser humano online para conseguir algo – não sabemos como garantir isso. Acho que essa é a principal lição.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo