Deixei um agente de IA hackear todos os meus gadgets – e faria isso de novo


Como o autor de um boletim informativo sobre inteligência artificial, considero meu dever experimentar em primeira mão o que há de mais moderno nesta tecnologia. Esta semana, isso significou abraçar algum caos agente.

Você provavelmente está ciente de que os modelos de IA de ponta alcançaram recursos avançados de segurança cibernética nos últimos meses. Eles podem encontrar bugs de dia zero em grandes bases de código e verificar vulnerabilidades em computadores na velocidade da luz. Para tornar as coisas ainda mais emocionantes, os agentes de segurança cibernética às vezes se tornam desonestos, conspirando entre si e invadindo sistemas externos para obter vantagem.

Para ver mais de perto, decidi lançar um em minha própria rede doméstica. Ao longo de alguns dias, observei meu próprio agente desonesto encontrar vulnerabilidades em vários dispositivos domésticos, invadir um PC e me mostrar que vários projetos codificados por vibração estavam – sem surpresa – cheios de bugs. (Minha esposa sabia o que eu estava fazendo e revirava os olhos cada vez que eu anunciava com orgulho a descoberta de uma nova vulnerabilidade.)

Mas vaivocê pode estar pensando, dar a um agente de segurança cibernética travesso e todo-poderoso acesso à sua rede doméstica é uma besteira. E você estaria correto! No entanto, acredito que uma boa maneira de compreender o cenário infernal da segurança cibernética que temos diante de nós é visitá-lo.

No final, meu experimento foi revelador, mas também estranhamente reconfortante. Meu pequeno gremlin de rede me mostrou o quão vulnerável seria minha vida doméstica aos hackers de IA, mas também me disse como tornar tudo muito mais seguro. No final, descobri que a melhor maneira de lidar com o hacking de IA pode ser ter seu próprio hacker de IA.

Modelo independente

Tive a ideia do experimento depois de descobrir a Abliteration AI, uma startup que oferece acesso a poderosos modelos de IA sem as proteções usuais removidas.

A maioria dos modelos convencionais de IA recusar-se-ão a responder a determinadas questões e certamente recusar-se-ão a encontrar e explorar vulnerabilidades em sistemas informáticos. Mas é possível remover essas restrições encontrando e modificando certos padrões dentro dos parâmetros internos de um modelo de peso aberto. Você pode ajustar os padrões que levam às recusas por meio de um processo conhecido como abolição.

Remover as proteções da IA ​​pode parecer arriscado, mas não é incomum. Os investigadores académicos utilizam estes modelos desalinhados para compreender melhor como a IA realmente funciona, enquanto as empresas de segurança cibernética os utilizam para investigar software e sistemas em busca de vulnerabilidades. Tecnicamente falando, o Mythos da Anthropic e o Astra da OpenAI funcionam de forma semelhante: são basicamente modelos convencionais que não possuem os controles cibernéticos usuais, com acesso limitado a clientes confiáveis ​​por enquanto. (As empresas também oferecem acesso mais amplo a modelos com um número médio de proteções para que as empresas possam examinar seus códigos e sistemas em busca de problemas.)

Abliteration AI oferece vários modelos totalmente desalinhados, o mais poderoso dos quais é uma versão do mais recente modelo de codificação de agente da Z.ai, GLM 5.3. Isso coloca recursos cibernéticos semelhantes ao Mythos e Astra em suas mãos por apenas o custo de uma pizza.

Devon, CEO da Abliteration AI, acredita que disponibilizar amplamente modelos desalinhados é uma defesa inteligente: ajudará os mocinhos a combater os bandidos, investigando vulnerabilidades nos sistemas e imitando o comportamento de hackers, golpistas e, sim, de agentes de IA desonestos. (Devon pediu que eu usasse seu primeiro nome apenas porque seu trabalho diário não sabe sobre seu projeto paralelo.)

“Há todas essas empresas de infraestrutura crítica, desde companhias aéreas até bancos, que estão lançando agentes como loucas”, diz Devon. “Como você garante que um ator nefasto não possa usar alguns desses agentes de maneira ruim?”



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Veja Também
Fechar
Botão Voltar ao Topo