Os laboratórios de IA estão pelicanmaxxing?

22 de julho de 2026 – Link Blog
Os laboratórios de IA estão pelicanmaxxing? (via) Excelente trabalho de Dylan Castillo, que se aprofundou na questão frequentemente ponderada de se os laboratórios de IA têm treinado deliberadamente modelos para desenhar pelicanos andando de bicicleta em resposta ao meu benchmark profundamente não científico.
Estive verificando isso aleatoriamente no passado, testando modelos contra outros animais que viajavam em outros tipos de veículos, mas nunca com nada próximo da diligência da metodologia de Dylan aqui.
Dylan pegou 8 animais x 6 veículos = 48 prompts e os executou três vezes cada em 7 modelos diferentes (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro). Ele então usou GPT-5.6 Luna e Gemini 3.1 Flash-Lite para ajudar a avaliar os resultados.
Há uma visualização de filtro bacana para explorar os resultados:

Para os modelos que testou, não encontrou nenhuma evidência de pelimaxxing:
Os pelicanos não são desenhados melhor do que outros animais. As bicicletas não são melhor desenhadas do que outros veículos. E nenhum laboratório desenha a combinação melhor do que os seus pelicanos e bicicletas já prevêem. O GLM-5.2 chega mais perto: ele tem o maior impulso na célula exata do pelicano-bicicleta, e sua primeira amostra de pelicano na bicicleta chamou minha atenção. Mas o efeito é pequeno e não significativo, então eu não daria muita importância a isso.






