Kimi K3 e o que ainda podemos aprender com o benchmark Pelican

Kimi K3 e o que ainda podemos aprender com o benchmark Pelican


Kimi K3 e o que ainda podemos aprender com o benchmark Pelican

16 de julho de 2026

O laboratório chinês de IA Moonshot AI anunciou o Kimi K3 esta manhã, descrevendo-o como seu “modelo mais capaz até o momento, com 2,8 trilhões de parâmetros”. Atualmente está disponível através do site e API, mas um lançamento de peso aberto está prometido “até 27 de julho de 2026”.

Moonshot está chamando este de o primeiro “modelo aberto da classe 3T” (acho que eles estão arredondando 2,8 trilhões para 3 trilhões), tirando a coroa do 1.6T v4 Pro da DeepSeek. Seus benchmarks auto-relatados mostram que o K3 superou principalmente Claude Opus 4.8 max e GPT-5.5 high, enquanto perdeu para Claude Fable 5 e GPT-5.6 Sol.

Alguns destaques do Relatório de análise artificial no modelo:

  • “Em nossa avaliação pessoal de trabalho de conhecimento de longo horizonte, Kimi K3 atinge um Elo geral de 1547, +732 pontos de Kimi K2.6 e atrás apenas de Claude Fable 5.”
  • “O custo por tarefa (US$ 0,94) é semelhante ao GPT-5.6 Sol (US$ 1,04), aproximadamente metade do preço do Opus 4.8 (US$ 1,80) e superior aos pares de peso aberto”
  • “O uso de tokens de Kimi K3 no Índice de Inteligência de Análise Artificial diminuiu significativamente, usando 21% menos tokens de saída do que K2.6.”

O modelo também é agora o modelo líder na arena Frontend Code da Arena.aisuperando até mesmo Claude Fable 5.

O novo modelo é notável pelo preço: tokens de entrada de US$ 3/milhão e tokens de saída de US$ 15/milhão, colocando-o no mesmo nível da série Claude Sonnet da Anthropic e tornando-o o modelo mais caro lançado por um laboratório de IA chinês até o momento. Este é um aumento significativo em relação aos modelos anteriores, como o Kimi K2.6, de US$ 0,95/US$ 4. 2,8 trilhões de parâmetros também são mais que o dobro do tamanho desse modelo 1T.

Mas como é que o pelicano?

Usei o OpenRouter (para evitar a inscrição em uma chave de API Moonshot) com o plugin llm-openrouter para gerar um SVG de um pelicano andando de bicicleta:

llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

Aqui está a transcrição. Parece assim:

Kimi K3 e o que ainda podemos aprender com o benchmark Pelican

Esse pelicano pegou 95 fichas de entrada e 16.658 fichas de saída (13.241 eram fichas de raciocínio), por um custo total de 25 centavos!

Como o K3 aceita entrada de imagem, executei-o no SVG renderizado acima (com meu prompt de texto alternativo) e voltei (por 0,6 centavos):

Ilustração dos desenhos animados de um pelicano branco usando um lenço vermelho, andando de bicicleta vermelha ao longo de uma estrada cinza com linhas tracejadas brancas; o pelicano tem um grande bico laranja e pés palmados laranja pedalando, com linhas de movimento brancas atrás dele; o fundo mostra um céu azul claro com nuvens brancas, um sol amarelo, dois pequenos pássaros pretos voando e grama verde com pequenas flores brancas em primeiro plano

O que podemos aprender com o pelicano?

Meu teste Gerar um SVG de um pelicano andando de bicicleta já tem 21 meses. Nunca foi uma referência particularmente excelente. Tudo começou como uma piada sobre como é absurdamente difícil comparar esses modelos, mas depois, no primeiro ano, descobriu-se que havia uma correlação surpreendente com a qualidade real dos modelos.

Essa conexão foi praticamente cortada agora. Os pelicanos GPT-5.6 e Claude Fable 5 são superados pelo GLM-5.2, e por mais que eu ame o GLM, não acho que seja um modelo da classe Fable.

(Ainda não estou convencido de que os laboratórios estejam treinando para o benchmark – se estivessem, esperaria resultados muito melhores. Há uma chance de que o Gemini tenha otimizado para qualquer combinação de um animal em um veículo!)

A maior limitação do Pelican é que ele não aborda o que mais importa para o modelo atual: chamadas de ferramentas de agente e a capacidade de operar ferramentas de maneira confiável à medida que as conversas aumentam.

Então não use pelicanos para comparar modelos!

Dito isso, ainda obtenho um valor razoável executando o benchmark sozinho.

Em primeiro lugar, é uma função de força para realmente testar o modelo. Se eu lhe mostrar um pelicano, significa que consegui executar um prompt nele. Se o modelo tiver uma API oficial, usarei isso, se for aberto (e pequeno o suficiente para caber em um MacBook Pro M5 de 128 GB), tentarei executá-lo em minha própria máquina, geralmente via llama.cpp ou LM Studio ou Ollama. Usarei frequentemente o OpenRouter, pois ele geralmente fornece um proxy para uma API oficial sem que eu precise de uma nova chave de API.

A maioria dos meus pelicanos são gerados usando minha ferramenta LLM CLI, o que me ajuda a garantir que os modelos mais recentes sejam suportados por ela (por meio de um de seus plug-ins).

Mais importante ainda, mesmo o simples ato de “Gerar um SVG de um pelicano andando de bicicleta” pode revelar características interessantes do modelo.

Considere o resultado do Kimi K3 hoje. A execução dessas instruções simples ajudou a enfatizar vários pontos sobre o modelo.

  1. No momento, ele só precisa de um esforço de raciocínio, “máximo” – e isso fica evidente. O modelo consumiu 13.241 tokens de raciocínio para gerar 3.417 tokens de resposta. Isto é caro – o pelicano custa 25 centavos!
  2. Como o prompt “Gerar um SVG de um pelicano andando de bicicleta” soma 95 tokens de entrada? O tokenizer da OpenAI conta 10, o da Anthropic conta 10 para Opus 4.6, 30 para Opus 4.7 e 25 para Sonnet 5/Fable 5. Solicitar “oi” para Kimi K3 contou 86 tokens, sugerindo que pode haver um prompt de sistema oculto de 85 tokens. Ele se recusou a vazar.
  3. O Vision funciona bem: o texto alternativo gerado é muito bom.

Atualmente, o K3 tem apenas um nível de esforço de pensamento, mas recentemente obtive bastante valor ao executar o mesmo prompt do Pelican em diferentes níveis de esforço para ter uma ideia rápida do impacto que eles têm. Aqui está minha matriz para a família de modelos GPT-5.6, por exemplo.

Na verdade, as principais coisas que ganho com o teste do pelicano são:

  1. É um exercício de “olá, mundo” para solicitar um modelo
  2. Uma estimativa aproximada de custo e raciocínio para uma tarefa simples
  3. Confirmação de que o modelo pode gerar SVG válido e tem uma ideia básica de geometria e consciência espacial. Este é um negócio muito maior para os modelos menores que rodam no meu laptop.
  4. Ainda é interessante comparar pelicanos entre lançamentos da mesma família de modelos. O pelicano do K3 é uma melhoria notável em relação ao Kimi 2.5.
  5. É algo que posso compartilhar que demonstra que tentei. Além disso, um comentário com um pelicano é uma espécie de tradição no Hacker News neste momento, sempre que estou atrasado recebo comentários perguntando onde ele está!





Source link

Postagens Similares

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *