Qwen3.8-Flash-Próximo

26 de agosto de 2026 – Link Blog
Qwen3.8-Flash-Próximo (via) Outro modelo de pesos abertos da Qwen. Este é “um modelo MoE multimodal que também serve como uma prévia da arquitetura usada no Qwen4”.
É muito grande: 125 bilhões de tokens, mas apenas 6 bilhões ativos, o que significa que obtém um aumento significativo de desempenho.
Tenho experimentado em um DGX Spark usando esses modelos quantizados do Unsloth. Ainda estou explorando o modelo – até agora experimentei o UD-IQ1_S de 72,5 GB (produzindo esses pelicanos) e o UD-Q2_K_XL de 78,9 GB (produzindo estes).
Meu favorito até agora foi este grande esforço de raciocínio do UD-Q2_K_XL:







