A Alibaba apresentou a Qwen3.8-Flash-Next como uma prévia da arquitetura Qwen4. Segundo dados do The Decoder, trata-se de um modelo do tipo mistura de especialistas (mixture-of-experts): para cada token, são ativados 6 de 125ilhões de parâmetros.

A descrição da fonte afirma que o treinamento do modelo custou nove vezes menos do que uma base comparável e que, em testes de programação e tarefas de escritório, superou modelos maiores como DeepSeek-V4-Flash e Claude Opus 4.6.

Se esses resultados forem confirmados, os desenvolvedores de modelos enfrentarão pressão adicional sobre o custo de suas ofertas. No entanto, a fonte é apresentada apenas por metadados e um sinopse, portanto, falta confirmação independente dos resultados e detalhes da comparação.