FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Devstral 2 cobra 4x mais caro no input que o Qwen3 Next

Dois modelos abertos, sem raciocínio, 256K de contexto. O da Mistral é especialista em código; o da Alibaba é generalista rápido e barato.

Redação FalaVIP IA 3 min de leitura
US$ 0,10/Mpreço de input do Qwen3 Next (4x menor que o Devstral)
19,242índice de inteligência do Devstral 2 no catálogo
31,259pontuação de coding do Devstral 2 (Qwen3 não publicou)

O preço não é metade da história

O Qwen3 Next 80B A3B Instruct cobra US$ 0,10 por milhão de tokens de entrada. O Devstral 2 2512, US$ 0,40. Na saída, US$ 1,10 contra US$ 2,00. Em um volume mensal de 100 milhões de tokens só de input, a diferença é de US$ 30 a favor do Qwen. Se a sua carga é chatbot simples ou tradução em massa, é caso encerrado. Mas se a carga é agente de código, esses US$ 30 por mês são a parte menos interessante da conta.

Preço de saída (US$ por milhão de tokens)
Devstral 2 25122Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

Inteligência e código: a diferença não é retórica

No índice de inteligência do catálogo, o Devstral 2 marca 19,242 e o Qwen3 Next marca 13,754. Em coding, a distância se abre: 31,259 para o Devstral — e o Qwen3 Next não tem nota publicada no catálogo para essa categoria. Não dá para comparar o que não foi medido, mas a ausência costuma ser informação também: o Devstral foi anunciado pela Mistral como modelo state-of-the-art open-source specializing in agentic coding; o Qwen3 Next foi tunado para respostas rápidas e estáveis sem thinking traces.

Índice de inteligência (Artificial Analysis)
Devstral 2 251219,2Qwen3 Next 80B A3B Instruct13,8índice
Fonte: Artificial Analysis
Devstral 2 2512 × Qwen3 Next 80B A3B Instruct
CritérioDevstral 2 2512Qwen3 Next 80B A3B Instruct
Índice de inteligência19.213.8
Entrada US$/M0.40.1
Saída US$/M21.1
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)117173
Índice de código31.3
Índice agêntico10.6

A arquitetura por trás do desconto

O Qwen3 Next é uma MoE: 80 bilhões de parâmetros totais, mas só 3 bilhões ativos em cada inferência. Por isso entrega 173,42 tokens por segundo — quase 50% mais rápido que os 117,08 do Devstral 2, um transformer denso de 125 bilhões. Pense em MoE como um restaurante com 80 chefs no quadro, mas só três cozinham seu prato por vez. É eficiente quando o prato é simples e repetível; em receitas com muitos ingredientes — raciocínio encadeado, navegação de contexto longo, edição de múltiplos arquivos — a cozinha inteira do Devstral é mobilizada.

Os dois compartilham duas escolhas estruturais: 256 mil tokens de contexto e pesos abertos. Nenhum dos dois tem modo de raciocínio, então você não paga thinking tokens extras em chain-of-thought interno. Isso os coloca no mesmo nicho: produção que precisa rodar barato e rápido, sem o custo variável do raciocínio.

Quando cada um vence

O Devstral 2 chegou em 9 de dezembro, da Mistral (França), 125 bilhões de parâmetros, focado em agentic coding. Para um agente que planeja, lê múltiplos arquivos, chama ferramentas e mantém coerência em janelas longas, os 10,642 pontos no benchmark agentic do catálogo justificam o dólar extra. O Qwen3 Next, da Alibaba (China), chegou em 11 de setembro, com 80 bilhões totais e 3 bilhões ativos, otimizado para latência. É a escolha certa para chat de suporte, sumarização, tradução e qualquer fluxo onde a velocidade de resposta vale mais que o último ponto percentual de acerto.

Para um engenheiro que mantém um agente de produção navegando repositórios de 100 mil linhas, pagar US$ 0,30 a mais por milhão de tokens de input é troca direta por menor taxa de falha. Para um produto B2C que responde 50 mil tickets de suporte por dia, a economia mensal de três dígitos no Qwen3 Next compra margem — e o usuário final não vai notar a diferença.

Onde eles se encaixam no tabuleiro de dezembro

O catálogo fechou esta data com mais de 313 modelos listados, 32 deles lançados nos últimos 30 dias. O topo do índice de inteligência é ocupado pelo Xiaomi MiMo-V2-Flash (34,024), seguido por OpenAI o3 (31,096) e Claude Haiku 4.5 (29,892). Devstral 2 e Qwen3 Next disputam um nicho específico: modelos abertos, sem raciocínio, 256K de contexto. Nesse segmento, a pergunta não é qual é melhor, é qual trabalho está pagando a sua API.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.
Em uma frase

Use Devstral 2 quando o trabalho for agente de código navegando repositório com 256K de contexto; escolha Qwen3 Next quando a carga for chatbot, sumarização ou tradução e latência importar mais que precisão.

Perguntas frequentes

Devstral 2 ou Qwen3 Next para agente de código?

Devstral 2. Foi lançado pela Mistral especializado em agentic coding, tem 31,259 pontos no benchmark de coding, 10,642 no agentic e 256K de contexto para navegar repositórios.

Qual é mais barato por token?

Qwen3 Next em todas as métricas: US$ 0,10 por milhão de tokens de input contra US$ 0,40 do Devstral, e US$ 1,10 por milhão de saída contra US$ 2,00.

Eles têm modo de raciocínio?

Não. Nenhum dos dois tem raciocínio ativo, então não há cobrança extra de thinking tokens em chain-of-thought — o custo por token é o que aparece na tabela de preços.

Leia também