FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Devstral 2 custa quase 3× mais e quase dobra o Llama 4 em código

Mistral mira agentes de código com o Devstral 2; Meta responde com multimodal, 1M de contexto e preço bem menor no Maverick.

Redação FalaVIP IA 3 min de leitura
US$ 2/M tokensoutput do Devstral 2 2512
US$ 0,696/M tokensoutput do Llama 4 Maverick
31,26 vs 16,28nota em codificação

Devstral 2 cobra US$ 2 por milhão de tokens de saída. Llama 4 Maverick cobra US$ 0,696. A diferença é de quase 3×, e esse é o tipo de número que faz o desenvolvedor fechar a aba antes de ler o resto. Só que a conta muda quando você olha o que cada um entrega em programação.

O placar da inteligência

O índice geral medido hoje coloca o Devstral 2 em 19,24, contra 14,48 do Llama 4 Maverick. Em codificação, a distância aumenta: 31,26 contra 16,28 — quase o dobro. Em tarefas agênticas, o abismo: 10,64 contra 1,24. Oito vezes e meia mais.

Índice de inteligência (Artificial Analysis)
Devstral 2 251219,2Llama 4 Maverick14,5índice
Fonte: Artificial Analysis

Esses números vêm da mesma régua que põe o Xiaomi MiMo-V2-Flash no topo do catálogo hoje, com 34,02. O Devstral 2 ocupa a quinta posição entre os modelos listados e, entre os com foco em código, está no topo.

O preço que ninguém comenta

O Llama 4 Maverick custa metade no input (US$ 0,20 contra US$ 0,40) e quase três vezes menos no output. Numa carga mensal moderada de 50 milhões de tokens de input e 10 milhões de output, são US$ 40 contra US$ 17. Diferença de US$ 23, ou 2,4× a mais pelo lado da Mistral.

Preço de saída (US$ por milhão de tokens)
Devstral 2 25122Llama 4 Maverick0,696US$/M
Fonte: OpenRouter

Mas tem um detalhe que o catálogo da Meta não publica: o preço de cache. O Devstral 2 lista US$ 0,04 por milhão de tokens em cache — útil se você reprompta o mesmo contexto várias vezes. O Llama 4 Maverick simplesmente não informa esse valor. Se a sua aplicação depende de cache agressivo, anote isso antes de comparar.

Devstral 2 2512 × Llama 4 Maverick
CritérioDevstral 2 2512Llama 4 Maverick
Índice de inteligência19.214.5
Entrada US$/M0.40.2
Saída US$/M20.696
Contexto262k1.05M
Pesos abertossimsim
Velocidade (tok/s)11786
Índice de código31.316.3
Índice agêntico10.61.2

Contexto, modalidade e origem

Aqui o Maverick vira o jogo. Janela de contexto de 1.048.576 tokens — quatro vezes o que o Devstral 2 oferece (262.144). Aceita imagem junto com texto; o Devstral 2 processa texto e arquivo, mas não imagem. O Devstral 2 vem da Mistral, da França; o Maverick é da Meta, dos Estados Unidos — diferença que pesa em projetos sob GDPR.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

O Devstral 2 é um modelo denso de 125 bilhões de parâmetros; o Maverick é mistura de especialistas com 402 bilhões totais e 17 bilhões ativos por inferência. Em velocidade, o Devstral 2 entrega 117 tokens por segundo, contra 86 do Maverick. Os dois são open weights: dá para hospedar e ajustar em infraestrutura própria.

Quando cada um ganha

Devstral 2 2512 ganha quando o seu produto é um agente de código de verdade: um Cursor da vida, um Devin, um worker que abre PR sozinho. É onde os 31 pontos em codificação e os 10,6 em agentic pagam o preço extra — especialmente se você já paga caro por completion de código em outros lugares.

Llama 4 Maverick ganha quando você precisa analisar imagem, fazer RAG sobre documentação inteira, ou quer gastar menos sem abrir mão de multimodal nativo. O contexto de 1M tokens sozinho muda a equação para qualquer fluxo que injeta repositório inteiro no prompt.

A pergunta, então, não é qual modelo é melhor — é qual tarefa está rodando. Para um agente de software que escreve, testa e revisa, a economia de US$ 23 por mês no Maverick não compensa a queda de quase 50% em codificação. Para um assistente multimodal com contexto longo, a conta inverte, e a diferença cabe no boleto.

Em uma frase

Escolha Devstral 2 para agentes de código que escrevem, testam e revisam; escolha Llama 4 Maverick para qualquer fluxo multimodal, com contexto longo ou com orçamento apertado — o preço de US$ 23 por mês num workload moderado não paga metade do ganho em codificação do Devstral 2.

Perguntas frequentes

Devstral 2 2512 ou Llama 4 Maverick: qual é melhor?

Nenhum é melhor em tudo. O Devstral 2 lidera em codificação (31,26 vs 16,28) e em tarefas agênticas (10,64 vs 1,24). O Llama 4 Maverick lidera em custo (cerca de 2,4× mais barato), em contexto (1M vs 256K tokens) e em multimodalidade. A escolha certa é pela tarefa que você roda, não pelo placar geral.

Quanto custa o Devstral 2 2512?

US$ 0,40 por milhão de tokens de input e US$ 2,00 por milhão de tokens de output, com cache a US$ 0,04. É um modelo pago via API e com pesos abertos, da Mistral AI.

Llama 4 Maverick aceita imagem?

Sim. O Maverick é multimodal no formato texto+imagem -> texto, com 1M tokens de contexto. O Devstral 2 aceita apenas texto e arquivo, sem entrada de imagem.

Leia também