Devstral 2 custa quase 3× mais e quase dobra o Llama 4 em código
Mistral mira agentes de código com o Devstral 2; Meta responde com multimodal, 1M de contexto e preço bem menor no Maverick.
Devstral 2 cobra US$ 2 por milhão de tokens de saída. Llama 4 Maverick cobra US$ 0,696. A diferença é de quase 3×, e esse é o tipo de número que faz o desenvolvedor fechar a aba antes de ler o resto. Só que a conta muda quando você olha o que cada um entrega em programação.
O placar da inteligência
O índice geral medido hoje coloca o Devstral 2 em 19,24, contra 14,48 do Llama 4 Maverick. Em codificação, a distância aumenta: 31,26 contra 16,28 — quase o dobro. Em tarefas agênticas, o abismo: 10,64 contra 1,24. Oito vezes e meia mais.
Esses números vêm da mesma régua que põe o Xiaomi MiMo-V2-Flash no topo do catálogo hoje, com 34,02. O Devstral 2 ocupa a quinta posição entre os modelos listados e, entre os com foco em código, está no topo.
O preço que ninguém comenta
O Llama 4 Maverick custa metade no input (US$ 0,20 contra US$ 0,40) e quase três vezes menos no output. Numa carga mensal moderada de 50 milhões de tokens de input e 10 milhões de output, são US$ 40 contra US$ 17. Diferença de US$ 23, ou 2,4× a mais pelo lado da Mistral.
Mas tem um detalhe que o catálogo da Meta não publica: o preço de cache. O Devstral 2 lista US$ 0,04 por milhão de tokens em cache — útil se você reprompta o mesmo contexto várias vezes. O Llama 4 Maverick simplesmente não informa esse valor. Se a sua aplicação depende de cache agressivo, anote isso antes de comparar.
| Critério | Devstral 2 2512 | Llama 4 Maverick |
|---|---|---|
| Índice de inteligência | 19.2 | 14.5 |
| Entrada US$/M | 0.4 | 0.2 |
| Saída US$/M | 2 | 0.696 |
| Contexto | 262k | 1.05M |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 117 | 86 |
| Índice de código | 31.3 | 16.3 |
| Índice agêntico | 10.6 | 1.2 |
Contexto, modalidade e origem
Aqui o Maverick vira o jogo. Janela de contexto de 1.048.576 tokens — quatro vezes o que o Devstral 2 oferece (262.144). Aceita imagem junto com texto; o Devstral 2 processa texto e arquivo, mas não imagem. O Devstral 2 vem da Mistral, da França; o Maverick é da Meta, dos Estados Unidos — diferença que pesa em projetos sob GDPR.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O Devstral 2 é um modelo denso de 125 bilhões de parâmetros; o Maverick é mistura de especialistas com 402 bilhões totais e 17 bilhões ativos por inferência. Em velocidade, o Devstral 2 entrega 117 tokens por segundo, contra 86 do Maverick. Os dois são open weights: dá para hospedar e ajustar em infraestrutura própria.
Quando cada um ganha
Devstral 2 2512 ganha quando o seu produto é um agente de código de verdade: um Cursor da vida, um Devin, um worker que abre PR sozinho. É onde os 31 pontos em codificação e os 10,6 em agentic pagam o preço extra — especialmente se você já paga caro por completion de código em outros lugares.
Llama 4 Maverick ganha quando você precisa analisar imagem, fazer RAG sobre documentação inteira, ou quer gastar menos sem abrir mão de multimodal nativo. O contexto de 1M tokens sozinho muda a equação para qualquer fluxo que injeta repositório inteiro no prompt.
A pergunta, então, não é qual modelo é melhor — é qual tarefa está rodando. Para um agente de software que escreve, testa e revisa, a economia de US$ 23 por mês no Maverick não compensa a queda de quase 50% em codificação. Para um assistente multimodal com contexto longo, a conta inverte, e a diferença cabe no boleto.
Escolha Devstral 2 para agentes de código que escrevem, testam e revisam; escolha Llama 4 Maverick para qualquer fluxo multimodal, com contexto longo ou com orçamento apertado — o preço de US$ 23 por mês num workload moderado não paga metade do ganho em codificação do Devstral 2.
Perguntas frequentes
Devstral 2 2512 ou Llama 4 Maverick: qual é melhor?
Nenhum é melhor em tudo. O Devstral 2 lidera em codificação (31,26 vs 16,28) e em tarefas agênticas (10,64 vs 1,24). O Llama 4 Maverick lidera em custo (cerca de 2,4× mais barato), em contexto (1M vs 256K tokens) e em multimodalidade. A escolha certa é pela tarefa que você roda, não pelo placar geral.
Quanto custa o Devstral 2 2512?
US$ 0,40 por milhão de tokens de input e US$ 2,00 por milhão de tokens de output, com cache a US$ 0,04. É um modelo pago via API e com pesos abertos, da Mistral AI.
Llama 4 Maverick aceita imagem?
Sim. O Maverick é multimodal no formato texto+imagem -> texto, com 1M tokens de contexto. O Devstral 2 aceita apenas texto e arquivo, sem entrada de imagem.