Mistral Large 3 cobra 5x mais que Llama 4 Scout na saída
Ambos são abertos, MoE e servidos por inferência própria — mas a conta no fim do mês diz quem é quem.
O que a conta de API mostra antes do benchmark
Você roda os dois no mesmo produto, mesma carga, mesmo prompt. No fim do mês, o Llama 4 Scout custa US$ 0,30 por milhão de tokens de saída e o Mistral Large 3 2512 custa US$ 0,30? Não. O Mistral cobra US$ 1,50 pelo mesmo milhão. Cinco vezes mais. Em workloads de geração longa, essa diferença não é detalhe — é a linha que separa um projeto viável de um que come a margem.
Antes de você decidir pela inteligência, vale olhar para o tamanho do pote. O Mistral tem 262.144 tokens de contexto; o Scout abre para 1.310.720. Em tarefas que enfiam livros inteiros, bases de código ou meses de log numa única janela, o Scout simplesmente cabe onde o Mistral corta.
Inteligência, coding e agentic: onde o Mistral cobra a mais
No índice de inteligência medido hoje, o Mistral Large 3 2512 marca 15,919 e o Llama 4 Scout marca 10,256. Em coding a diferença é ainda mais feia para o Scout: 20,066 contra 8,168. Em agentic, 5,519 contra 1,1.
Traduzindo: o Mistral é um modelo mais capaz em raciocínio aplicado, especialmente em código e em tarefas que pedem encadear ferramentas. O Scout entrega metade disso, mas entrega mais rápido — 111,53 tokens por segundo contra 77,45 do Mistral. Se o seu produto é uma ferramenta de developer experience ou um agente que faz chamadas em sequência, o salto de qualidade do Mistral tende a aparecer no resultado final. Se é um chatbot de alto volume, o Scout entrega latência melhor por uma fração do custo.
Onde o Llama 4 Scout ainda vence
Três pontos em que o Scout não pede desculpa:
- Contexto: 1,31 milhão de tokens é cinco vezes o teto do Mistral. Para RAG pesado, análise de codebase ou auditoria de logs longos, é a única opção da dupla.
- Velocidade: 111,53 t/s contra 77,45. Em produto ao usuário final, isso é a diferença entre UX aceitável e UX travada.
- Preço de entrada: US$ 0,10 por milhão de tokens de input contra US$ 0,50 do Mistral. Em workloads de prompt longo (resumir documentos, few-shot pesado), isso pesa.
| Critério | Mistral Large 3 2512 | Llama 4 Scout |
|---|---|---|
| Índice de inteligência | 15.9 | 10.3 |
| Entrada US$/M | 0.5 | 0.1 |
| Saída US$/M | 1.5 | 0.3 |
| Contexto | 262k | 1.31M |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 77 | 112 |
| Índice de código | 20.1 | 8.2 |
| Índice agêntico | 5.5 | 1.1 |
E o Scout tem corte de conhecimento declarado: agosto de 2024. O Mistral não publicou o dele no catálogo. Se o seu caso depende de eventos recentes, vale testar antes de cravar.
O tabuleiro em 22 de janeiro de 2026
O catálogo aberto hoje lista 321 modelos de 50 criadores. O topo do índice de inteligência tem Xiaomi MiMo-V2-Flash (IQ 34,024, US$ 0,30/M de saída), OpenAI o3 (31,096, US$ 8) e Claude Haiku 4.5 (29,892, US$ 5). Os dois da pauta estão bem abaixo disso — e por um motivo: são pesos abertos, rodam na sua infra se você quiser, e não competem com os fechados no mesmo eixo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A conta que você paga na API é o aluguel de quem hospeda esses pesos para você. O Mistral é francês, o Scout é americano. Ambos MoE — Mistral ativa 41B de 675B, Scout ativa 17B de 109B. Ambos com licença aberta.
Quando cada um ganha
Você precisa de coding forte, agentic ou raciocínio aplicado e o orçamento comporta: vai de Mistral Large 3 2512. A diferença de 2,5x no índice de inteligência e de 2,5x em coding não é cosmética — aparece no produto.
Você precisa de contexto longo, alto volume, latência baixa ou preço de entrada agressivo: vai de Llama 4 Scout. É mais barato na entrada e na saída, é mais rápido e cabe cinco vezes mais texto na janela.
Se o seu caso é resumir PDFs de 800 páginas em massa, é Scout. Se é rodar um agente que mexe em banco, chama API e escreve código, é Mistral.
Pague US$ 1,50/M quando coding e agentic forem o produto; pague US$ 0,30/M quando volume, contexto longo ou latência forem o produto — e nunca os dois ao mesmo tempo.
Perguntas frequentes
Mistral Large 3 2512 ou Llama 4 Scout para coding?
Mistral Large 3 2512. O índice de coding dele é 20,066 contra 8,168 do Scout — diferença que aparece em geração de código real, não só em benchmark.
Qual tem contexto maior?
Llama 4 Scout, com 1.310.720 tokens contra 262.144 do Mistral Large 3 2512. Em documentos longos ou codebase inteira, o Scout é a única opção da dupla.
Os dois são open weights?
Sim. Ambos são MoE com pesos abertos — Mistral Large 3 2512 ativa 41B de 675B, Llama 4 Scout ativa 17B de 109B. Você pode hospedar na sua própria infra se quiser fugir da API.