FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mistral Large 3 cobra 5x mais que Llama 4 Scout na saída

Ambos são abertos, MoE e servidos por inferência própria — mas a conta no fim do mês diz quem é quem.

Redação FalaVIP IA 3 min de leitura

O que a conta de API mostra antes do benchmark

Você roda os dois no mesmo produto, mesma carga, mesmo prompt. No fim do mês, o Llama 4 Scout custa US$ 0,30 por milhão de tokens de saída e o Mistral Large 3 2512 custa US$ 0,30? Não. O Mistral cobra US$ 1,50 pelo mesmo milhão. Cinco vezes mais. Em workloads de geração longa, essa diferença não é detalhe — é a linha que separa um projeto viável de um que come a margem.

Preço de saída (US$ por milhão de tokens)
Mistral Large 3 25121,5Llama 4 Scout0,3US$/M
Fonte: OpenRouter

Antes de você decidir pela inteligência, vale olhar para o tamanho do pote. O Mistral tem 262.144 tokens de contexto; o Scout abre para 1.310.720. Em tarefas que enfiam livros inteiros, bases de código ou meses de log numa única janela, o Scout simplesmente cabe onde o Mistral corta.

Inteligência, coding e agentic: onde o Mistral cobra a mais

No índice de inteligência medido hoje, o Mistral Large 3 2512 marca 15,919 e o Llama 4 Scout marca 10,256. Em coding a diferença é ainda mais feia para o Scout: 20,066 contra 8,168. Em agentic, 5,519 contra 1,1.

Índice de inteligência (Artificial Analysis)
Mistral Large 3 251215,9Llama 4 Scout10,3índice
Fonte: Artificial Analysis

Traduzindo: o Mistral é um modelo mais capaz em raciocínio aplicado, especialmente em código e em tarefas que pedem encadear ferramentas. O Scout entrega metade disso, mas entrega mais rápido — 111,53 tokens por segundo contra 77,45 do Mistral. Se o seu produto é uma ferramenta de developer experience ou um agente que faz chamadas em sequência, o salto de qualidade do Mistral tende a aparecer no resultado final. Se é um chatbot de alto volume, o Scout entrega latência melhor por uma fração do custo.

Onde o Llama 4 Scout ainda vence

Três pontos em que o Scout não pede desculpa:

  • Contexto: 1,31 milhão de tokens é cinco vezes o teto do Mistral. Para RAG pesado, análise de codebase ou auditoria de logs longos, é a única opção da dupla.
  • Velocidade: 111,53 t/s contra 77,45. Em produto ao usuário final, isso é a diferença entre UX aceitável e UX travada.
  • Preço de entrada: US$ 0,10 por milhão de tokens de input contra US$ 0,50 do Mistral. Em workloads de prompt longo (resumir documentos, few-shot pesado), isso pesa.
Mistral Large 3 2512 × Llama 4 Scout
CritérioMistral Large 3 2512Llama 4 Scout
Índice de inteligência15.910.3
Entrada US$/M0.50.1
Saída US$/M1.50.3
Contexto262k1.31M
Pesos abertossimsim
Velocidade (tok/s)77112
Índice de código20.18.2
Índice agêntico5.51.1

E o Scout tem corte de conhecimento declarado: agosto de 2024. O Mistral não publicou o dele no catálogo. Se o seu caso depende de eventos recentes, vale testar antes de cravar.

O tabuleiro em 22 de janeiro de 2026

O catálogo aberto hoje lista 321 modelos de 50 criadores. O topo do índice de inteligência tem Xiaomi MiMo-V2-Flash (IQ 34,024, US$ 0,30/M de saída), OpenAI o3 (31,096, US$ 8) e Claude Haiku 4.5 (29,892, US$ 5). Os dois da pauta estão bem abaixo disso — e por um motivo: são pesos abertos, rodam na sua infra se você quiser, e não competem com os fechados no mesmo eixo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 321 modelos disponíveis no catálogo nesta data.

A conta que você paga na API é o aluguel de quem hospeda esses pesos para você. O Mistral é francês, o Scout é americano. Ambos MoE — Mistral ativa 41B de 675B, Scout ativa 17B de 109B. Ambos com licença aberta.

Quando cada um ganha

Você precisa de coding forte, agentic ou raciocínio aplicado e o orçamento comporta: vai de Mistral Large 3 2512. A diferença de 2,5x no índice de inteligência e de 2,5x em coding não é cosmética — aparece no produto.

Você precisa de contexto longo, alto volume, latência baixa ou preço de entrada agressivo: vai de Llama 4 Scout. É mais barato na entrada e na saída, é mais rápido e cabe cinco vezes mais texto na janela.

Se o seu caso é resumir PDFs de 800 páginas em massa, é Scout. Se é rodar um agente que mexe em banco, chama API e escreve código, é Mistral.

Em uma frase

Pague US$ 1,50/M quando coding e agentic forem o produto; pague US$ 0,30/M quando volume, contexto longo ou latência forem o produto — e nunca os dois ao mesmo tempo.

Perguntas frequentes

Mistral Large 3 2512 ou Llama 4 Scout para coding?

Mistral Large 3 2512. O índice de coding dele é 20,066 contra 8,168 do Scout — diferença que aparece em geração de código real, não só em benchmark.

Qual tem contexto maior?

Llama 4 Scout, com 1.310.720 tokens contra 262.144 do Mistral Large 3 2512. Em documentos longos ou codebase inteira, o Scout é a única opção da dupla.

Os dois são open weights?

Sim. Ambos são MoE com pesos abertos — Mistral Large 3 2512 ativa 41B de 675B, Llama 4 Scout ativa 17B de 109B. Você pode hospedar na sua própria infra se quiser fugir da API.

Leia também