FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mistral Large 3 2512 batch: 41B ativos por US$ 0,75 de saída

Modelo sparse MoE da Mistral chega em variante batch com janela de 256k e preço agressivo, mas sem benchmark de inteligência publicado.

Redação FalaVIP IA 3 min de leitura
US$ 0,75por milhão de tokens de saída
US$ 0,25por milhão de tokens de entrada
US$ 0,025por milhão de tokens em cache (hit)

O que está em jogo

A conta de API não mente. E, em 13 de dezembro de 2025, a Mistral colocou no catálogo uma variante batch do seu旗舰 que custa US$ 0,75 por milhão de tokens de saída — cobrado a 75% do preço da versão síncrona. Para um modelo com 41 bilhões de parâmetros ativos em uma arquitetura sparse mixture-of-experts de 675B totais, é um número que merece lupa.

O detalhe importante: este não é um lançamento novo. O Mistral Large 3 2512 estreou em 1º de dezembro, e a versão batch que você está olhando existe porque o provedor oferece desconto para quem aceita latência assíncrona — você enfileira a requisição, espera minutos ou horas, e paga menos. É o mesmo modelo, mesmo contexto de 262.144 tokens, mesma multimodalidade texto+imagem+arquivo→texto, licença Apache 2.0.

O tabuleiro hoje

Para situar o preço, olhe quem está no topo do catálogo agora. O OpenAI o3 lidera em índice de inteligência com 31,096 e cobra US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 vem logo atrás com IQ 29,892 e US$ 5 de saída. O gpt-oss-120b, da própria OpenAI, marca 24,126 de IQ e custa US$ 0,17 de saída. Mais abaixo, Devstral 2 2512 (IQ 19,242) e Amazon Nova 2 Lite (IQ 19,240) ficam na casa dos US$ 2 a US$ 2,50 de saída.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Nova 2 Lite19.22.5
Entre os 304 modelos disponíveis no catálogo nesta data.

O Mistral Large 3 2512 entra nesse cenário sem índice de inteligência publicado — o campo iq veio vazio nos dados. Isso significa que você não tem como ranquear ele contra os pares só pela régua de capacidade do catálogo. Sabe o preço, sabe a arquitetura, sabe a janela. Não sabe a nota.

A economia real do batch

Traduzindo o marketing: "batch" não é modelo mais burro, é o mesmo modelo com fila. O desconto vem do provedor porque ele consegue empacotar muitas requisições e rodar em hardware ocioso. Para o seu caso de uso, isso só serve se a tarefa não precisar de resposta em tempo real — geração de dataset, sumarização em massa, classificação de documentos, reescrita de base de conhecimento, embeddings via LLM, jobs noturnos.

Ficha técnica — Mistral Large 3 2512 (batch)
CampoValor
Identificadormistralai/mistral-large-2512:batch
Criadormistralai
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 0.750 / M tokens
Janela de contexto262k
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.025 / M (90% de desconto)

A conta concreta, para um trabalho típico de 10 milhões de tokens de saída:

  • Versão síncrona do mesmo modelo: a Mistral costuma cobrar US$ 3/M de saída. Total: US$ 30.
  • Versão batch deste anúncio: US$ 0,75/M. Total: US$ 7,50.

É uma economia de 75% no item mais caro da fatura — saída de tokens. A entrada cai na mesma proporção (US$ 0,25 vs. US$ 1,00), e o cache hit fica em US$ 0,025/M, útil se você vai reusar prompts longos repetidamente.

Para quem vale — e para quem não

Vale a pena se você roda pipelines assíncronos, processa grandes volumes de texto ou imagem→texto de uma vez, e quer a arquitetura MoE 41B/675B sem pagar o preço cheio. A janela de 256k tokens é generosa para documentos longos, e a licença Apache 2.0 abre porta para self-host se a conta apertar de novo.

Não muda nada se seu produto exige resposta em menos de um segundo, se você precisa de benchmark de IQ para defender a escolha diante de um time técnico, ou se o seu volume é tão pequeno que a diferença de centavos não aparece na fatura. Nesses casos, o Claude Haiku 4.5 (IQ conhecido, latência baixa) ou o gpt-oss-120b (IQ 24,126 por US$ 0,17 de saída) continuam sendo apostas com mais régua na mão.

O que olhar nas próximas semanas

O catálogo tem 304 modelos listados e 28 lançamentos nos últimos 30 dias. O slot "acima de IQ 45 mais barato" está vazio nesta data — ninguém entrega capacidade alta a preço baixo ainda. O Mistral Large 3 2512 batch entra na faixa intermediária, competindo por preço com Nova 2 Lite e Devstral 2, mas sem o número de IQ para comparar.

A implicação prática: se você já roda jobs batch e quer testar um MoE de 41B ativos sem comprometer o orçamento, este é um candidato sério. Se a régua de capacidade importa, espere o índice de inteligência ser publicado — ou rode seu próprio eval antes de migrar volume.

Em uma frase

Roda jobs batch nele se volume e latência tolerável importam mais que benchmark público; para produto síncrono, Haiku 4.5 ou gpt-oss-120b continuam com nota na régua.

Perguntas frequentes

Mistral Large 3 2512 batch é o mesmo modelo que a versão síncrona?

Sim. É o mesmo Mistral Large 3 2512 (41B ativos, 675B totais, MoE sparse, Apache 2.0, contexto de 262.144 tokens), ofertado com 75% de desconto pelo provedor em troca de latência assíncrona. A qualidade não muda; o que muda é o SLA de tempo de resposta.

Quanto custa na prática rodar 10 milhões de tokens de saída?

Pelos preços de 13/12/2025, US$ 0,75 por milhão de saída × 10M = US$ 7,50. Some a entrada (US$ 0,25/M) e o cache hit (US$ 0,025/M) conforme o seu padrão de uso. A versão síncrona do mesmo modelo sai por cerca de 4× esse valor.

Por que não tem índice de inteligência publicado para ele?

O catálogo não publicou IQ, coding, agentic nem blended para este modelo na data de hoje. Isso não significa que o modelo é ruim — significa que você não tem régua pública do provedor para ranquear contra o3, Haiku 4.5 ou gpt-oss-120b sem rodar eval próprio.

Leia também