Mistral Large 3 2512 batch: 41B ativos por US$ 0,75 de saída
Modelo sparse MoE da Mistral chega em variante batch com janela de 256k e preço agressivo, mas sem benchmark de inteligência publicado.
O que está em jogo
A conta de API não mente. E, em 13 de dezembro de 2025, a Mistral colocou no catálogo uma variante batch do seu旗舰 que custa US$ 0,75 por milhão de tokens de saída — cobrado a 75% do preço da versão síncrona. Para um modelo com 41 bilhões de parâmetros ativos em uma arquitetura sparse mixture-of-experts de 675B totais, é um número que merece lupa.
O detalhe importante: este não é um lançamento novo. O Mistral Large 3 2512 estreou em 1º de dezembro, e a versão batch que você está olhando existe porque o provedor oferece desconto para quem aceita latência assíncrona — você enfileira a requisição, espera minutos ou horas, e paga menos. É o mesmo modelo, mesmo contexto de 262.144 tokens, mesma multimodalidade texto+imagem+arquivo→texto, licença Apache 2.0.
O tabuleiro hoje
Para situar o preço, olhe quem está no topo do catálogo agora. O OpenAI o3 lidera em índice de inteligência com 31,096 e cobra US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 vem logo atrás com IQ 29,892 e US$ 5 de saída. O gpt-oss-120b, da própria OpenAI, marca 24,126 de IQ e custa US$ 0,17 de saída. Mais abaixo, Devstral 2 2512 (IQ 19,242) e Amazon Nova 2 Lite (IQ 19,240) ficam na casa dos US$ 2 a US$ 2,50 de saída.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
| Nova 2 Lite | 19.2 | 2.5 |
O Mistral Large 3 2512 entra nesse cenário sem índice de inteligência publicado — o campo iq veio vazio nos dados. Isso significa que você não tem como ranquear ele contra os pares só pela régua de capacidade do catálogo. Sabe o preço, sabe a arquitetura, sabe a janela. Não sabe a nota.
A economia real do batch
Traduzindo o marketing: "batch" não é modelo mais burro, é o mesmo modelo com fila. O desconto vem do provedor porque ele consegue empacotar muitas requisições e rodar em hardware ocioso. Para o seu caso de uso, isso só serve se a tarefa não precisar de resposta em tempo real — geração de dataset, sumarização em massa, classificação de documentos, reescrita de base de conhecimento, embeddings via LLM, jobs noturnos.
| Campo | Valor |
|---|---|
| Identificador | mistralai/mistral-large-2512:batch |
| Criador | mistralai |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 0.750 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.025 / M (90% de desconto) |
A conta concreta, para um trabalho típico de 10 milhões de tokens de saída:
- Versão síncrona do mesmo modelo: a Mistral costuma cobrar US$ 3/M de saída. Total: US$ 30.
- Versão batch deste anúncio: US$ 0,75/M. Total: US$ 7,50.
É uma economia de 75% no item mais caro da fatura — saída de tokens. A entrada cai na mesma proporção (US$ 0,25 vs. US$ 1,00), e o cache hit fica em US$ 0,025/M, útil se você vai reusar prompts longos repetidamente.
Para quem vale — e para quem não
Vale a pena se você roda pipelines assíncronos, processa grandes volumes de texto ou imagem→texto de uma vez, e quer a arquitetura MoE 41B/675B sem pagar o preço cheio. A janela de 256k tokens é generosa para documentos longos, e a licença Apache 2.0 abre porta para self-host se a conta apertar de novo.
Não muda nada se seu produto exige resposta em menos de um segundo, se você precisa de benchmark de IQ para defender a escolha diante de um time técnico, ou se o seu volume é tão pequeno que a diferença de centavos não aparece na fatura. Nesses casos, o Claude Haiku 4.5 (IQ conhecido, latência baixa) ou o gpt-oss-120b (IQ 24,126 por US$ 0,17 de saída) continuam sendo apostas com mais régua na mão.
O que olhar nas próximas semanas
O catálogo tem 304 modelos listados e 28 lançamentos nos últimos 30 dias. O slot "acima de IQ 45 mais barato" está vazio nesta data — ninguém entrega capacidade alta a preço baixo ainda. O Mistral Large 3 2512 batch entra na faixa intermediária, competindo por preço com Nova 2 Lite e Devstral 2, mas sem o número de IQ para comparar.
A implicação prática: se você já roda jobs batch e quer testar um MoE de 41B ativos sem comprometer o orçamento, este é um candidato sério. Se a régua de capacidade importa, espere o índice de inteligência ser publicado — ou rode seu próprio eval antes de migrar volume.
Roda jobs batch nele se volume e latência tolerável importam mais que benchmark público; para produto síncrono, Haiku 4.5 ou gpt-oss-120b continuam com nota na régua.
Perguntas frequentes
Mistral Large 3 2512 batch é o mesmo modelo que a versão síncrona?
Sim. É o mesmo Mistral Large 3 2512 (41B ativos, 675B totais, MoE sparse, Apache 2.0, contexto de 262.144 tokens), ofertado com 75% de desconto pelo provedor em troca de latência assíncrona. A qualidade não muda; o que muda é o SLA de tempo de resposta.
Quanto custa na prática rodar 10 milhões de tokens de saída?
Pelos preços de 13/12/2025, US$ 0,75 por milhão de saída × 10M = US$ 7,50. Some a entrada (US$ 0,25/M) e o cache hit (US$ 0,025/M) conforme o seu padrão de uso. A versão síncrona do mesmo modelo sai por cerca de 4× esse valor.
Por que não tem índice de inteligência publicado para ele?
O catálogo não publicou IQ, coding, agentic nem blended para este modelo na data de hoje. Isso não significa que o modelo é ruim — significa que você não tem régua pública do provedor para ranquear contra o3, Haiku 4.5 ou gpt-oss-120b sem rodar eval próprio.