FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mistral Medium 3.1 em modo batch custa um quinto do preço cheio

A versão assíncrona do medium da Mistral chega três semanas depois do lançamento cobrando US$ 1 por milhão de tokens de saída — mas sem nota pública de inteligência no catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 1,00por milhão de tokens de saída no modo batch
US$ 0,20por milhão de tokens de entrada
131.072tokens de contexto

O que muda (e o que não muda) quando você liga o "batch"

Você está olhando o catálogo e encontra duas entradas quase iguais: Mistral Medium 3.1 e Mistral Medium 3.1 (batch). O nome difere por um parêntese, mas a conta no fim do mês pode diferir por um fator de cinco. A versão batch cobra US$ 1,00 por milhão de tokens de saída — contra US$ 4,40 do modo padrão — e US$ 0,20 por milhão de entrada, com cache de leitura a US$ 0,02. Em troca, você abre mão de resposta em tempo real: o processamento é assíncrono, a latência deixa de ser milissegundo e vira hora.

Não é um modelo novo. É o mesmo Mistral Medium 3.1 lançado em 13 de agosto de 2025, com a mesma janela de 131.072 tokens, a mesma modalidade texto+imagem+arquivo→texto e o mesmo corte de conhecimento em 30 de junho de 2025. O que muda é o canal de cobrança. Para quem processa volume em janelas — sumarização de logs, classificação de backlog, extração de dados em PDFs antigos —, o batch é a diferença entre pagar a conta com cartão e pagar com Pix no boleto.

A ficha que o catálogo não entrega

A Mistral vende o Medium 3.1 como "frontier-level capabilities a custo operacional significativamente reduzido". Traduzindo: é o carro-chefe da casa para clientes corporativos, posicionado abaixo do Large e acima do Small. O catálogo, porém, não publicou nota de inteligência, score de coding, índice agentic nem blended para esse modelo. Sem número, não dá para colocar no gráfico de IQ nem para comparar com o topo do mercado. Quem precisa desse número para decidir vai ter de rodar benchmark próprio — ou aceitar o marketing como ele está.

Ficha técnica — Mistral Medium 3.1 (batch)
CampoValor
Identificadormistralai/mistral-medium-3.1:batch
Criadormistralai
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 1.00 / M tokens
Janela de contexto131k
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.020 / M (90% de desconto)

Onde o batch se encaixa no tabuleiro de setembro

O topo do catálogo hoje, medido pelo índice de inteligência, é ocupado pela OpenAI: o3 lidera com IQ 31,096 cobrando US$ 8 por milhão de saída. Logo abaixo vem o gpt-oss-120b, com IQ 24,126 e preço de US$ 0,17 — e logo abaixo dele o gpt-oss-20b, a US$ 0,13. A Meta entra com Llama 4 Maverick (IQ 14,477, US$ 0,696) e Llama 4 Scout (IQ 10,256, US$ 0,30). São 27 modelos lançados nos últimos 30 dias, 219 no catálogo total, 38 criadores.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 219 modelos disponíveis no catálogo nesta data.

Repare no que essa foto diz: o batch da Mistral, a US$ 1,00 de saída, custa mais que o dobro do Maverick e quase três vezes o Scout por token. Quem busca preço mínimo absoluto em capacidade multimodal não vai encontrá-lo aqui. Quem busca um medium com pedigree europeu, multimodal nativo e SLA de provedor enterprise — e pode esperar horas pelo resultado —, está olhando para o produto certo.

Para quem vale a pena — e para quem é dinheiro jogado fora

Vale a pena se você roda pipelines noturnos de classificação, sumarização, extração estruturada ou reescrita em massa, e o deadline é a próxima manhã, não o próximo segundo. Vale a pena se você já consome a Mistral via API padrão e quer migrar parte do tráfego sem trocar de modelo. Vale a pena se o seu sistema tem fila e absorve latência de horas sem refazer arquitetura.

Não vale a pena se você precisa de resposta em tempo real para chat, agente ou tool-use síncrono — o batch não foi feito para isso. Não vale a pena se o seu gargalo é inteligência bruta e você está comparando com o3: o catálogo não traz nota para o Medium 3.1, e a diferença de cinco vezes no preço da saída entre o3 (US$ 8) e o batch (US$ 1) é real, mas só faz sentido se a tarefa não exigir o topo da régua. Não vale a pena, finalmente, se você já está rodando gpt-oss-120b em self-hosted e pagando só o inferência: o custo por token da OpenAI aberta é menor e o IQ publicado é mais alto.

O que fazer com isso na segunda-feira

Pegue o extrato da sua API do mês passado. Identifique quais chamadas eram assíncronas por natureza — fila de e-mails, processamento de uploads, enriquecimento de CRM. Calcule o volume em milhões de tokens de saída. Multiplique por US$ 4,40 e depois por US$ 1,00. A diferença é o que o batch devolve para o caixa. Se o número pagar a conta de um estagiário por um mês, você tem um caso. Se pagar um almoço, provavelmente não vale a migração.

Em uma frase

Migre para o batch da Mistral só o tráfego que tolera horas de espera; o resto, deixe no modo síncrono ou troque de modelo.

Perguntas frequentes

Qual a diferença de preço entre Mistral Medium 3.1 e a versão batch?

O modo batch custa US$ 1,00 por milhão de tokens de saída, contra US$ 4,40 do modo padrão — uma redução de cerca de cinco vezes. A entrada cai de US$ 0,40 para US$ 0,20 por milhão, e o cache de leitura fica em US$ 0,02. A troca é latência: o batch é assíncrono e não serve para resposta em tempo real.

Mistral Medium 3.1 (batch) é melhor que Llama 4 Maverick?

O catálogo não publicou nota de inteligência para o Medium 3.1, então não dá para comparar diretamente. O Maverick tem IQ 14,477 publicado e custa US$ 0,696 por milhão de saída — mais barato por token, mas é modelo aberto com生态 diferente. A decisão depende de teste no seu caso de uso e de quanto você valoriza suporte enterprise da Mistral.

Quando NÃO devo usar o batch da Mistral?

Evite para chat, agentes síncronos, tool-use em tempo real e qualquer fluxo onde o usuário espera resposta em segundos. O batch foi feito para jobs noturnos, filas de processamento e pipelines que toleram latência de horas. Também não faz sentido se você precisa do topo absoluto de capacidade de raciocínio — para isso, o3 segue sendo referência no catálogo.

Leia também