Mistral Medium 3.1 em modo batch custa um quinto do preço cheio
A versão assíncrona do medium da Mistral chega três semanas depois do lançamento cobrando US$ 1 por milhão de tokens de saída — mas sem nota pública de inteligência no catálogo.
O que muda (e o que não muda) quando você liga o "batch"
Você está olhando o catálogo e encontra duas entradas quase iguais: Mistral Medium 3.1 e Mistral Medium 3.1 (batch). O nome difere por um parêntese, mas a conta no fim do mês pode diferir por um fator de cinco. A versão batch cobra US$ 1,00 por milhão de tokens de saída — contra US$ 4,40 do modo padrão — e US$ 0,20 por milhão de entrada, com cache de leitura a US$ 0,02. Em troca, você abre mão de resposta em tempo real: o processamento é assíncrono, a latência deixa de ser milissegundo e vira hora.
Não é um modelo novo. É o mesmo Mistral Medium 3.1 lançado em 13 de agosto de 2025, com a mesma janela de 131.072 tokens, a mesma modalidade texto+imagem+arquivo→texto e o mesmo corte de conhecimento em 30 de junho de 2025. O que muda é o canal de cobrança. Para quem processa volume em janelas — sumarização de logs, classificação de backlog, extração de dados em PDFs antigos —, o batch é a diferença entre pagar a conta com cartão e pagar com Pix no boleto.
A ficha que o catálogo não entrega
A Mistral vende o Medium 3.1 como "frontier-level capabilities a custo operacional significativamente reduzido". Traduzindo: é o carro-chefe da casa para clientes corporativos, posicionado abaixo do Large e acima do Small. O catálogo, porém, não publicou nota de inteligência, score de coding, índice agentic nem blended para esse modelo. Sem número, não dá para colocar no gráfico de IQ nem para comparar com o topo do mercado. Quem precisa desse número para decidir vai ter de rodar benchmark próprio — ou aceitar o marketing como ele está.
| Campo | Valor |
|---|---|
| Identificador | mistralai/mistral-medium-3.1:batch |
| Criador | mistralai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 1.00 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.020 / M (90% de desconto) |
Onde o batch se encaixa no tabuleiro de setembro
O topo do catálogo hoje, medido pelo índice de inteligência, é ocupado pela OpenAI: o3 lidera com IQ 31,096 cobrando US$ 8 por milhão de saída. Logo abaixo vem o gpt-oss-120b, com IQ 24,126 e preço de US$ 0,17 — e logo abaixo dele o gpt-oss-20b, a US$ 0,13. A Meta entra com Llama 4 Maverick (IQ 14,477, US$ 0,696) e Llama 4 Scout (IQ 10,256, US$ 0,30). São 27 modelos lançados nos últimos 30 dias, 219 no catálogo total, 38 criadores.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
Repare no que essa foto diz: o batch da Mistral, a US$ 1,00 de saída, custa mais que o dobro do Maverick e quase três vezes o Scout por token. Quem busca preço mínimo absoluto em capacidade multimodal não vai encontrá-lo aqui. Quem busca um medium com pedigree europeu, multimodal nativo e SLA de provedor enterprise — e pode esperar horas pelo resultado —, está olhando para o produto certo.
Para quem vale a pena — e para quem é dinheiro jogado fora
Vale a pena se você roda pipelines noturnos de classificação, sumarização, extração estruturada ou reescrita em massa, e o deadline é a próxima manhã, não o próximo segundo. Vale a pena se você já consome a Mistral via API padrão e quer migrar parte do tráfego sem trocar de modelo. Vale a pena se o seu sistema tem fila e absorve latência de horas sem refazer arquitetura.
Não vale a pena se você precisa de resposta em tempo real para chat, agente ou tool-use síncrono — o batch não foi feito para isso. Não vale a pena se o seu gargalo é inteligência bruta e você está comparando com o3: o catálogo não traz nota para o Medium 3.1, e a diferença de cinco vezes no preço da saída entre o3 (US$ 8) e o batch (US$ 1) é real, mas só faz sentido se a tarefa não exigir o topo da régua. Não vale a pena, finalmente, se você já está rodando gpt-oss-120b em self-hosted e pagando só o inferência: o custo por token da OpenAI aberta é menor e o IQ publicado é mais alto.
O que fazer com isso na segunda-feira
Pegue o extrato da sua API do mês passado. Identifique quais chamadas eram assíncronas por natureza — fila de e-mails, processamento de uploads, enriquecimento de CRM. Calcule o volume em milhões de tokens de saída. Multiplique por US$ 4,40 e depois por US$ 1,00. A diferença é o que o batch devolve para o caixa. Se o número pagar a conta de um estagiário por um mês, você tem um caso. Se pagar um almoço, provavelmente não vale a migração.
Migre para o batch da Mistral só o tráfego que tolera horas de espera; o resto, deixe no modo síncrono ou troque de modelo.
Perguntas frequentes
Qual a diferença de preço entre Mistral Medium 3.1 e a versão batch?
O modo batch custa US$ 1,00 por milhão de tokens de saída, contra US$ 4,40 do modo padrão — uma redução de cerca de cinco vezes. A entrada cai de US$ 0,40 para US$ 0,20 por milhão, e o cache de leitura fica em US$ 0,02. A troca é latência: o batch é assíncrono e não serve para resposta em tempo real.
Mistral Medium 3.1 (batch) é melhor que Llama 4 Maverick?
O catálogo não publicou nota de inteligência para o Medium 3.1, então não dá para comparar diretamente. O Maverick tem IQ 14,477 publicado e custa US$ 0,696 por milhão de saída — mais barato por token, mas é modelo aberto com生态 diferente. A decisão depende de teste no seu caso de uso e de quanto você valoriza suporte enterprise da Mistral.
Quando NÃO devo usar o batch da Mistral?
Evite para chat, agentes síncronos, tool-use em tempo real e qualquer fluxo onde o usuário espera resposta em segundos. O batch foi feito para jobs noturnos, filas de processamento e pipelines que toleram latência de horas. Também não faz sentido se você precisa do topo absoluto de capacidade de raciocínio — para isso, o3 segue sendo referência no catálogo.