Mistral lança Ministral 3 14B por US$ 0,20 e mira o chão da pirâmide
Modelo aberto de 14 bilhões de parâmetros chega a US$ 0,20 por milhão de tokens de entrada e saída, com promessa de rivalizar com o Small 3.2 24B da própria casa.
O que a Mistral colocou na mesa hoje
A conta de API brasileira que paga US$ 8 por milhão de tokens de saída para usar o o3 da OpenAI acaba de ganhar um novo vizinho no catálogo: o Ministral 3 14B 2512, da Mistral AI, custa US$ 0,20 por milhão de tokens — tanto de entrada quanto de saída. É o mesmo preço de ida e volta, sem a pegadinha clássica de “entrada barata, saída cara”. Para quem roda agente ou resume documento longo, é a diferença entre a fatura do mês caber no cartão ou virar caso de reunião com o financeiro.
O modelo é o maior da nova família Ministral 3, anunciada hoje em quatro versões. Tem 14 bilhões de parâmetros, todos ativos, e os pesos são abertos — ou seja, você pode baixar e rodar local se tiver a GPU (ou a paciência) para isso. A janela de contexto é de 262 mil tokens, praticamente o tamanho de um romance grande. Não é modelo de raciocínio: responde direto, sem aquele “deixe-me pensar” que dobra o tempo e o custo.
O que ele faz bem — e o que não faz
A descrição oficial diz que o Ministral 3 14B oferece “capacidades de fronteira” comparáveis ao Mistral Small 3.2 24B, o modelo maior da própria casa. É uma afirmação forte. O índice de inteligência do catálogo, medido pela Artificial Analysis, coloca o 14B em 11,24 — bem abaixo dos 31,10 do o3 e dos 29,89 do Claude Haiku 4.5, os dois primeiros colocados hoje. Então a “fronteira” da Mistral não é a fronteira do mercado.
Onde o modelo brilha é no custo por unidade de capacidade. Pelo preço que você paga por uma única resposta do Haiku 4.5 (US$ 5 por milhão de saída), roda 25 milhões de tokens no Ministral 3 14B. Em tarefas de classificação, extração, sumarização curta e roteamento de agentes — o trabalho braçal que consome 80% do orçamento de quem opera LLM em produção — essa diferença muda a economia do projeto inteiro.
| Campo | Valor |
|---|---|
| Identificador | mistralai/ministral-14b-2512 |
| Criador | mistralai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.200 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.020 / M (90% de desconto) |
| Índice de inteligência (AA) | 11.2 |
| Índice de código | 14.4 |
| Índice agêntico | 2.2 |
| Parâmetros | 14B (14B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 107 tokens/s |
A família completa lançada hoje
A Mistral não soltou um modelo, soltou quatro. A linha Ministral 3 chega em três tamanhos e um modo batch:
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Ministral 3 3B 2512 | 0.1 | 0.1 | 131k |
| Ministral 3 8B 2512 | 0.15 | 0.15 | 262k |
| Ministral 3 8B 2512 (batch) | 0.075 | 0.075 | 262k |
O 3B é o mais barato de todos: US$ 0,10 por milhão de token em ambas as direções, com 131k de contexto. O 8B fica em US$ 0,15. A versão :batch do 8B corta o preço pela metade (US$ 0,075) para quem pode esperar — útil para jobs noturnos de reindexação, geração de embeddings ou enriquecimento de base.
Para quem isso muda o jogo — e para quem não muda nada
Vale trocar se: você roda modelo pequeno em produção hoje (Haiku, GPT-4.1 mini, Llama 3.1 8B via API), gasta mais de algumas centenas de dólares por mês e o gargalo é volume, não raciocínio profundo. Também vale se você quer hospedar localmente: 14B em FP16 cabe em uma GPU de 24 GB com quantização, e os pesos abertos eliminam a dependência de fornecedor.
Não muda nada se: você precisa de raciocínio pesado, código complexo de várias etapas, ou agente que planeja sozinho. Para isso, o o3 continua sendo referência de capacidade — e custa 40 vezes mais por token de saída. A conta é sua.
Onde a Mistral se encaixa no tabuleiro
A empresa francesa ocupa um nicho curioso: não compete pelo topo de capacidade (onde OpenAI e Anthropic brigam), nem pelo fundo do poço (onde reinam os modelos de US$ 0,10 ou menos). Ela ataca o meio — modelos médios, abertos, com preço agressivo e contexto grande. O Ministral 3 14B é a expressão mais clara dessa estratégia até agora.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Ministral 3 14B 2512 (o novo) | 11.2 | 0.2 | 0.2 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
Para o desenvolvedor brasileiro que monta stack híbrido — modelo forte para o cérebro, modelo barato para o trabalho braçal — a linha Ministral 3 entra como opção séria na faixa dos centavos. Não substitui o melhor modelo do mercado. Mas talvez não precise.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Nova 2 Lite | 19.2 | 2.5 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
Se sua fatura de API cresce por volume e não por raciocínio, teste o Ministral 3 14B antes do próximo ciclo: a US$ 0,20 por milhão de tokens, ele pode ser o novo padrão de “modelo de trabalho” da sua stack.
Perguntas frequentes
Quanto custa o Ministral 3 14B da Mistral?
US$ 0,20 por milhão de tokens de entrada e US$ 0,20 por milhão de tokens de saída — mesmo preço nas duas direções, com cache de leitura a US$ 0,02 por milhão. É um dos menores preços do catálogo para um modelo aberto de 14B.
O Ministral 3 14B é modelo de raciocínio?
Não. É um modelo denso padrão, sem modo de thinking. Responde direto, sem cadeia de raciocínio explícita, o que ajuda no custo e na latência, mas limita o desempenho em tarefas que exigem planejamento longo.
Posso rodar o Ministral 3 14B localmente?
Sim, os pesos são abertos. Em FP16 precisa de cerca de 28 GB de VRAM; com quantização Q4 cabe em uma GPU de 16 GB, com perda moderada de qualidade. O contexto de 262k tokens exige mais memória RAM/VRAM que modelos menores.