FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Mistral lança Ministral 3 14B por US$ 0,20 e mira o chão da pirâmide

Modelo aberto de 14 bilhões de parâmetros chega a US$ 0,20 por milhão de tokens de entrada e saída, com promessa de rivalizar com o Small 3.2 24B da própria casa.

Redação FalaVIP IA 3 min de leitura
US$ 0,20por milhão de tokens de entrada e saída
14Bparâmetros, com pesos abertos
262ktokens de contexto

O que a Mistral colocou na mesa hoje

A conta de API brasileira que paga US$ 8 por milhão de tokens de saída para usar o o3 da OpenAI acaba de ganhar um novo vizinho no catálogo: o Ministral 3 14B 2512, da Mistral AI, custa US$ 0,20 por milhão de tokens — tanto de entrada quanto de saída. É o mesmo preço de ida e volta, sem a pegadinha clássica de “entrada barata, saída cara”. Para quem roda agente ou resume documento longo, é a diferença entre a fatura do mês caber no cartão ou virar caso de reunião com o financeiro.

Preço de saída (US$ por milhão de tokens)
Ministral 3 14B 25120,2o38Claude Haiku 4.55gpt-oss-120b0,17US$/M
Fonte: OpenRouter

O modelo é o maior da nova família Ministral 3, anunciada hoje em quatro versões. Tem 14 bilhões de parâmetros, todos ativos, e os pesos são abertos — ou seja, você pode baixar e rodar local se tiver a GPU (ou a paciência) para isso. A janela de contexto é de 262 mil tokens, praticamente o tamanho de um romance grande. Não é modelo de raciocínio: responde direto, sem aquele “deixe-me pensar” que dobra o tempo e o custo.

O que ele faz bem — e o que não faz

A descrição oficial diz que o Ministral 3 14B oferece “capacidades de fronteira” comparáveis ao Mistral Small 3.2 24B, o modelo maior da própria casa. É uma afirmação forte. O índice de inteligência do catálogo, medido pela Artificial Analysis, coloca o 14B em 11,24 — bem abaixo dos 31,10 do o3 e dos 29,89 do Claude Haiku 4.5, os dois primeiros colocados hoje. Então a “fronteira” da Mistral não é a fronteira do mercado.

Índice de inteligência (Artificial Analysis)
Ministral 3 14B 251211,2o331,1Claude Haiku 4.529,9gpt-oss-120b24,1índice
Fonte: Artificial Analysis

Onde o modelo brilha é no custo por unidade de capacidade. Pelo preço que você paga por uma única resposta do Haiku 4.5 (US$ 5 por milhão de saída), roda 25 milhões de tokens no Ministral 3 14B. Em tarefas de classificação, extração, sumarização curta e roteamento de agentes — o trabalho braçal que consome 80% do orçamento de quem opera LLM em produção — essa diferença muda a economia do projeto inteiro.

Ficha técnica — Ministral 3 14B 2512
CampoValor
Identificadormistralai/ministral-14b-2512
Criadormistralai
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 0.200 / M tokens
Janela de contexto262k
Modalidadetext+image->text
Leitura de cacheUS$ 0.020 / M (90% de desconto)
Índice de inteligência (AA)11.2
Índice de código14.4
Índice agêntico2.2
Parâmetros14B (14B ativos por token)
Pesosabertos
Velocidade de saída107 tokens/s

A família completa lançada hoje

A Mistral não soltou um modelo, soltou quatro. A linha Ministral 3 chega em três tamanhos e um modo batch:

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Ministral 3 3B 25120.10.1131k
Ministral 3 8B 25120.150.15262k
Ministral 3 8B 2512 (batch)0.0750.075262k

O 3B é o mais barato de todos: US$ 0,10 por milhão de token em ambas as direções, com 131k de contexto. O 8B fica em US$ 0,15. A versão :batch do 8B corta o preço pela metade (US$ 0,075) para quem pode esperar — útil para jobs noturnos de reindexação, geração de embeddings ou enriquecimento de base.

Inteligência × preço de saída
Ministral 3 14B 2512o3Claude Haiku 4.5gpt-oss-120bUS$ por milhão (saída, escala log)índice de inteligência

Para quem isso muda o jogo — e para quem não muda nada

Vale trocar se: você roda modelo pequeno em produção hoje (Haiku, GPT-4.1 mini, Llama 3.1 8B via API), gasta mais de algumas centenas de dólares por mês e o gargalo é volume, não raciocínio profundo. Também vale se você quer hospedar localmente: 14B em FP16 cabe em uma GPU de 24 GB com quantização, e os pesos abertos eliminam a dependência de fornecedor.

Não muda nada se: você precisa de raciocínio pesado, código complexo de várias etapas, ou agente que planeja sozinho. Para isso, o o3 continua sendo referência de capacidade — e custa 40 vezes mais por token de saída. A conta é sua.

Onde a Mistral se encaixa no tabuleiro

A empresa francesa ocupa um nicho curioso: não compete pelo topo de capacidade (onde OpenAI e Anthropic brigam), nem pelo fundo do poço (onde reinam os modelos de US$ 0,10 ou menos). Ela ataca o meio — modelos médios, abertos, com preço agressivo e contexto grande. O Ministral 3 14B é a expressão mais clara dessa estratégia até agora.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Ministral 3 14B 2512 (o novo)11.20.20.2262k
o331.128200k
Claude Haiku 4.529.915200k
gpt-oss-120b24.10.0370.17131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para o desenvolvedor brasileiro que monta stack híbrido — modelo forte para o cérebro, modelo barato para o trabalho braçal — a linha Ministral 3 entra como opção séria na faixa dos centavos. Não substitui o melhor modelo do mercado. Mas talvez não precise.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Nova 2 Lite19.22.5
Qwen3 Next 80B A3B Thinking16.91.2
Entre os 292 modelos disponíveis no catálogo nesta data.
Em uma frase

Se sua fatura de API cresce por volume e não por raciocínio, teste o Ministral 3 14B antes do próximo ciclo: a US$ 0,20 por milhão de tokens, ele pode ser o novo padrão de “modelo de trabalho” da sua stack.

Perguntas frequentes

Quanto custa o Ministral 3 14B da Mistral?

US$ 0,20 por milhão de tokens de entrada e US$ 0,20 por milhão de tokens de saída — mesmo preço nas duas direções, com cache de leitura a US$ 0,02 por milhão. É um dos menores preços do catálogo para um modelo aberto de 14B.

O Ministral 3 14B é modelo de raciocínio?

Não. É um modelo denso padrão, sem modo de thinking. Responde direto, sem cadeia de raciocínio explícita, o que ajuda no custo e na latência, mas limita o desempenho em tarefas que exigem planejamento longo.

Posso rodar o Ministral 3 14B localmente?

Sim, os pesos são abertos. Em FP16 precisa de cerca de 28 GB de VRAM; com quantização Q4 cabe em uma GPU de 16 GB, com perda moderada de qualidade. O contexto de 262k tokens exige mais memória RAM/VRAM que modelos menores.

Leia também