8 modelos custam menos de US$ 0,40 por milhão de tokens — e entregam mais do que parece
A faixa barata do catálogo em janeiro de 2026 reúne modelos abertos de Xiaomi, OpenAI, NVIDIA, Mistral e Meta com preços que cabem em qualquer projeto.
O preço que cabe no bolso
Você abre o catálogo, filtra por preço e descobre que 89 dos 314 modelos listados hoje custam US$ 0,40 ou menos por milhão de tokens de saída. É quase um terço do catálogo. Mas preço baixo sem contexto é pegadinha: o que importa é quanto de inteligência você leva por cada centavo. E é aí que a faixa barata de janeiro de 2026 fica interessante — porque não é mais sinônimo de modelo capenga.
O caso que muda a régua
O Xiaomi MiMo-V2-Flash é o nome que você precisa guardar. Lançado em 14 de dezembro de 2025, é um modelo aberto de 309 bilhões de parâmetros totais com apenas 15 bilhões ativos por inferência — a tal arquitetura Mixture-of-Experts, que funciona como um prédio com 309 salas mas só abre 15 por vez. Cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com cache a US$ 0,01. E entrega um índice de inteligência de 34,024 — o maior do recorte, e o maior do catálogo inteiro hoje.
Para dimensionar: o segundo colocado geral, o OpenAI o3, cobra US$ 8 por milhão de tokens de saída. São 26 vezes mais caro. A diferença de capacidade existe, claro, mas não é 26 vezes. É o tipo de proporção que faz você repensar o que vale a pena pagar caro.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Llama 3.3 Nemotron Super 49B | nvidia | 12.4 | 0.4 | 131k |
| Ministral 3 14B 2512 | mistralai | 11.2 | 0.2 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | meta-llama | 9.3 | 0.32 | 131k |
O segundo time também joga
Logo abaixo do MiMo, o gpt-oss-120b da OpenAI aparece com US$ 0,037 de entrada e US$ 0,17 de saída — preço de modelo pequeno, porte de modelo grande, 117 bilhões de parâmetros com 5,1 bilhões ativos. É o tipo de coisa que, dois anos atrás, custaria dez vezes mais. O índice de inteligência é 24,126, com benchmark de coding em 30,441, acima do próprio IQ geral, sinal de que o modelo foi afinado para código e tarefas agentic.
O irmão menor, gpt-oss-20b, vai ainda mais fundo no preço: US$ 0,03 de entrada e US$ 0,13 de saída. É o teto de barato do recorte e serve para protótipos, classificação, extração e qualquer tarefa em que você só precisa de um modelo que responda direito sem pensar muito.
Quem mais entra na conta
A NVIDIA aparece duas vezes no recorte. O Nemotron 3 Nano 30B A3B, também de 14 de dezembro, cobra US$ 0,05 de entrada e US$ 0,20 de saída, com a velocidade mais alta do grupo: 247,99 tokens por segundo. É o modelo para quem precisa de throughput, não de brilhantismo — IQ de 14,538, mas roda rápido. O Llama 3.3 Nemotron Super 49B V1.5 é a opção densa (49 bilhões ativos, sem MoE) a US$ 0,40 de entrada e saída, mais lento (52,85 t/s), mas com raciocínio habilitado e contexto de 128 mil tokens.
A Mistral francesa entra com a família Ministral 3: o de 14B a US$ 0,20 e o de 8B a US$ 0,15, ambos com visão (text+image→text) e contexto de 262 mil tokens. Não são modelos de raciocínio — o campo reasoning está como false — mas são multimodal e leves. O Llama 4 Scout da Meta fecha o recorte: 109 bilhões totais, 17 ativos, multimodal, contexto de 1,3 milhão de tokens a US$ 0,10 de entrada e US$ 0,30 de saída. É a maior janela de contexto do grupo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso muda alguma coisa
Se você roda agente, classificador, extrator, chatbot de alto volume ou qualquer pipeline que consome muito token por pouco valor unitário, este recorte é onde mora a economia real. O MiMo-V2-Flash sozinho já entrega o melhor custo-benefício do catálogo; o gpt-oss-120b é a alternativa ocidental imediata; os Nemotron e Ministral são as opções de nicho para velocidade, visão ou contexto gigante.
Se você está construindo um produto onde cada resposta precisa ser a melhor possível — geração de código crítica, raciocínio jurídico, planejamento multi-etapa —, a faixa barata ainda não substitui os modelos de topo. O o3 e o Claude Haiku 4.5 continuam em outro andar. Mas a conta agora cabe em outro orçamento.
Antes de escolher um modelo caro por inércia, rode um benchmark seu no MiMo-V2-Flash ou no gpt-oss-120b — a diferença de preço é grande demais para ignorar sem testar.
Perguntas frequentes
Qual é o modelo mais barato do catálogo em janeiro de 2026?
Dentro do recorte de US$ 0,40 por milhão de tokens de saída, o mais barato em entrada é o gpt-oss-20b, a US$ 0,03 por milhão. O Xiaomi MiMo-V2-Flash tem o melhor custo-benefício do grupo, com IQ de 34,024 a US$ 0,30 de saída.
Modelos abertos valem a pena em produção?
Todos os oito modelos do recorte têm pesos abertos (`open_weights: true`) e são de grandes laboratórios — Xiaomi, OpenAI, NVIDIA, Mistral e Meta. Para tarefas de alto volume e baixa exigência unitária, são a opção mais racional da fatura.
Por que o MiMo-V2-Flash é tão mais barato que o o3?
Porque é uma arquitetura Mixture-of-Experts com apenas 15 bilhões de parâmetros ativos por inferência, embora tenha 309 bilhões totais. Você paga para usar uma fração do modelo a cada chamada, o que derruba o custo sem eliminar a capacidade.