FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

8 modelos custam menos de US$ 0,40 por milhão de tokens — e entregam mais do que parece

A faixa barata do catálogo em janeiro de 2026 reúne modelos abertos de Xiaomi, OpenAI, NVIDIA, Mistral e Meta com preços que cabem em qualquer projeto.

Redação FalaVIP IA 3 min de leitura
US$ 0,10entrada por milhão de tokens no Xiaomi MiMo-V2-Flash
US$ 0,30saída por milhão de tokens no Xiaomi MiMo-V2-Flash
US$ 0,03entrada mais barata do recorte, no gpt-oss-20b

O preço que cabe no bolso

Você abre o catálogo, filtra por preço e descobre que 89 dos 314 modelos listados hoje custam US$ 0,40 ou menos por milhão de tokens de saída. É quase um terço do catálogo. Mas preço baixo sem contexto é pegadinha: o que importa é quanto de inteligência você leva por cada centavo. E é aí que a faixa barata de janeiro de 2026 fica interessante — porque não é mais sinônimo de modelo capenga.

Inteligência × preço no recorte
MiMo-V2-Flashgpt-oss-120bgpt-oss-20bNemotron 3 Nano 30B A3BLlama 3.3 Nemotron Super 49BMinistral 3 14B 2512Llama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

O caso que muda a régua

O Xiaomi MiMo-V2-Flash é o nome que você precisa guardar. Lançado em 14 de dezembro de 2025, é um modelo aberto de 309 bilhões de parâmetros totais com apenas 15 bilhões ativos por inferência — a tal arquitetura Mixture-of-Experts, que funciona como um prédio com 309 salas mas só abre 15 por vez. Cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com cache a US$ 0,01. E entrega um índice de inteligência de 34,024 — o maior do recorte, e o maior do catálogo inteiro hoje.

Para dimensionar: o segundo colocado geral, o OpenAI o3, cobra US$ 8 por milhão de tokens de saída. São 26 vezes mais caro. A diferença de capacidade existe, claro, mas não é 26 vezes. É o tipo de proporção que faz você repensar o que vale a pena pagar caro.

Destaques do recorte: a faixa barata
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
gpt-oss-120bopenai24.10.17131k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Ministral 3 14B 2512mistralai11.20.2262k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k

O segundo time também joga

Logo abaixo do MiMo, o gpt-oss-120b da OpenAI aparece com US$ 0,037 de entrada e US$ 0,17 de saída — preço de modelo pequeno, porte de modelo grande, 117 bilhões de parâmetros com 5,1 bilhões ativos. É o tipo de coisa que, dois anos atrás, custaria dez vezes mais. O índice de inteligência é 24,126, com benchmark de coding em 30,441, acima do próprio IQ geral, sinal de que o modelo foi afinado para código e tarefas agentic.

O irmão menor, gpt-oss-20b, vai ainda mais fundo no preço: US$ 0,03 de entrada e US$ 0,13 de saída. É o teto de barato do recorte e serve para protótipos, classificação, extração e qualquer tarefa em que você só precisa de um modelo que responda direito sem pensar muito.

Quem mais entra na conta

A NVIDIA aparece duas vezes no recorte. O Nemotron 3 Nano 30B A3B, também de 14 de dezembro, cobra US$ 0,05 de entrada e US$ 0,20 de saída, com a velocidade mais alta do grupo: 247,99 tokens por segundo. É o modelo para quem precisa de throughput, não de brilhantismo — IQ de 14,538, mas roda rápido. O Llama 3.3 Nemotron Super 49B V1.5 é a opção densa (49 bilhões ativos, sem MoE) a US$ 0,40 de entrada e saída, mais lento (52,85 t/s), mas com raciocínio habilitado e contexto de 128 mil tokens.

A Mistral francesa entra com a família Ministral 3: o de 14B a US$ 0,20 e o de 8B a US$ 0,15, ambos com visão (text+image→text) e contexto de 262 mil tokens. Não são modelos de raciocínio — o campo reasoning está como false — mas são multimodal e leves. O Llama 4 Scout da Meta fecha o recorte: 109 bilhões totais, 17 ativos, multimodal, contexto de 1,3 milhão de tokens a US$ 0,10 de entrada e US$ 0,30 de saída. É a maior janela de contexto do grupo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

Para quem isso muda alguma coisa

Se você roda agente, classificador, extrator, chatbot de alto volume ou qualquer pipeline que consome muito token por pouco valor unitário, este recorte é onde mora a economia real. O MiMo-V2-Flash sozinho já entrega o melhor custo-benefício do catálogo; o gpt-oss-120b é a alternativa ocidental imediata; os Nemotron e Ministral são as opções de nicho para velocidade, visão ou contexto gigante.

Se você está construindo um produto onde cada resposta precisa ser a melhor possível — geração de código crítica, raciocínio jurídico, planejamento multi-etapa —, a faixa barata ainda não substitui os modelos de topo. O o3 e o Claude Haiku 4.5 continuam em outro andar. Mas a conta agora cabe em outro orçamento.

Em uma frase

Antes de escolher um modelo caro por inércia, rode um benchmark seu no MiMo-V2-Flash ou no gpt-oss-120b — a diferença de preço é grande demais para ignorar sem testar.

Perguntas frequentes

Qual é o modelo mais barato do catálogo em janeiro de 2026?

Dentro do recorte de US$ 0,40 por milhão de tokens de saída, o mais barato em entrada é o gpt-oss-20b, a US$ 0,03 por milhão. O Xiaomi MiMo-V2-Flash tem o melhor custo-benefício do grupo, com IQ de 34,024 a US$ 0,30 de saída.

Modelos abertos valem a pena em produção?

Todos os oito modelos do recorte têm pesos abertos (`open_weights: true`) e são de grandes laboratórios — Xiaomi, OpenAI, NVIDIA, Mistral e Meta. Para tarefas de alto volume e baixa exigência unitária, são a opção mais racional da fatura.

Por que o MiMo-V2-Flash é tão mais barato que o o3?

Porque é uma arquitetura Mixture-of-Experts com apenas 15 bilhões de parâmetros ativos por inferência, embora tenha 309 bilhões totais. Você paga para usar uma fração do modelo a cada chamada, o que derruba o custo sem eliminar a capacidade.

Leia também