FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

89 modelos custam menos de US$ 1 por milhão de tokens — e poucos valem a pena

A faixa barata do catálogo concentra modelos open-weight de China, EUA e França, mas só três entregam inteligência competitiva; Xiaomi, OpenAI e NVIDIA dominam a conversa.

Redação FalaVIP IA 3 min de leitura
89modelos na faixa barata do catálogo
US$ 0,10preço de entrada do Xiaomi MiMo-V2-Flash por milhão de tokens
34,024índice de inteligência do modelo mais barato entre os baratos

O preço baixo não é o mesmo que vale a pena

Se você paga a conta da API no fim do mês, a pergunta que importa não é "quanto custa o mais barato", mas "quanto custa o barato que entrega trabalho de verdade". O catálogo aberto nesta semana lista mais de 315 modelos; 89 deles cabem na faixa barata — definida aqui como entrada e saída abaixo de US$ 1 por milhão de tokens. É quase um terço de tudo o que está disponível. E é justamente aí que mora a armadilha: a maioria desses 89 não te economiza dinheiro, te custa mais caro quando você precisa de uma segunda chamada para corrigir a primeira.

Os três nomes que se separam do resto

Olhando o recorte de perto, só três modelos justificam o trânsito por essa faixa. O primeiro é o Xiaomi MiMo-V2-Flash: US$ 0,10 de entrada e US$ 0,30 de saída por milhão de tokens, com índice de inteligência de 34,024 — o maior de toda a faixa e também o maior do catálogo inteiro, empatando ou ultrapassando rivais 25 vezes mais caros. É open-weight, mistura de especialistas com 309B de parâmetros totais e 15B ativos, contexto de 262 mil tokens e vem da China.

Logo abaixo vem o OpenAI gpt-oss-120b, único modelo americano a entrar no ranking que importa nessa faixa: US$ 0,037 de entrada e US$ 0,17 de saída, índice de 24,126, contexto de 131 mil, MoE com 5,1B ativos. É a melhor opção se você precisa de raciocínio com peso americano e quer gastar pouco.

O terceiro lugar do pódio barato é o NVIDIA Nemotron 3 Nano 30B A3B: US$ 0,05 de entrada e US$ 0,20 de saída, índice de 14,538, velocidade de 247,99 tokens por segundo — a maior do recorte. Se o teu gargalo é latência, esse é o nome.

Inteligência × preço no recorte
MiMo-V2-Flashgpt-oss-120bgpt-oss-20bNemotron 3 Nano 30B A3BLlama 3.3 Nemotron Super 49BMinistral 3 14B 2512Llama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

O resto do recorte: uma mistura útil, com ressalvas

A faixa não se resume aos três. O catálogo traz ainda opções como o gpt-oss-20b da própria OpenAI, ainda mais barato (US$ 0,03 e US$ 0,13), o Llama 4 Scout da Meta com contexto absurdo de 1,3 milhão de tokens, e os franceses Ministral 3 14B e 8B da Mistral, que adicionam visão ao pacote. Cada um cobre um nicho: contexto gigante, multimodalidade, latência. Mas o salto de qualidade entre o Nemotron Nano e o quarto colocado é grande o suficiente para você repensar antes de automatizar qualquer coisa crítica em cima deles.

Destaques do recorte: a faixa barata
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
gpt-oss-120bopenai24.10.17131k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Ministral 3 14B 2512mistralai11.20.2262k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k

Para quem essa faixa vale — e para quem não muda nada

Vale para você que roda pipelines em volume (classificação, extração, resumos, agentes simples), onde cada centavo por milhão vira milhares no fim do mês, e onde a diferença entre um modelo bom e um modelo medíocre é uma camada extra de pós-processamento. Vale para protótipos e MVPs que precisam rodar hoje sem travar o orçamento. Vale para times que já têm guardrails próprios e tratam o modelo como commodity.

Não muda nada se o que você precisa é raciocínio pesado, código complexo ou agentes autônomos que tomam decisões caras: o topo do mercado continua custando o que custa. O índice de inteligência do o3, por exemplo, é 31,096 — mas a US$ 8 por milhão de tokens de saída, são mais de 26 vezes o preço do MiMo-V2-Flash. E há um abismo entre qualquer modelo dessa faixa e o Claude Haiku 4.5 (US$ 5 de saída, índice 29,892) quando o assunto é confiabilidade em tarefas que o cliente vê.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 315 modelos disponíveis no catálogo nesta data.

A geopolítica do token barato

O padrão geográfico é claro: dos cinco modelos que vale a pena conhecer na faixa, dois vêm dos Estados Unidos (OpenAI, NVIDIA), um da China (Xiaomi) e os multimodais vêm da França (Mistral). O MiMo-V2-Flash chamando a atenção no topo do ranking de inteligência do catálogo inteiro é o sinal mais concreto de que a frente open-weight chinesa já não é só "barata" — é competitiva na medida. Para o desenvolvedor brasileiro, isso significa que dá pra rodar MiMo em cloud americana sem dor de cabeça regulatória, com ganho real de preço.

O que fazer com isso agora

Teste três modelos antes de comprometer o pipeline: MiMo-V2-Flash para a tarefa padrão, gpt-oss-120b se você precisa do ecossistema OpenAI sem o preço dela, e Nemotron 3 Nano quando latência mandar. Meça com seu próprio eval, não com benchmark genérico. E não confunda "US$ 0,10 por milhão" com economia automática — o barato que erra duas vezes custa o mesmo que o caro que acerta uma.

Em uma frase

Pegue o MiMo-V2-Flash como default barato, o gpt-oss-120b como plano B no ecossistema OpenAI e o Nemotron Nano quando latência for o gargalo; só migre para a faixa cara se a tarefa exigir raciocínio que esses três não entregam.

Perguntas frequentes

Qual o modelo mais barato que ainda vale a pena em janeiro de 2026?

O Xiaomi MiMo-V2-Flash lidera a faixa barata com US$ 0,30 por milhão de tokens de saída e o maior índice de inteligência do catálogo inteiro (34,024). É open-weight e roda em infra americana sem fricção regulatória.

Modelos abaixo de US$ 1 por milhão entregam o mesmo que os caros?

Não. O MiMo-V2-Flash se aproxima do Claude Haiku 4.5 em inteligência e custa 17 vezes menos na saída, mas modelos como o3 (US$ 8/M de saída) ainda dominam raciocínio pesado. Para commodity, o barato vence; para tarefas críticas, a diferença ainda pesa na conta.

Vale a pena usar modelo chinês open-weight em produção?

O MiMo-V2-Flash é open-weight, o que permite auditoria completa dos pesos. Para a maioria dos casos rodando em cloud nos EUA, o uso é direto; o ponto de atenção continua sendo o_cutoff de conhecimento (não divulgado) e a política de dados do provedor escolhido.

Leia também