89 modelos custam menos de US$ 1 por milhão de tokens — e poucos valem a pena
A faixa barata do catálogo concentra modelos open-weight de China, EUA e França, mas só três entregam inteligência competitiva; Xiaomi, OpenAI e NVIDIA dominam a conversa.
O preço baixo não é o mesmo que vale a pena
Se você paga a conta da API no fim do mês, a pergunta que importa não é "quanto custa o mais barato", mas "quanto custa o barato que entrega trabalho de verdade". O catálogo aberto nesta semana lista mais de 315 modelos; 89 deles cabem na faixa barata — definida aqui como entrada e saída abaixo de US$ 1 por milhão de tokens. É quase um terço de tudo o que está disponível. E é justamente aí que mora a armadilha: a maioria desses 89 não te economiza dinheiro, te custa mais caro quando você precisa de uma segunda chamada para corrigir a primeira.
Os três nomes que se separam do resto
Olhando o recorte de perto, só três modelos justificam o trânsito por essa faixa. O primeiro é o Xiaomi MiMo-V2-Flash: US$ 0,10 de entrada e US$ 0,30 de saída por milhão de tokens, com índice de inteligência de 34,024 — o maior de toda a faixa e também o maior do catálogo inteiro, empatando ou ultrapassando rivais 25 vezes mais caros. É open-weight, mistura de especialistas com 309B de parâmetros totais e 15B ativos, contexto de 262 mil tokens e vem da China.
Logo abaixo vem o OpenAI gpt-oss-120b, único modelo americano a entrar no ranking que importa nessa faixa: US$ 0,037 de entrada e US$ 0,17 de saída, índice de 24,126, contexto de 131 mil, MoE com 5,1B ativos. É a melhor opção se você precisa de raciocínio com peso americano e quer gastar pouco.
O terceiro lugar do pódio barato é o NVIDIA Nemotron 3 Nano 30B A3B: US$ 0,05 de entrada e US$ 0,20 de saída, índice de 14,538, velocidade de 247,99 tokens por segundo — a maior do recorte. Se o teu gargalo é latência, esse é o nome.
O resto do recorte: uma mistura útil, com ressalvas
A faixa não se resume aos três. O catálogo traz ainda opções como o gpt-oss-20b da própria OpenAI, ainda mais barato (US$ 0,03 e US$ 0,13), o Llama 4 Scout da Meta com contexto absurdo de 1,3 milhão de tokens, e os franceses Ministral 3 14B e 8B da Mistral, que adicionam visão ao pacote. Cada um cobre um nicho: contexto gigante, multimodalidade, latência. Mas o salto de qualidade entre o Nemotron Nano e o quarto colocado é grande o suficiente para você repensar antes de automatizar qualquer coisa crítica em cima deles.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Llama 3.3 Nemotron Super 49B | nvidia | 12.4 | 0.4 | 131k |
| Ministral 3 14B 2512 | mistralai | 11.2 | 0.2 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | meta-llama | 9.3 | 0.32 | 131k |
Para quem essa faixa vale — e para quem não muda nada
Vale para você que roda pipelines em volume (classificação, extração, resumos, agentes simples), onde cada centavo por milhão vira milhares no fim do mês, e onde a diferença entre um modelo bom e um modelo medíocre é uma camada extra de pós-processamento. Vale para protótipos e MVPs que precisam rodar hoje sem travar o orçamento. Vale para times que já têm guardrails próprios e tratam o modelo como commodity.
Não muda nada se o que você precisa é raciocínio pesado, código complexo ou agentes autônomos que tomam decisões caras: o topo do mercado continua custando o que custa. O índice de inteligência do o3, por exemplo, é 31,096 — mas a US$ 8 por milhão de tokens de saída, são mais de 26 vezes o preço do MiMo-V2-Flash. E há um abismo entre qualquer modelo dessa faixa e o Claude Haiku 4.5 (US$ 5 de saída, índice 29,892) quando o assunto é confiabilidade em tarefas que o cliente vê.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A geopolítica do token barato
O padrão geográfico é claro: dos cinco modelos que vale a pena conhecer na faixa, dois vêm dos Estados Unidos (OpenAI, NVIDIA), um da China (Xiaomi) e os multimodais vêm da França (Mistral). O MiMo-V2-Flash chamando a atenção no topo do ranking de inteligência do catálogo inteiro é o sinal mais concreto de que a frente open-weight chinesa já não é só "barata" — é competitiva na medida. Para o desenvolvedor brasileiro, isso significa que dá pra rodar MiMo em cloud americana sem dor de cabeça regulatória, com ganho real de preço.
O que fazer com isso agora
Teste três modelos antes de comprometer o pipeline: MiMo-V2-Flash para a tarefa padrão, gpt-oss-120b se você precisa do ecossistema OpenAI sem o preço dela, e Nemotron 3 Nano quando latência mandar. Meça com seu próprio eval, não com benchmark genérico. E não confunda "US$ 0,10 por milhão" com economia automática — o barato que erra duas vezes custa o mesmo que o caro que acerta uma.
Pegue o MiMo-V2-Flash como default barato, o gpt-oss-120b como plano B no ecossistema OpenAI e o Nemotron Nano quando latência for o gargalo; só migre para a faixa cara se a tarefa exigir raciocínio que esses três não entregam.
Perguntas frequentes
Qual o modelo mais barato que ainda vale a pena em janeiro de 2026?
O Xiaomi MiMo-V2-Flash lidera a faixa barata com US$ 0,30 por milhão de tokens de saída e o maior índice de inteligência do catálogo inteiro (34,024). É open-weight e roda em infra americana sem fricção regulatória.
Modelos abaixo de US$ 1 por milhão entregam o mesmo que os caros?
Não. O MiMo-V2-Flash se aproxima do Claude Haiku 4.5 em inteligência e custa 17 vezes menos na saída, mas modelos como o3 (US$ 8/M de saída) ainda dominam raciocínio pesado. Para commodity, o barato vence; para tarefas críticas, a diferença ainda pesa na conta.
Vale a pena usar modelo chinês open-weight em produção?
O MiMo-V2-Flash é open-weight, o que permite auditoria completa dos pesos. Para a maioria dos casos rodando em cloud nos EUA, o uso é direto; o ponto de atenção continua sendo o_cutoff de conhecimento (não divulgado) e a política de dados do provedor escolhido.