Um milhão de tokens virou commodity: 38 modelos e o preço varia 40 vezes
Llama 4 Scout cobra US$ 0,10 por milhão de tokens de entrada. Nova Premier, US$ 12,50 de saída. A janela de contexto longa deixou de ser diferencial — o que você faz com ela é.
Quando 1 milhão virou commodity
Você já parou para pensar que "contexto de 1 milhão" deixou de ser feature de flagship? No catálogo desta segunda-feira, 4 de janeiro de 2026, são 38 modelos com janela de um milhão de tokens ou mais — 12% dos 313 listados. A maioria chegou nos últimos 12 meses. O que era exceção virou item de prateleira, e a conta no fim do mês é o que separa uma escolha boa de uma armadilha silenciosa.
O barato que ninguém está colocando em release
Olha o Llama 4 Scout, da Meta. Contexto de 1.310.720 tokens, US$ 0,10 por milhão de tokens de entrada, US$ 0,30 de saída. É modelo aberto, 109 bilhões de parâmetros totais com 17 bilhões ativos por inferência (arquitetura mixture-of-experts). Para uma tarefa do tipo "joga esse PDF inteiro no modelo e me resume", é difícil bater o custo.
O Llama 4 Maverick, da mesma Meta, sobe para US$ 0,20 de entrada e US$ 0,696 de saída — ainda barato, mesma janela de 1M, com bônus multimodal (aceita imagem). A diferença de preço entre os dois irmãos é pequena; a de capacidade, nem tanto.
O outro extremo da tabela
Agora olha o Amazon Nova Premier. Mesma janela de 1 milhão de tokens. Mesma multimodalidade. Preço: US$ 2,50 de entrada, US$ 12,50 de saída — 40 vezes mais caro que o Scout na saída. Tem cache de prompt (US$ 0,625 por milhão), o que ajuda em workloads repetitivos, mas não esconde o spread.
A Amazon também oferece o Nova 2 Lite na mesma faixa de contexto, a US$ 0,30 de entrada e US$ 2,50 de saída — bem mais razoável, com raciocínio nativo e velocidade de 153 tokens por segundo. Para a maioria dos casos de "contexto longo", o Lite provavelmente entrega o que você precisa sem a conta gorda do Premier.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
O detalhe que ninguém coloca no release
Contexto grande não é qualidade grande. Olha os índices de inteligência do recorte: Nova 2 Lite marca IQ 19,24; Llama 4 Maverick, 14,5; Scout, 10,3; Nova Premier, 12,7. Compare com o topo do mercado hoje — o Xiaomi MiMo-V2-Flash lidera com IQ 34, e o OpenAI o3 marca 31. Nenhum dos dois aparece neste recorte de contexto longo com folga.
Isso não é defeito, é trade-off. Janelas maiores custam atenção do modelo, e muitos fornecedores optam por escalar contexto sem escalar raciocínio. Para resumir transcrição de call ou extrair cláusula de contrato, serve. Para raciocínio encadeado sobre um codebase inteiro, a janela sozinha não resolve.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso muda o jogo
Se você está montando pipeline de RAG sobre base grande, processando vídeos longos ou fazendo análise de repositório de código, o Scout a US$ 0,10/M é uma porta de entrada que não existia há um ano. Para workload que repete o mesmo system prompt em milhões de chamadas, o cache do Nova Premier (US$ 0,625) pode pagar a conta — mas só se a qualidade justificar.
Se o que você precisa é o modelo mais inteligente possível e o contexto cabe em 200 mil tokens, não muda nada: vá de o3 ou do MiMo-V2-Flash e pare de pensar em janela.
O que fazer com essa informação
Antes de escolher um modelo de "contexto longo", faça três contas: qual é o tamanho real do seu prompt (não o máximo que o modelo aguenta), quantas chamadas você faz por mês e quanto da fatura vai para input versus output. Se a maior parte é input, Scout e Maverick entregam 95% do valor por uma fração do preço. Se a maior parte é output, o cálculo muda — e o spread de 40 vezes entre Scout e Premier começa a doer.
Escolha pelo seu caso real, não pelo número do release: em contexto longo, o mais barato costuma ser o mais inteligente financeiramente — e o mais caro raramente é o mais capaz.
Perguntas frequentes
Qual modelo de contexto longo tem o melhor custo-benefício hoje?
Entre os modelos com 1M+ tokens listados agora, o Llama 4 Scout, da Meta, lidera no custo: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 de saída, com pesos abertos. O Llama 4 Maverick é o próximo passo natural se você precisa de multimodalidade.
1 milhão de tokens é sempre melhor que 200 mil?
Não. Janela maior só ajuda se o seu prompt realmente precisa desse tamanho. Para a maioria das aplicações, 200 mil tokens já resolve, e os modelos mais inteligentes do mercado (MiMo-V2-Flash, o3) não estão necessariamente no recorte de 1M+ com a melhor qualidade.
Por que o Amazon Nova Premier é tão mais caro que o Scout?
O Premier cobra US$ 12,50 por milhão de tokens de saída, contra US$ 0,30 do Scout — 40 vezes mais. A diferença reflete posicionamento (Premier é o topo da linha Amazon, com cache de prompt) e não necessariamente qualidade proporcional: o IQ do Premier (12,7) é menor que o do Nova 2 Lite (19,2), que custa cinco vezes menos na saída.