1 milhão de tokens não impressiona mais — o que importa agora é o preço
No recorte de janelas longas, Scout cobra US$ 0,30 e Nova Premier, US$ 12,50 por milhão de tokens de saída — mesma janela, preços 41 vezes diferentes.
Você está olhando o catálogo e 34 dos 270 modelos listados hoje aceitam pelo menos 1 milhão de tokens de contexto. Mais de 12% do total. Em 2024 isso era exceção de laboratório; em novembro de 2025 virou commodity.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
| Gemini 2.0 Flash | — | 0.4 | 1.05M |
Só que aí vem a parte que ninguém fala: a diferença entre o modelo mais barato e o mais caro desse recorte passa de 40 vezes por milhão de tokens de saída. Janela igual, conta oposta.
De 10 centavos a 12,50 dólares
A faixa dentro do recorte é brutal:
- Llama 4 Scout, da Meta: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. Contexto de 1,31 milhão. Open weights, americano, lançado em abril.
- Amazon Nova Premier 1.0, lançado em 31 de outubro: US$ 2,50 na entrada e US$ 12,50 na saída. Mesmo balde de 1 milhão de contexto, sem cache listado.
Para cada milhão de tokens que você gera no Scout, paga 30 centavos. No Nova Premier, paga US$ 12,50. São 41 vezes mais pelo mesmo tamanho de janela.
O que está acontecendo no tabuleiro
Quando o Meta lançou o Llama 4 em abril, 1 milhão de contexto virou o novo chão para os modelos abertos de fronteira. O Scout e o Maverick (US$ 0,20 entrada / US$ 0,696 saída) mostram até onde dá para empurrar pesos abertos nesse balde.
Do outro lado, a Amazon entrou no fim de outubro com o Nova Premier como "modelo professor" para destilação — não é a aposta de volume, é o topo do catálogo. Daí o preço.
No meio, o Gemini 2.0 Flash da Google cobra US$ 0,10 de entrada e US$ 0,40 de saída, mas com cache de prompt a US$ 0,025 por milhão. Se você reusa o mesmo contexto milhares de vezes por dia, esse 2,5 centavo muda a conta mais do que qualquer desconto na entrada.
Não é só tamanho de janela
Janela grande é capacidade bruta, não qualidade. É como comprar uma mesa de 3 metros para usar com 5 livros: você paga pelo espaço que não ocupa.
O o3 da OpenAI lidera o catálogo em inteligência medida (IQ 31,096) e não aparece neste recorte de contexto longo. O Scout tem 1,31 milhão de tokens mas IQ 10,256. Janela não é proxy de capacidade.
Para quem vale — e para quem não muda nada
Vale para você se:
- já está esbarrando no limite de 128k ou 200k de tokens
- roda RAG pesado, análise de codebase ou sumarização de documentos longos
- quer pesos abertos para self-host com 1M+ (Scout, Maverick)
- pode se beneficiar de cache de prompt agressivo (Flash)
Não muda nada se:
- seu prompt médio cabe em 32 mil tokens — você está pagando por ineficiência
- você trata "1 milhão de contexto" como sinônimo de modelo bom
- nunca testou se a coerência do modelo se mantém nos últimos 500 mil tokens
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O que fazer amanhã
Pega o caso de uso que está esbarrando no limite e roda o mesmo prompt no Scout e no Gemini Flash. Compara o custo por chamada em produção. Se a diferença de qualidade não compensar os quase US$ 12 a mais por milhão de tokens de saída do Premier, volta para o Flash com cache de 2,5 centavos.
Se você está vendendo "contexto de 1 milhão" como diferencial hoje, pare. Já são 34 modelos. O que vira diferencial agora é preço por token reutilizado, velocidade e o que cabe nos primeiros 128 mil — não o tamanho da janela.
Pare de pagar caro por '1 milhão de contexto' como se fosse diferencial: meça o custo real por chamada entre Scout, Gemini Flash e o que você já usa, e só então decida se a janela maior muda o resultado.
Perguntas frequentes
Qual o modelo mais barato com 1 milhão de contexto hoje?
O Llama 4 Scout da Meta lidera em preço de entrada, a US$ 0,10 por milhão de tokens, com 1,31 milhão de janela. O Gemini 2.0 Flash cobra o mesmo na entrada, mas oferece cache de prompt a US$ 0,025 por milhão, mais vantajoso quando o contexto é reusado.
Janela de contexto grande significa modelo melhor?
Não. Janela grande é capacidade bruta de entrada, não qualidade. O o3 da OpenAI lidera o catálogo em inteligência medida (IQ 31,096) sem aparecer neste recorte; o Scout tem 1,31M de contexto mas IQ 10,256. São eixos diferentes.
Vale a pena pagar o Amazon Nova Premier?
Só se você precisa do topo da Amazon para destilação ou raciocínio complexo e o custo de US$ 12,50 por milhão de tokens de saída cabe no orçamento. Para a maioria dos casos de contexto longo, Scout, Flash ou Qwen-Plus entregam o mesmo a uma fração do custo.