FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

1 milhão de tokens não impressiona mais — o que importa agora é o preço

No recorte de janelas longas, Scout cobra US$ 0,30 e Nova Premier, US$ 12,50 por milhão de tokens de saída — mesma janela, preços 41 vezes diferentes.

Redação FalaVIP IA 3 min de leitura
US$ 0,10por milhão de tokens de entrada (Llama 4 Scout)
US$ 12,50por milhão de tokens de saída (Amazon Nova Premier)
34modelos com 1M+ de contexto no catálogo

Você está olhando o catálogo e 34 dos 270 modelos listados hoje aceitam pelo menos 1 milhão de tokens de contexto. Mais de 12% do total. Em 2024 isso era exceção de laboratório; em novembro de 2025 virou commodity.

Destaques do recorte: janelas de contexto longas
ModeloCriadorInteligênciaSaída US$/MContexto
Llama 4 Maverickmeta-llama14.50.6961.05M
Nova Premier 1.0amazon12.712.51M
Llama 4 Scoutmeta-llama10.30.31.31M
Auto Routeropenrouter-10000002M
UnslopNemo 12Bthedrummer0.41.02M
MiniMax-01minimax1.11M
Qwen-Plusqwen0.781M
Gemini 2.0 Flashgoogle0.41.05M

Só que aí vem a parte que ninguém fala: a diferença entre o modelo mais barato e o mais caro desse recorte passa de 40 vezes por milhão de tokens de saída. Janela igual, conta oposta.

De 10 centavos a 12,50 dólares

A faixa dentro do recorte é brutal:

  • Llama 4 Scout, da Meta: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. Contexto de 1,31 milhão. Open weights, americano, lançado em abril.
  • Amazon Nova Premier 1.0, lançado em 31 de outubro: US$ 2,50 na entrada e US$ 12,50 na saída. Mesmo balde de 1 milhão de contexto, sem cache listado.

Para cada milhão de tokens que você gera no Scout, paga 30 centavos. No Nova Premier, paga US$ 12,50. São 41 vezes mais pelo mesmo tamanho de janela.

Inteligência × preço no recorte
Llama 4 MaverickNova Premier 1.0Llama 4 ScoutUS$ por milhão (saída, escala log)índice de inteligência

O que está acontecendo no tabuleiro

Quando o Meta lançou o Llama 4 em abril, 1 milhão de contexto virou o novo chão para os modelos abertos de fronteira. O Scout e o Maverick (US$ 0,20 entrada / US$ 0,696 saída) mostram até onde dá para empurrar pesos abertos nesse balde.

Do outro lado, a Amazon entrou no fim de outubro com o Nova Premier como "modelo professor" para destilação — não é a aposta de volume, é o topo do catálogo. Daí o preço.

No meio, o Gemini 2.0 Flash da Google cobra US$ 0,10 de entrada e US$ 0,40 de saída, mas com cache de prompt a US$ 0,025 por milhão. Se você reusa o mesmo contexto milhares de vezes por dia, esse 2,5 centavo muda a conta mais do que qualquer desconto na entrada.

Não é só tamanho de janela

Janela grande é capacidade bruta, não qualidade. É como comprar uma mesa de 3 metros para usar com 5 livros: você paga pelo espaço que não ocupa.

O o3 da OpenAI lidera o catálogo em inteligência medida (IQ 31,096) e não aparece neste recorte de contexto longo. O Scout tem 1,31 milhão de tokens mas IQ 10,256. Janela não é proxy de capacidade.

Para quem vale — e para quem não muda nada

Vale para você se:

  • já está esbarrando no limite de 128k ou 200k de tokens
  • roda RAG pesado, análise de codebase ou sumarização de documentos longos
  • quer pesos abertos para self-host com 1M+ (Scout, Maverick)
  • pode se beneficiar de cache de prompt agressivo (Flash)

Não muda nada se:

  • seu prompt médio cabe em 32 mil tokens — você está pagando por ineficiência
  • você trata "1 milhão de contexto" como sinônimo de modelo bom
  • nunca testou se a coerência do modelo se mantém nos últimos 500 mil tokens
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

O que fazer amanhã

Pega o caso de uso que está esbarrando no limite e roda o mesmo prompt no Scout e no Gemini Flash. Compara o custo por chamada em produção. Se a diferença de qualidade não compensar os quase US$ 12 a mais por milhão de tokens de saída do Premier, volta para o Flash com cache de 2,5 centavos.

Se você está vendendo "contexto de 1 milhão" como diferencial hoje, pare. Já são 34 modelos. O que vira diferencial agora é preço por token reutilizado, velocidade e o que cabe nos primeiros 128 mil — não o tamanho da janela.

Em uma frase

Pare de pagar caro por '1 milhão de contexto' como se fosse diferencial: meça o custo real por chamada entre Scout, Gemini Flash e o que você já usa, e só então decida se a janela maior muda o resultado.

Perguntas frequentes

Qual o modelo mais barato com 1 milhão de contexto hoje?

O Llama 4 Scout da Meta lidera em preço de entrada, a US$ 0,10 por milhão de tokens, com 1,31 milhão de janela. O Gemini 2.0 Flash cobra o mesmo na entrada, mas oferece cache de prompt a US$ 0,025 por milhão, mais vantajoso quando o contexto é reusado.

Janela de contexto grande significa modelo melhor?

Não. Janela grande é capacidade bruta de entrada, não qualidade. O o3 da OpenAI lidera o catálogo em inteligência medida (IQ 31,096) sem aparecer neste recorte; o Scout tem 1,31M de contexto mas IQ 10,256. São eixos diferentes.

Vale a pena pagar o Amazon Nova Premier?

Só se você precisa do topo da Amazon para destilação ou raciocínio complexo e o custo de US$ 12,50 por milhão de tokens de saída cabe no orçamento. Para a maioria dos casos de contexto longo, Scout, Flash ou Qwen-Plus entregam o mesmo a uma fração do custo.

Leia também