FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Um milhão de tokens virou commodity: 38 modelos e o preço varia 40 vezes

Llama 4 Scout cobra US$ 0,10 por milhão de tokens de entrada. Nova Premier, US$ 12,50 de saída. A janela de contexto longa deixou de ser diferencial — o que você faz com ela é.

Redação FalaVIP IA 3 min de leitura
38modelos com 1M+ tokens de contexto no catálogo
US$ 0,10por milhão de tokens de entrada (Llama 4 Scout)
US$ 12,50por milhão de tokens de saída (Nova Premier)

Quando 1 milhão virou commodity

Você já parou para pensar que "contexto de 1 milhão" deixou de ser feature de flagship? No catálogo desta segunda-feira, 4 de janeiro de 2026, são 38 modelos com janela de um milhão de tokens ou mais — 12% dos 313 listados. A maioria chegou nos últimos 12 meses. O que era exceção virou item de prateleira, e a conta no fim do mês é o que separa uma escolha boa de uma armadilha silenciosa.

Inteligência × preço no recorte
Nova 2 LiteLlama 4 MaverickNova Premier 1.0Llama 4 ScoutUS$ por milhão (saída, escala log)índice de inteligência

O barato que ninguém está colocando em release

Olha o Llama 4 Scout, da Meta. Contexto de 1.310.720 tokens, US$ 0,10 por milhão de tokens de entrada, US$ 0,30 de saída. É modelo aberto, 109 bilhões de parâmetros totais com 17 bilhões ativos por inferência (arquitetura mixture-of-experts). Para uma tarefa do tipo "joga esse PDF inteiro no modelo e me resume", é difícil bater o custo.

O Llama 4 Maverick, da mesma Meta, sobe para US$ 0,20 de entrada e US$ 0,696 de saída — ainda barato, mesma janela de 1M, com bônus multimodal (aceita imagem). A diferença de preço entre os dois irmãos é pequena; a de capacidade, nem tanto.

O outro extremo da tabela

Agora olha o Amazon Nova Premier. Mesma janela de 1 milhão de tokens. Mesma multimodalidade. Preço: US$ 2,50 de entrada, US$ 12,50 de saída — 40 vezes mais caro que o Scout na saída. Tem cache de prompt (US$ 0,625 por milhão), o que ajuda em workloads repetitivos, mas não esconde o spread.

A Amazon também oferece o Nova 2 Lite na mesma faixa de contexto, a US$ 0,30 de entrada e US$ 2,50 de saída — bem mais razoável, com raciocínio nativo e velocidade de 153 tokens por segundo. Para a maioria dos casos de "contexto longo", o Lite provavelmente entrega o que você precisa sem a conta gorda do Premier.

Destaques do recorte: janelas de contexto longas
ModeloCriadorInteligênciaSaída US$/MContexto
Nova 2 Liteamazon19.22.51M
Llama 4 Maverickmeta-llama14.50.6961.05M
Nova Premier 1.0amazon12.712.51M
Llama 4 Scoutmeta-llama10.30.31.31M
Auto Routeropenrouter-10000002M
UnslopNemo 12Bthedrummer0.41.02M
MiniMax-01minimax1.11M
Qwen-Plusqwen0.781M

O detalhe que ninguém coloca no release

Contexto grande não é qualidade grande. Olha os índices de inteligência do recorte: Nova 2 Lite marca IQ 19,24; Llama 4 Maverick, 14,5; Scout, 10,3; Nova Premier, 12,7. Compare com o topo do mercado hoje — o Xiaomi MiMo-V2-Flash lidera com IQ 34, e o OpenAI o3 marca 31. Nenhum dos dois aparece neste recorte de contexto longo com folga.

Isso não é defeito, é trade-off. Janelas maiores custam atenção do modelo, e muitos fornecedores optam por escalar contexto sem escalar raciocínio. Para resumir transcrição de call ou extrair cláusula de contrato, serve. Para raciocínio encadeado sobre um codebase inteiro, a janela sozinha não resolve.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

Para quem isso muda o jogo

Se você está montando pipeline de RAG sobre base grande, processando vídeos longos ou fazendo análise de repositório de código, o Scout a US$ 0,10/M é uma porta de entrada que não existia há um ano. Para workload que repete o mesmo system prompt em milhões de chamadas, o cache do Nova Premier (US$ 0,625) pode pagar a conta — mas só se a qualidade justificar.

Se o que você precisa é o modelo mais inteligente possível e o contexto cabe em 200 mil tokens, não muda nada: vá de o3 ou do MiMo-V2-Flash e pare de pensar em janela.

O que fazer com essa informação

Antes de escolher um modelo de "contexto longo", faça três contas: qual é o tamanho real do seu prompt (não o máximo que o modelo aguenta), quantas chamadas você faz por mês e quanto da fatura vai para input versus output. Se a maior parte é input, Scout e Maverick entregam 95% do valor por uma fração do preço. Se a maior parte é output, o cálculo muda — e o spread de 40 vezes entre Scout e Premier começa a doer.

Em uma frase

Escolha pelo seu caso real, não pelo número do release: em contexto longo, o mais barato costuma ser o mais inteligente financeiramente — e o mais caro raramente é o mais capaz.

Perguntas frequentes

Qual modelo de contexto longo tem o melhor custo-benefício hoje?

Entre os modelos com 1M+ tokens listados agora, o Llama 4 Scout, da Meta, lidera no custo: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 de saída, com pesos abertos. O Llama 4 Maverick é o próximo passo natural se você precisa de multimodalidade.

1 milhão de tokens é sempre melhor que 200 mil?

Não. Janela maior só ajuda se o seu prompt realmente precisa desse tamanho. Para a maioria das aplicações, 200 mil tokens já resolve, e os modelos mais inteligentes do mercado (MiMo-V2-Flash, o3) não estão necessariamente no recorte de 1M+ com a melhor qualidade.

Por que o Amazon Nova Premier é tão mais caro que o Scout?

O Premier cobra US$ 12,50 por milhão de tokens de saída, contra US$ 0,30 do Scout — 40 vezes mais. A diferença reflete posicionamento (Premier é o topo da linha Amazon, com cache de prompt) e não necessariamente qualidade proporcional: o IQ do Premier (12,7) é menor que o do Nova 2 Lite (19,2), que custa cinco vezes menos na saída.

Leia também