FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Contexto de 1 milhão de tokens já é commodity: 38 modelos, e o melhor custa US$ 0,30

Oito deles processam livros inteiros de uma vez. Só que pagar barato pela janela não significa pagar barato pelo modelo — e o ranking de inteligência mostra quem entrega e quem só decora.

Redação FalaVIP IA 4 min de leitura
US$ 0,30por milhão de tokens de saída do Llama 4 Scout (1,3M de contexto)
38modelos com contexto ≥ 1M de tokens no catálogo
8modelos no recorte de destaque, de 4 países diferentes

O número que parecia impossível virou item de prateleira

Em janeiro de 2026, abrir uma janela de contexto de 1 milhão de tokens em qualquer API não é mais notícia. É item de catálogo. São 38 modelos listados hoje com essa capacidade ou mais — quase 12% de um catálogo que tem mais de 315 opções. Destes, oito viraram destaque por combinarem contexto longo com algum tipo de proposta de valor mensurável: preço baixo, peso aberto ou multimodalidade nativa.

Inteligência × preço no recorte
Nova 2 LiteLlama 4 MaverickNova Premier 1.0Llama 4 ScoutUS$ por milhão (saída, escala log)índice de inteligência

A pergunta prática mudou. Não é mais "qual modelo aceita meu PDF de 800 páginas". É "qual modelo aceita meu PDF de 800 páginas sem me cobrar como se fosse um jantar".

O rei do custo por token não é o rei da inteligência

Olha o Llama 4 Scout no recorte. Contexto de 1.310.720 tokens, multimodal (texto e imagem), pesos abertos, da Meta. Custa US$ 0,10 por milhão de entrada e US$ 0,30 por milhão de saída. Em geração de texto, é o mais barato do grupo.

Só que o índice de inteligência dele é 10,256 — o menor entre os modelos do recorte que têm nota. Para comparação, o Nova 2 Lite, da Amazon, marca 19,24 no mesmo índice e custa US$ 2,50 por milhão de saída. São 8 vezes mais caro na saída, mas com nota de inteligência quase duas vezes maior.

Traduzindo o marketing: "contexto longo e barato" virou commodity. Inteligência dentro daquele contexto, não.

Destaques do recorte: janelas de contexto longas
ModeloCriadorInteligênciaSaída US$/MContexto
Nova 2 Liteamazon19.22.51M
Llama 4 Maverickmeta-llama14.50.6961.05M
Nova Premier 1.0amazon12.712.51M
Llama 4 Scoutmeta-llama10.30.31.31M
Auto Routeropenrouter-10000002M
UnslopNemo 12Bthedrummer0.41.02M
MiniMax-01minimax1.11M
Qwen-Plusqwen0.781M

A Amazon dobrou a aposta em multimodal

Dos oito modelos do recorte, dois são da Amazon e ambos aceitam imagem junto com texto. O Nova 2 Lite, lançado em 2 de dezembro de 2025, é o mais barato dos dois (US$ 0,30 entrada / US$ 2,50 saída) e tem nota 19,24. O Nova Premier 1.0, de outubro de 2025, é o mais caro do recorte: US$ 12,50 por milhão de saída — quarenta vezes o preço do Scout. Em troca, oferece suporte a cache de prompt a US$ 0,625, o que faz diferença em workloads repetitivos.

Para quem processa vídeo, imagem e texto no mesmo pipeline, a Amazon é a única do recorte com essa combinação a preço baixo. Para quem só precisa de texto longo, o Premier não se justifica — você está pagando multimodalidade que não vai usar.

A Meta entrega o open weights mais barato, a um custo

Os dois Llama 4 do recorte são os únicos com pesos abertos. Maverick (1.048.576 de contexto, MoE com 17B ativos de 402B totais) sai por US$ 0,696 por milhão de saída. Scout é ainda mais barato. Em troca, nenhum dos dois tem raciocínio nativo — reasoning: false nos dois. Se o seu caso de uso exige cadeia de pensamento longa, você vai gastar mais tokens de saída tentando compensar.

Para quem quer self-host ou fine-tuning, o preço de API é quase irrelevante — o que importa é o tamanho do modelo ativo. 17B ativos é administrável em uma GPU de 80GB. 402B totais, nem tanto.

Tem modelo chinês no recorte, mas não no topo

O Qwen-Plus, da Alibaba, aparece com 1M de contexto e preço de US$ 0,26 entrada / US$ 0,78 saída — com cache a US$ 0,052, o mais barato do recorte. Só que não tem índice de inteligência publicado no catálogo. O mesmo vale para o TheDrummer UnslopNemo 12B, focado em roleplay, e para o MiniMax-01, que é o único modelo do recorte com 2 milhões de tokens de contexto (na verdade, são 1.000.192, mas o Auto Router da OpenRouter chega a 2M).

Sem nota de inteligência, a comparação justa é impossível. Você está comprando no escuro — o que pode valer a pena para workloads muito específicos, mas não para uma decisão de arquitetura.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 315 modelos disponíveis no catálogo nesta data.

Para quem isso muda a conta, e para quem não muda nada

Se você já estava usando contexto de 128K e pagando caro por isso, migrar para Scout ou Qwen-Plus derruba o custo de API em uma ordem de grandeza — assumindo que a queda de inteligência não quebra seu produto. Se você está rodando agente que precisa raciocinar sobre documentos longos, o Nova 2 Lite é o melhor equilíbrio custo × inteligência do recorte, mesmo custando 8x mais que o Scout na saída.

Se você está satisfeito com 200K de contexto e não processa documentos inteiros, nada aqui te afeta. A janela de 1M é para quem engole livros, bases de código ou vídeos de uma vez — e isso ainda é minoria dos workloads em produção.

O que fazer hoje: rode seu caso de uso real no Scout e no Nova 2 Lite lado a lado. Se a diferença de qualidade não aparece no seu eval, a Scout economiza US$ 2,20 por milhão de tokens de saída. Em escala, isso é orçamento de um estagiário por mês.

Em uma frase

Teste Llama 4 Scout e Nova 2 Lite no seu caso de uso real antes de renovar contrato: a diferença de 8x no preço de saída só se justifica se a inteligência do Scout não cobrir seu workload.

Perguntas frequentes

Qual o modelo mais barato com 1 milhão de tokens de contexto?

O Llama 4 Scout, da Meta, custa US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com 1.310.720 tokens de contexto e pesos abertos. É o mais barato do recorte, mas tem o menor índice de inteligência entre os modelos com nota publicada.

Contexto longo significa que o modelo é mais inteligente?

Não. Janela de contexto é a quantidade de texto que cabe na memória de uma vez; inteligência é uma medida separada de capacidade de raciocínio. No recorte, o Scout tem a maior janela e a menor nota de inteligência; o Nova 2 Lite tem janela parecida e nota quase duas vezes maior.

Vale a pena usar contexto de 1M de tokens?

Só se você realmente precisa processar documentos inteiros, bases de código grandes ou vídeos longos em uma única chamada. Para a maioria dos workloads em produção, 128K a 200K continuam suficientes, e os modelos do recorte de 1M não trazem ganho de qualidade fora desse nicho.

Leia também