Contexto de 1 milhão de tokens já é commodity: 38 modelos, e o melhor custa US$ 0,30
Oito deles processam livros inteiros de uma vez. Só que pagar barato pela janela não significa pagar barato pelo modelo — e o ranking de inteligência mostra quem entrega e quem só decora.
O número que parecia impossível virou item de prateleira
Em janeiro de 2026, abrir uma janela de contexto de 1 milhão de tokens em qualquer API não é mais notícia. É item de catálogo. São 38 modelos listados hoje com essa capacidade ou mais — quase 12% de um catálogo que tem mais de 315 opções. Destes, oito viraram destaque por combinarem contexto longo com algum tipo de proposta de valor mensurável: preço baixo, peso aberto ou multimodalidade nativa.
A pergunta prática mudou. Não é mais "qual modelo aceita meu PDF de 800 páginas". É "qual modelo aceita meu PDF de 800 páginas sem me cobrar como se fosse um jantar".
O rei do custo por token não é o rei da inteligência
Olha o Llama 4 Scout no recorte. Contexto de 1.310.720 tokens, multimodal (texto e imagem), pesos abertos, da Meta. Custa US$ 0,10 por milhão de entrada e US$ 0,30 por milhão de saída. Em geração de texto, é o mais barato do grupo.
Só que o índice de inteligência dele é 10,256 — o menor entre os modelos do recorte que têm nota. Para comparação, o Nova 2 Lite, da Amazon, marca 19,24 no mesmo índice e custa US$ 2,50 por milhão de saída. São 8 vezes mais caro na saída, mas com nota de inteligência quase duas vezes maior.
Traduzindo o marketing: "contexto longo e barato" virou commodity. Inteligência dentro daquele contexto, não.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
A Amazon dobrou a aposta em multimodal
Dos oito modelos do recorte, dois são da Amazon e ambos aceitam imagem junto com texto. O Nova 2 Lite, lançado em 2 de dezembro de 2025, é o mais barato dos dois (US$ 0,30 entrada / US$ 2,50 saída) e tem nota 19,24. O Nova Premier 1.0, de outubro de 2025, é o mais caro do recorte: US$ 12,50 por milhão de saída — quarenta vezes o preço do Scout. Em troca, oferece suporte a cache de prompt a US$ 0,625, o que faz diferença em workloads repetitivos.
Para quem processa vídeo, imagem e texto no mesmo pipeline, a Amazon é a única do recorte com essa combinação a preço baixo. Para quem só precisa de texto longo, o Premier não se justifica — você está pagando multimodalidade que não vai usar.
A Meta entrega o open weights mais barato, a um custo
Os dois Llama 4 do recorte são os únicos com pesos abertos. Maverick (1.048.576 de contexto, MoE com 17B ativos de 402B totais) sai por US$ 0,696 por milhão de saída. Scout é ainda mais barato. Em troca, nenhum dos dois tem raciocínio nativo — reasoning: false nos dois. Se o seu caso de uso exige cadeia de pensamento longa, você vai gastar mais tokens de saída tentando compensar.
Para quem quer self-host ou fine-tuning, o preço de API é quase irrelevante — o que importa é o tamanho do modelo ativo. 17B ativos é administrável em uma GPU de 80GB. 402B totais, nem tanto.
Tem modelo chinês no recorte, mas não no topo
O Qwen-Plus, da Alibaba, aparece com 1M de contexto e preço de US$ 0,26 entrada / US$ 0,78 saída — com cache a US$ 0,052, o mais barato do recorte. Só que não tem índice de inteligência publicado no catálogo. O mesmo vale para o TheDrummer UnslopNemo 12B, focado em roleplay, e para o MiniMax-01, que é o único modelo do recorte com 2 milhões de tokens de contexto (na verdade, são 1.000.192, mas o Auto Router da OpenRouter chega a 2M).
Sem nota de inteligência, a comparação justa é impossível. Você está comprando no escuro — o que pode valer a pena para workloads muito específicos, mas não para uma decisão de arquitetura.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso muda a conta, e para quem não muda nada
Se você já estava usando contexto de 128K e pagando caro por isso, migrar para Scout ou Qwen-Plus derruba o custo de API em uma ordem de grandeza — assumindo que a queda de inteligência não quebra seu produto. Se você está rodando agente que precisa raciocinar sobre documentos longos, o Nova 2 Lite é o melhor equilíbrio custo × inteligência do recorte, mesmo custando 8x mais que o Scout na saída.
Se você está satisfeito com 200K de contexto e não processa documentos inteiros, nada aqui te afeta. A janela de 1M é para quem engole livros, bases de código ou vídeos de uma vez — e isso ainda é minoria dos workloads em produção.
O que fazer hoje: rode seu caso de uso real no Scout e no Nova 2 Lite lado a lado. Se a diferença de qualidade não aparece no seu eval, a Scout economiza US$ 2,20 por milhão de tokens de saída. Em escala, isso é orçamento de um estagiário por mês.
Teste Llama 4 Scout e Nova 2 Lite no seu caso de uso real antes de renovar contrato: a diferença de 8x no preço de saída só se justifica se a inteligência do Scout não cobrir seu workload.
Perguntas frequentes
Qual o modelo mais barato com 1 milhão de tokens de contexto?
O Llama 4 Scout, da Meta, custa US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com 1.310.720 tokens de contexto e pesos abertos. É o mais barato do recorte, mas tem o menor índice de inteligência entre os modelos com nota publicada.
Contexto longo significa que o modelo é mais inteligente?
Não. Janela de contexto é a quantidade de texto que cabe na memória de uma vez; inteligência é uma medida separada de capacidade de raciocínio. No recorte, o Scout tem a maior janela e a menor nota de inteligência; o Nova 2 Lite tem janela parecida e nota quase duas vezes maior.
Vale a pena usar contexto de 1M de tokens?
Só se você realmente precisa processar documentos inteiros, bases de código grandes ou vídeos longos em uma única chamada. Para a maioria dos workloads em produção, 128K a 200K continuam suficientes, e os modelos do recorte de 1M não trazem ganho de qualidade fora desse nicho.