Janela de 1 milhão de tokens já tem 41 modelos — e o mais barato não é o melhor
O catálogo de modelos com contexto longo cresceu, mas pagar mais ainda não garante que o modelo pense melhor: o topo de inteligência do recorte está em outro lugar.
A janela ficou grande — o catálogo também
São 41 modelos com mais de 1 milhão de tokens de contexto num catálogo que, nesta terça-feira, lista 331 opções distribuídas entre 52 criadores. Em outras palavras, mais de um em cada oito modelos disponíveis hoje aceita um livro inteiro — ou uma codebase gorda — numa única chamada. A janela de contexto virou commodity mais rápido do que muita gente esperava.
Mas o número bruto esconde o que importa para quem paga a conta: janela grande não é sinônimo de modelo bom, e quase nunca é sinônimo de modelo barato.
O topo do recorte não é o topo do mercado
Olha o ranking de inteligência do recorte de contexto longo e aparece uma inversão curiosa. O Llama 4 Maverick, da Meta, lidera o grupo com IQ 14,477 — à frente do Nova Premier, da Amazon, que marca 12,718, e do Llama 4 Scout, com 10,256. Compare com o topo geral do catálogo no mesmo recorte: o Xiaomi MiMo-V2-Flash aparece com IQ 34,024 e o OpenAI o3 com 31,096. Ou seja, nenhum dos modelos com janela de 1M+ entra no top 5 de inteligência do dia.
A leitura prática é direta: se você precisa processar um PDF de 800 páginas, está trocando qualidade de raciocínio por capacidade de leitura. É uma troca legítima, mas é uma troca — e ninguém te conta isso no release.
Preço: a diferença entre Scout e Premier é de 40 vezes
Aqui o recorte mostra a maior volatilidade do catálogo. O Llama 4 Scout cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. O Nova Premier, da Amazon, cobra US$ 2,50 de entrada e US$ 12,50 de saída. São 25 vezes mais na entrada e 41 vezes mais na saída para um modelo que, pelo índice atual, pensa pior que o Scout em quase 5 pontos de IQ.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
O Nova 2 Lite entra como opção intermediária: US$ 0,30 de entrada e US$ 2,50 de saída, com IQ 19,24 — o mais alto do recorte, mas ainda distante do topo geral. O Qwen-Plus, da chinesa Alibaba, cobra US$ 0,26 de entrada, US$ 0,78 de saída e US$ 0,052 com cache habilitado, sem índice de inteligência publicado no catálogo.
Para quem cada modelo vale — e para quem não muda nada
Vale para você que trabalha com documentos grandes: Llama 4 Scout e Nova 2 Lite são as escolhas de custo-benefício honestas. Scout tem pesos abertos e 109B de parâmetros totais com 17B ativos; Nova 2 Lite é proprietário da Amazon e tem o melhor IQ do recorte.
Vale para você que precisa de raciocínio forte dentro do contexto longo: o Llama 4 Maverick entrega o melhor IQ do recorte (14,477) por US$ 0,696 de saída — ainda 2,3 vezes mais caro que o Scout na saída, mas com ganho mensurável de raciocínio.
Não muda nada para quem: usa contextos abaixo de 200 mil tokens (a maioria dos casos), prefere os modelos top de mercado mesmo pagando mais por chamada, ou precisa de benchmark de coding/agentic — o recorte de contexto longo tem cobertura fraca nesses eixos, com vários campos nulos.
O detalhe que ninguém destaca
O Nova Premier é descrito pela própria Amazon como "o mais capaz" da família e como "o melhor professor para destilar modelos customizados". É uma peça de infraestrutura para empresas que treinam modelos próprios, não para quem está chamando a API para resumir um contrato. O preço de US$ 12,50 por milhão de saída deixa isso explícito — é um produto B2B com outro público.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Coder Next | 21.3 | 0.8 |
No fim das contas, o recorte de contexto longo em fevereiro de 2026 confirma uma regra que já apareceu em outras pautas: a especificação que vira headline do lançamento raramente é a especificação que decide a compra. O Scout é barato, aberto e suficiente. O Premier é caro, fechado e voltado para destilação. O resto do recorte é variação de preço em torno dessas duas pontas.
Se você só precisa de contexto longo, escolha pelo IQ do recorte (Nova 2 Lite ou Llama 4 Maverick) — pagar caro no Premier compra infraestrutura de destilação, não raciocínio melhor.
Perguntas frequentes
Qual modelo com 1 milhão de tokens tem o melhor custo-benefício hoje?
Pelo índice de inteligência e preço do catálogo, o Nova 2 Lite lidera em IQ (19,24) e o Llama 4 Scout lidera em preço baixo (US$ 0,30 por milhão de saída). Para raciocínio dentro do recorte, o Llama 4 Maverick tem o melhor IQ entre os modelos com dados completos (14,477).
Por que o Nova Premier é tão caro se o IQ é menor que o do Scout?
O Premier é posicionado pela Amazon como modelo "professor" para destilação de modelos customizados — uso B2B de infraestrutura, não chamada de API comum. O preço reflete esse nicho, não qualidade de raciocínio bruta.
Modelos com contexto longo são piores que os modelos top de mercado?
Sim, pelo índice atual: o melhor do recorte (Nova 2 Lite, IQ 19,24) fica bem abaixo do topo geral (MiMo-V2-Flash, IQ 34,024). Janela grande é uma capacidade adicional, não um substituto para inteligência de modelo.