Janela de 1 milhão de tokens custa o mesmo que um café — se você não se importar com a inteligência
38 modelos no catálogo prometem contextos gigantes. Alguns cobram barato. Nenhum dos dois entrega o pacote completo.
O número que aparece no release e o número que aparece na fatura
Quando um fornecedor anuncia "contexto de 1 milhão de tokens", o que você está comprando, na prática? A resposta curta: a capacidade de enfiar um livro inteiro, uma temporada inteira de código ou um ano de transcrições numa única chamada. A resposta longa, que só aparece quando você abre a fatura da API, é outra.
Dos 315 modelos listados no catálogo hoje, 38 oferecem janelas de 1 milhão de tokens ou mais. É um recorte respeitável — quase 12% do catálogo. Mas quando você cruza esse recorte com a métrica de inteligência medida hoje, o cenário fica desconcertante: nenhum dos modelos com contexto de 1M+ aparece no topo da lista de IQ. O primeiro do ranking geral é o Xiaomi MiMo-V2-Flash, com IQ 34,024, e ele não está neste recorte. O segundo é o OpenAI o3 (31,096). Também não está.
O que cabe no campo, e o que sobra
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
A leitura honesta da tabela é esta: você está escolhendo entre modelos que aceitam volumes absurdos de entrada e modelos que pensam bem. Raramente os dois ao mesmo tempo.
O caso mais didático é o Meta Llama 4 Scout. Janela de 1.310.720 tokens — a maior entre os modelos com dados completos —, preço de saída de US$ 0,30 por milhão de tokens, pesos abertos. Parece um sonho. Só que o IQ medido fica em 10,256, e o índice de codificação em 8,168. É um modelo que engole qualquer coisa e devolve uma resposta medíocre. Pior: não é modelo de raciocínio, então não há esperança de que "pensando mais" ele se aproxime dos líderes.
O oposto simétrico é o Amazon Nova Premier 1.0. Mesma janela de 1M, multimodal, mas a conta é outra: US$ 12,50 por milhão de tokens de saída, com cache a US$ 0,625. É o modelo mais caro do recorte — e mesmo assim o IQ medido é 12,718. Você paga caro e continua longe do topo.
O canto do meio: barato e medíocre
No gráfico de inteligência × preço, o padrão é nítido. Os pontos se espalham numa faixa horizontal baixa: muita opção, inteligência apertada. O Llama 4 Maverick (IQ 14,477, US$ 0,696 de saída) e o Nova 2 Lite (IQ 19,24, US$ 2,50 de saída) são os mais equilibrados do recorte — mas "equilibrado" aqui é um eufemismo para "não é o pior dos dois mundos".
Compare com o topo absoluto do catálogo hoje:
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O MiMo-V2-Flash cobra US$ 0,30 por milhão de tokens de saída — o mesmo preço do Scout, com contexto que não está divulgado nesta listagem. O Claude Haiku 4.5, da Anthropic, cobra US$ 5 e entrega IQ 29,892. Ou seja: para a mesma tarefa de raciocínio, você paga mais e fica mais inteligente. O Scout só ganha se o seu gargalo for literalmente o tamanho do input.
Para quem isso vale — e para quem não muda nada
Vale para quem precisa processar documentos inteiros, bases de código longas ou vídeos longos em uma só passada. Nessas cargas, o tamanho da janela é o que destrava o caso de uso, não a inteligência bruta. Se você está indexando um repositório, resumindo 500 páginas ou fazendo RAG sobre um corpus grande, o Scout e o Maverick são candidatos sérios — especialmente porque são pesos abertos, e o preço de inferência própria pode ser menor ainda.
Não muda nada para quem está construindo agente, ferramenta de codificação ou qualquer fluxo onde a qualidade da resposta importa mais que o volume do prompt. Para esses, o caminho continua sendo: contexto padrão (32K, 128K) e modelo de raciocínio forte. A janela de 1M é um recurso de nicho, não um upgrade universal.
A conta, no fim do mês
Se você está pagando a API, a pergunta certa não é "qual modelo tem a maior janela", mas "quanto do meu tráfego realmente precisa de 1M de tokens". Para a maioria dos workloads, a resposta é: pouco. E para esse pouco, Scout e Maverick entregam o suficiente por centavos. Para o resto, o Haiku 4.5 e o o3 continuam sendo o caminho — mesmo cobrando 17× e 27× mais por token de saída que o Scout.
Antes de escolher pelo tamanho da janela, meça quanto do seu tráfego realmente passa de 200K tokens — em geral, pagar por um modelo de raciocínio forte no contexto padrão sai mais barato e mais inteligente.
Perguntas frequentes
Qual modelo tem a maior janela de contexto hoje?
Entre os modelos com dados completos no recorte, o Meta Llama 4 Scout lidera com 1.310.720 tokens. O Auto Router, do OpenRouter, declara 2 milhões, mas é um roteador, não um modelo — ele distribui a chamada entre vários.
Contexto longo significa modelo mais inteligente?
Não. No recorte de 1M+ tokens do catálogo, nenhum modelo aparece entre os cinco maiores IQs medidos hoje. Janela grande é sobre volume de entrada; inteligência é sobre qualidade da saída.
Vale a pena pagar mais caro por contexto de 1M?
Só se o seu caso de uso realmente exigir processar documentos inteiros, bases de código longas ou vídeos completos numa única chamada. Para a maioria das aplicações, contexto padrão (32K–128K) com modelo de raciocínio forte entrega mais por menos.