29 modelos vendem 1 milhão de tokens de contexto — e só 2 valem o preço
O catálogo de hoje tem 29 opções com janela longa, mas a conta muda quando você compara o que cabe no envelope e o que cabe no boleto.
29 dos 230 modelos listados hoje vendem, no papel, um milhão de tokens ou mais de contexto. É quase 13% do catálogo — uma prateleira inteira dedicada a quem precisa enfiar livros inteiros, codebases ou horas de transcrição num único prompt. Mas o tamanho da janela é só a primeira linha da fatura; a segunda é o que custa mandar tudo aquilo de volta.
A prateleira dos 1M+: quem está nela
O recorte junta nomes esperados e algumas surpresas. A Meta aparece em dobro, com Llama 4 Maverick (1.048.576 tokens, multimodal, pesos abertos, 402B de parâmetros totais com 17B ativos) e Llama 4 Scout (1.310.720 tokens, mesma arquitetura MoE). O Google responde com Gemini 2.0 Flash e Gemini 2.0 Flash Lite, ambos com 1.048.576 tokens e a vantagem de aceitar áudio, vídeo e arquivo de saída — não só texto. A Alibaba entra via Qwen-Plus (1M tokens, com cache de leitura a US$ 0,052 por milhão, detalhe que ninguém lembra de olhar). E ainda tem o Auto Router da OpenRouter, que promete 2 milhões de tokens mas é um roteador, não um modelo — você paga o que o modelo destino custar.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Auto Router | openrouter | — | -1000000 | 2M |
| UnslopNemo 12B | thedrummer | — | 0.4 | 1.02M |
| MiniMax-01 | minimax | — | 1.1 | 1M |
| Qwen-Plus | qwen | — | 0.78 | 1M |
| Gemini 2.0 Flash | — | 0.4 | 1.05M | |
| Gemini 2.0 Flash Lite | — | 0.3 | 1.05M |
O detalhe que ninguém conta: contexto grande não é grátis
Aqui é onde o marketing tropeça. Anunciar "1 milhão de tokens de contexto" virou commodity — a maioria dos modelos do recorte entrega esse número. O que diferencia a conta é a combinação de três variáveis: preço de entrada, preço de saída e cache. O Gemini 2.0 Flash Lite cobra US$ 0,075 por milhão de tokens de entrada e US$ 0,30 de saída. O Llama 4 Scout cobra US$ 0,10 e US$ 0,30. O Llama 4 Maverick sobe para US$ 0,20 e US$ 0,696. O MiniMax-01, com 1.000.192 tokens, cobra US$ 0,20 de entrada mas US$ 1,10 de saída — quase quatro vezes o Flash Lite pelo mesmo envelope.
E tem o custo escondido do cache. Quando você reutiliza o mesmo prompt gigante em várias chamadas, o Gemini 2.0 Flash cobra só US$ 0,025 por milhão de tokens re-lidos; o Qwen-Plus, US$ 0,052. É o equivalente a pagar meia entrada de cinema quando você mostra o mesmo ingresso pela segunda vez — quem processa logs, documentação ou bases de código em loop sente a diferença no fim do mês.
Onde o contexto longo muda a decisão
Para quem está montando RAG pesado, análise de contratos ou agentes que precisam ler repositórios inteiros, o recorte entrega opções reais: Gemini 2.0 Flash Lite pelo menor custo de entrada, Llama 4 Scout pelo melhor equilíbrio entre preço e capacidade multimodal, e Maverick quando você quer a versão mais forte da família Llama 4 dentro do mesmo envelope. O Qwen-Plus é o único do recorte com cache barato publicado — relevante se você repete contexto.
Para quem está fazendo role-play, escrita criativa ou tarefas que não exigem raciocínio pesado, o TheDrummer UnslopNemo 12B entra com 1.024.000 tokens a US$ 0,40 fixo por milhão — preço único de entrada e saída, sem surpresa na fatura. É o modelo mais previsível do recorte.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem esse recorte não muda nada
Se o seu prompt cabe em 128 mil tokens — e a maioria cabe — você está pagando por janela que não usa. O catálogo tem centenas de modelos com contexto menor e custo menor. O o3 da OpenAI, topo de inteligência hoje com IQ 31,096, não está neste recorte; gpt-oss-120b (IQ 24,126) também não. Contexto longo é ferramenta, não upgrade automático.
O que olhar antes de fechar o pedido
Três perguntas antes de escolher um modelo de 1M+ tokens:
- Você realmente precisa de 1M? Se a resposta for "talvez", comece com um modelo de 128K e meça a taxa de truncamento. Contexto longo sem necessidade é dinheiro queimado.
- Você reusa o contexto? Se sim, o preço de cache importa mais que o de entrada. Qwen-Plus e Gemini 2.0 Flash lideram aqui.
- Você gera muito texto de saída? Se sim, fuja do MiniMax-01 e do Maverick. A saída é onde a conta explode — US$ 1,10 por milhão no MiniMax-01 contra US$ 0,30 no Flash Lite é a diferença entre um piloto e um orçamento mensal.
A janela de 1 milhão de tokens deixou de ser diferencial e virou commodity. O diferencial agora está no preço por token que sai — e em quantas vezes você consegue reusar o que entrou.
Janela de 1M+ tokens é commodity em 2025; o que decide a compra é preço de saída e cache, não o tamanho do envelope.
Perguntas frequentes
Qual modelo de contexto longo tem o menor preço de entrada?
Entre os modelos do recorte com 1M+ tokens, o Gemini 2.0 Flash Lite cobra US$ 0,075 por milhão de tokens de entrada — o menor valor publicado. O Llama 4 Scout vem logo atrás, a US$ 0,10.
Contexto longo vale a pena para qualquer tarefa?
Não. Se seu prompt cabe em 128 mil tokens, pagar por 1 milhão é desperdício. Contexto longo só compensa quando você precisa processar documentos grandes, codebases inteiros ou históricos longos de conversa — e quando o cache de leitura está habilitado para reusar o mesmo contexto.
Por que o MiniMax-01 cobra quase 4x mais na saída que o Gemini 2.0 Flash Lite?
O MiniMax-01 cobra US$ 1,10 por milhão de tokens de saída contra US$ 0,30 do Gemini 2.0 Flash Lite, mesmo ambos oferecendo 1M+ tokens de contexto. A diferença está no modelo de cobrança de cada provedor — não há relação direta entre tamanho da janela e preço de saída, então comparar envelope por envelope sem olhar saída é comparar errado.