Três modelos novos saíram por menos de US$ 1 por milhão
Nenhum dos lançamentos brigou pelo topo de inteligência — todos apostaram em preço e nicho
Nenhum reajuste de preço entre 15 e 21 de setembro — e três modelos novos no catálogo. Você pode respirar em relação à fatura, mas o mercado não parou. A diferença é onde a ação aconteceu: ninguém brigou pelo topo de inteligência esta semana. A briga foi por preço e nicho.
| Data | Modelo | Criador | Inteligência | Saída US$/M |
|---|---|---|---|---|
| 2025-09-17 | Qwen3 Coder Flash | qwen | — | 0.975 |
| 2025-09-18 | Tongyi DeepResearch 30B A3B | alibaba | — | 0.45 |
| 2025-09-19 | Grok 4 Fast | x-ai | — | 0.5 |
Os três da semana
Quarta, dia 17, abriu a fila com o Qwen3 Coder Flash. O nome já diz: variante "flash" da família Qwen3, focada em geração de código. Sai a US$ 0,975 por milhão de tokens de saída. Não é o mais barato da semana, mas entra como mais uma opção na prateleira de quem roda fluxos de coding e quer fugir do Claude Sonnet ou do GPT-4o sem amarrar a stack à OpenAI.
Na quinta, dia 18, foi a vez do Tongyi DeepResearch 30B A3B, da Alibaba. É um modelo especializado em pesquisa aprofundada — o tipo de tarefa em que o agente precisa navegar, ler e sintetizar dezenas de fontes antes de devolver uma resposta. O "30B A3B" no nome indica arquitetura MoE: 30 bilhões de parâmetros totais, com cerca de 3 bilhões ativos por token. Sai a US$ 0,45 por milhão de tokens de saída, o mais barato dos três.
Sexta, dia 19, a xAI entrou com o Grok 4 Fast. É a versão "rápida" do Grok 4, a US$ 0,50 por milhão de tokens de saída. A xAI está claramente posicionando a família em dois andares: o Grok 4 tradicional para quem quer mais fôlego, e o Fast para quem prioriza throughput e quer pagar menos por token.
Onde eles se encaixam no tabuleiro
Os três chegam num catálogo de 230 modelos ativos, produzidos por 39 criadores, com 15 lançamentos nos últimos 30 dias. Nenhum dos novos tem índice de inteligência publicado ainda — então não dá para comparar diretamente com o topo do ranking. O que sabemos hoje é preço e posicionamento.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para efeito de régua, o OpenAI o3 segue na primeira posição com IQ 31,096, cobrando US$ 8 por milhão de tokens de saída. Isso é quase 18 vezes mais caro que o Tongyi e 16 vezes mais que o Grok 4 Fast. A pergunta que fica não é "qual é o melhor" — é "vale pagar 16 vezes mais por uma resposta um pouco mais inteligente, ou 1/16 do preço resolve o seu caso?".
Para quem muda e para quem não muda
Se você roda agentes de coding em volume, pipelines de pesquisa que varrem a web, ou qualquer fluxo que queima muitos tokens por dia — esta semana foi boa. Três opções novas, todas abaixo de US$ 1 por milhão de tokens de saída, todas com posicionamento de especialização. Faz sentido rodar um piloto com cada uma antes do próximo ciclo de produção.
Se o seu uso é mais pontual, com prompts curtos, latência baixa e respostas que precisam ser as mais afiadas possíveis — os novos não substituem o o3 nem o gpt-oss-120b, que ocupa a segunda posição do ranking com IQ 24,126. Provavelmente nem estão competindo com o seu caso.
O silêncio dos preços
Talvez o dado mais importante da semana seja o que não aconteceu: zero mudança de preço nos modelos já listados. Num mercado que costuma ajustar a cada duas semanas, uma semana inteira sem corte nem aumento é quase um evento. Ou os proveedores estão esperando o próximo round de comparações internas, ou os lançamentos novos já estão fazendo o trabalho de puxar a média para baixo sem precisar mexer nos cardápios antigos. Fica o convite para acompanhar o próximo fecho.
Antes de renovar contrato com o modelo que você paga caro hoje, rode os três novos em modo piloto: estão entre US$ 0,45 e US$ 0,975 por milhão de tokens de saída e podem cobrir boa parte do que você está pagando tarifa de topo sem precisar.
Perguntas frequentes
Qual foi o modelo mais barato lançado na semana?
O Tongyi DeepResearch 30B A3B, da Alibaba, lançado em 18 de setembro por US$ 0,45 por milhão de tokens de saída. É um modelo MoE focado em tarefas de pesquisa aprofundada.
O Grok 4 Fast substitui o Grok 4?
Não necessariamente. O Fast é a variante de baixo custo da xAI para alto volume de tokens, saindo a US$ 0,50 por milhão de saída. O Grok 4 tradicional segue como opção para casos que pedem mais capacidade de raciocínio.
Os novos modelos brigam com o o3 pelo topo?
Sem índice de inteligência publicado, não dá para comparar diretamente. O o3 segue no topo com IQ 31,096 a US$ 8 por milhão de tokens de saída — quase 18 vezes o preço do Tongyi. Os novos apostam em especialização e custo, não em capacidade bruta.