Qwen3 Next cobra quase o mesmo e entrega quase o dobro de IQ
Comparativo entre dois modelos chineses open-weights mostra que a conta da API não revela quem pensa melhor — e quem nem entra na briga.
Você está olhando o preço de saída, vê US$ 1,20 por milhão de tokens do Qwen3 Next e US$ 1,10 do ERNIE 4.5, e pensa: são quase a mesma coisa. A conta está errada. Esses dois modelos chineses open-weights disputam a mesma prateleira, mas não disputam a mesma corrida.
O que cada um é, de verdade
O Qwen3 Next 80B A3B Thinking é um modelo de raciocínio: foi treinado para devolver aqueles blocos de “thinking” antes da resposta final, e a própria descrição oficial fala em “hard multi-step problems” — provas de matemática, síntese e debug de código, lógica, tarefas agentic. São 80 bilhões de parâmetros totais, mas só 3 bilhões ativos por token (MoE). Lançado em 11 de setembro de 2025, knowledge cutoff de 30 de setembro de 2025.
O ERNIE 4.5 300B A47B é outra arquitetura MoE, mas bem maior no papel: 300B totais, 47B ativos por token. Lançado em 30 de junho de 2025, knowledge cutoff de 31 de março de 2025. A descrição não menciona raciocínio nativo — é um chat de uso geral da Baidu, sem o “Thinking” no nome.
A diferença que aparece no índice
No índice de inteligência medido hoje, o Qwen3 Next marca 16,867 e o ERNIE 4.5 marca 8,867. Quase o dobro. Em coding, o Qwen3 Next tem 17,419; o ERNIE 4.5 não publicou nota nesse recorte. Em agentic, o Qwen3 Next marca 2,062 e o ERNIE 4.5 também não publicou. Para um comprador que olha benchmark, o segundo simplesmente não entra em algumas categorias — não porque perdeu, mas porque não jogou.
E o preço, que é o que paga a conta
Aqui está o detalhe que o headline de “45% mais barato” esconde. O Qwen3 Next cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O ERNIE 4.5 cobra US$ 0,28 de entrada e US$ 1,10 de saída. Na ponta do lápis, com um prompt típico de 1.000 tokens de entrada e 500 de saída, o Qwen3 Next custa cerca de US$ 0,75 por milhão de requisições desse tipo, contra US$ 0,83 do ERNIE 4.5 — diferença de 10%. Nada de 45%. O “barato” do Qwen3 Next está na entrada, não na saída.
Nenhum dos dois publicou preço de cache de leitura, então não dá pra comparar economia em prompt repetido.
| Critério | Qwen3 Next 80B A3B Thinking | ERNIE 4.5 300B A47B |
|---|---|---|
| Índice de inteligência | 16.9 | 8.9 |
| Entrada US$/M | 0.15 | 0.28 |
| Saída US$/M | 1.2 | 1.1 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | — |
| Índice de código | 17.4 | — |
| Índice agêntico | 2.1 | — |
Janela de contexto e velocidade
O Qwen3 Next oferece 262.144 tokens de contexto; o ERNIE 4.5, 131.072. Em tarefas com documentos longos — análise de contrato, codebase inteiro, transcrição de reunião — essa diferença muda a arquitetura do produto, não só o custo. Em velocidade, o Qwen3 Next tem 196,94 tokens por segundo publicados; o ERNIE 4.5 não publicou.
Para quem cada um ganha
Qwen3 Next 80B A3B Thinking ganha quando você precisa de raciocínio multi-passo, código não trivial, prova matemática, agente que planeja antes de agir, ou contexto acima de 128k. É o modelo chinês de raciocínio mais barato do catálogo hoje, e ainda assim fica atrás dos três do topo absoluto (o3, gpt-oss-120b, Llama 4 Maverick).
ERNIE 4.5 300B A47B ganha quando você precisa de um chat geral em chinês, quer a marca Baidu por algum motivo de compliance ou parceria, e o caso de uso não envolve raciocínio pesado nem benchmark público. Para o desenvolvedor brasileiro médio pagando API em dólar, é difícil justificar a escolha.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
O que você faz com isso amanhã
Se você está decidindo entre os dois para um produto novo, comece pelo Qwen3 Next e só olhe para o ERNIE 4.5 se o Qwen falhar em algum teste cego no seu domínio. Se já usa ERNIE 4.5, vale rodar um A/B de uma semana em prompts reais — a diferença de IQ sugere que a conta pode até subir um pouco e a qualidade subir muito mais.
Para raciocínio e código, Qwen3 Next; para chat geral em chinês sem exigência de benchmark, ERNIE 4.5 — e o segundo caso é raro no produto brasileiro.
Perguntas frequentes
Qwen3 Next 80B A3B Thinking é realmente mais barato que o ERNIE 4.5?
Depende do lado da conta. Na entrada, sim: US$ 0,15 contra US$ 0,28 por milhão de tokens. Na saída, o Qwen3 Next é US$ 1,20 contra US$ 1,10 do ERNIE 4.5 — ou seja, mais caro. O saving real está em prompts com muito texto de entrada e pouca resposta.
Só o Qwen3 Next 80B A3B Thinking. O “Thinking” no nome não é enfeite: o modelo devolve traces de raciocínio antes da resposta final e foi treinado para problemas multi-passo. O ERNIE 4.5 300B A47B é um chat geral sem essa camada.
Por que o ERNIE 4.5 não tem nota de coding nem agentic no catálogo?
Porque a Baidu não publicou esses números para esse modelo no recorte do índice. Não significa que ele não faz — significa que, na comparação direta de hoje, não dá para colocá-lo no gráfico ao lado do Qwen3 Next.