FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Baidu lança ERNIE 4.5 21B Thinking a US$ 0,28 por milhão de saída

Modelo leve de raciocínio da chinesa chega ao catálogo com preço entre os menores do segmento, mas sem nota de inteligência publicada.

Redação FalaVIP IA 3 min de leitura
US$ 0,28por milhão de tokens de saída
US$ 0,07por milhão de tokens de entrada
131.072tokens de contexto

O que muda quando o barato é chinês e de raciocínio

Você já deve ter visto a conta de API estourar porque alguém rodou um modelo "top" para uma tarefa que um modelo médio resolvia. O lançamento de hoje da Baidu mira exatamente esse tipo de decisão: o ERNIE 4.5 21B A3B Thinking chega ao catálogo cobrando US$ 0,28 por milhão de tokens de saída e US$ 0,07 por milhão de entrada. É a faixa dos modelos pequenos, mas com a etiqueta "Thinking" colada no nome — ou seja, vendido como ferramenta de raciocínio, não como chatbot genérico.

A conta fica interessante quando você compara. O o3 da OpenAI, que lidera o índice de inteligência hoje, sai por US$ 8 por milhão de tokens de saída — quase 29 vezes mais caro. O gpt-oss-120b, também da OpenAI, fica em US$ 0,17 e é a referência de "custo baixo" entre os modelos de raciocínio. O Qwen3 Next 80B A3B Thinking, da Alibaba, cobra US$ 1,20 pelo mesmo trabalho. O ERNIE entra abaixo do Qwen e acima do gpt-oss-120b, mas com um detalhe que muda o cálculo: é 21B de parâmetros totais, com uma fração ativa por inferência (o "A3B" no nome indica isso), o que costuma significar servidor mais barato para o provedor e, em tese, mais margem para o preço cair.

Preço de saída (US$ por milhão de tokens)
ERNIE 4.5 21B A3B Thinking0,28o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

O que a Baidu está vendendo, em português claro

O release descreve o modelo como uma versão "refinada" do ERNIE 4.5, ajustada para profundidade de raciocínio em lógica, matemática, ciência, código, geração de texto e benchmarks acadêmicos de nível especialista. Traduzindo: a empresa posiciona o 21B como um modelo pequeno que aguenta tarefas que antes pediam um modelo grande. É a mesma aposta que a OpenAI fez com o gpt-oss-120b e que a Alibaba fez com o Qwen3 Next 80B A3B Thinking — colocar um MoE enxuto no lugar de um denso pesado.

O contexto é de 131.072 tokens, o padrão da casa para modelos de raciocínio atuais. O corte de conhecimento é março de 2025, então não espere nada sobre os últimos seis meses sem RAG por cima.

Ficha técnica — ERNIE 4.5 21B A3B Thinking
CampoValor
Identificadorbaidu/ernie-4.5-21b-a3b-thinking
Criadorbaidu
Preço de entradaUS$ 0.070 / M tokens
Preço de saídaUS$ 0.280 / M tokens
Janela de contexto131k
Modalidadetext->text

O ponto-cego: não tem nota de inteligência

Aqui vem o porém. O índice de inteligência da Artificial Analysis para o ERNIE 4.5 21B A3B Thinking não foi publicado no catálogo — o campo veio vazio. Isso significa que, na hora de comparar com o3 (31,096), gpt-oss-120b (24,126) ou Qwen3 Next 80B A3B Thinking (16,867), você está comprando no escuro. Sem nota, a única métrica visível é o preço. Para quem decide modelo olhando planilha, isso é um sinal amarelo, não vermelho: dá para testar, mas não dá para colocar em produção crítica sem benchmark próprio.

Inteligência × preço de saída
o3gpt-oss-120bQwen3 Next 80B A3B ThinkingUS$ por milhão (saída, escala log)índice de inteligência

Para quem vale e para quem não muda nada

Vale para você se: roda muito modelo de raciocínio em tarefas que não precisam do estado da arte absoluto — classificação, extração, agentes internos, código de baixa complexidade — e quer pagar perto do que pagaria por um modelo não-thinking. Vale especialmente se você já testou o gpt-oss-120b e quer uma segunda opção na mesma faixa de preço com perfil chinês.

Não muda nada se: você precisa de nota de benchmark antes de aprovar modelo em produção, ou se o seu gargalo é o modelo topo de linha tipo o3. Para essas cargas, o o3 continua sendo o3, e o ERNIE 21B entra no máximo como filtro de pré-triagem — roda nele o que for simples, joga para o o3 o que for difícil.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
ERNIE 4.5 21B A3B Thinking (o novo)0.070.28131k
o331.128200k
gpt-oss-120b24.10.0370.17131k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O tabuleiro hoje

O catálogo tem 250 modelos listados, vindos de 40 criadores, com 26 lançamentos nos últimos 30 dias. O topo do índice continua sendo o o3 da OpenAI, seguido do gpt-oss-120b e do Qwen3 Next 80B A3B Thinking — exatamente os três rivais diretos do ERNIE 4.5 21B A3B Thinking em proposta. A Baidu entra para disputar o segmento que mais cresce: raciocínio barato.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 250 modelos disponíveis no catálogo nesta data.

O que você faz com isso: se você tem um workload de raciocínio que hoje roda no Qwen3 Next 80B A3B Thinking ou no o3, vale rodar o ERNIE 4.5 21B A3B Thinking em paralelo por uma semana, medir qualidade no seu caso específico e ver se a conta cai sem a qualidade cair junto. Se você está no gpt-oss-120b, a diferença de preço é pequena — teste só se a geografia ou a latência da Baidu ajudar.

Em uma frase

Rode o ERNIE 4.5 21B A3B Thinking em paralelo ao seu modelo de raciocínio atual por uma semana, meça qualidade no seu caso e veja se a conta cai sem perder o que importa.

Perguntas frequentes

Quanto custa o ERNIE 4.5 21B A3B Thinking?

US$ 0,07 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída. O catálogo não publicou preço de cache.

O ERNIE 4.5 21B A3B Thinking tem nota de inteligência?

Não. O índice da Artificial Analysis não foi publicado para esse modelo no catálogo, então não dá para comparar diretamente com o3 (31,096) ou gpt-oss-120b (24,126).

Para que tipo de tarefa o ERNIE 4.5 21B A3B Thinking serve?

A Baidu posiciona como modelo leve de raciocínio para lógica, matemática, ciência, código e benchmarks acadêmicos — basicamente o mesmo nicho do gpt-oss-120b e do Qwen3 Next 80B A3B Thinking.

Leia também