FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Baidu ERNIE 4.5 VL 28B A3B, 21 dias sem benchmark publicado

Modelo multimodal da Baidu cobra US$ 0,14 de entrada e US$ 0,56 de saída, mas o catálogo ainda não publicou índice de inteligência, coding ou agentic.

Redação FalaVIP IA 3 min de leitura
US$ 0,14por milhão de tokens de entrada
US$ 0,56por milhão de tokens de saída
28B / 3Bparâmetros totais / ativos por token

A conta antes da nota

Vinte e um dias após o lançamento, o catálogo segue sem índice de inteligência publicado para o ERNIE 4.5 VL 28B A3B. Isso não é necessariamente ruim — pode significar que a medição ainda não caiu, não que o modelo seja fraco. Mas te coloca numa posição chata: você está olhando para um multimodal da Baidu que custa US$ 0,14 por milhão de tokens de entrada e US$ 0,56 por milhão de tokens de saída, sem o número que normalmente orienta a escolha.

Ficha técnica — ERNIE 4.5 VL 28B A3B
CampoValor
Identificadorbaidu/ernie-4.5-vl-28b-a3b
Criadorbaidu
Preço de entradaUS$ 0.140 / M tokens
Preço de saídaUS$ 0.560 / M tokens
Janela de contexto131k
Modalidadetext+image->text

Onde ele entra no tabuleiro

O preço de entrada está entre os mais baixos do catálogo para multimodal: US$ 0,14 por milhão. O de saída, US$ 0,56, não é o mais barato — os modelos abertos da OpenAI, gpt-oss-120b e gpt-oss-20b, saem por US$ 0,17 e US$ 0,13, respectivamente. Mas esses dois são só texto. Quando você compara com pares multimodais que aparecem no topo do ranking de inteligência hoje, a história muda: Llama 4 Maverick custa US$ 0,696 de saída e Llama 4 Scout, US$ 0,30. O ERNIE 4.5 VL entra entre os dois, ainda com a vantagem de trazer 131 mil tokens de contexto — o mesmo tamanho dos Llama 4 e maior do que boa parte do meio do catálogo.

Só que preço sem nota de inteligência é só metade da história. Para comparar com o Llama 4 Maverick (IQ 14,477) ou com o Scout (IQ 10,256), falta a régua. E para piorar, o catálogo também não publicou índices de coding nem de agentic. Você está decidindo às cegas nesses eixos.

O MoE heterogêneo, em uma frase

A descrição fala em "heterogeneous MoE structure with modality-isolated routing". Traduzindo sem jargão: são 28 bilhões de parâmetros no total, mas só 3 bilhões "acordam" por token processado. Pense num hospital com 28 especialistas no quadro — para cada paciente, só 3 são acionados. Isso reduz custo de inferência sem precisar de um modelo pequeno. O detalhe que importa é o "modality-isolated routing": os especialistas que olham imagens não são os mesmos que processam texto. Visão não polui raciocínio textual, e vice-versa. É uma escolha de arquitetura pensando em multimodal de verdade, não em texto com imagem colada por cima.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 219 modelos disponíveis no catálogo nesta data.

Para quem faz sentido agora

Você toca produto multimodal e o orçamento da API pesa. Texto puro está descartado. Aí o ERNIE 4.5 VL começa a aparecer: contexto longo, preço de entrada baixo, multimodal nativo. Para fluxos onde o gargalo é processar muitas imagens com prompt curto, US$ 0,14 de entrada é competitivo. E o roteamento isolado por modalidade sugere que a parte de visão não degrada o raciocínio textual — ou ao menos foi desenhada para isso.

Para quem não muda nada

Se você já roda Llama 4 Scout ou Maverick, tem multimodal medido e cobertura conhecida, o argumento de trocar hoje é fraco — você estaria trocando benchmark conhecido por arquitetura nova sem nota. Se seu workload é só texto, os modelos abertos da OpenAI citados acima entregam mais barato. E se você precisa de raciocínio de ponta, o3 está lá em cima com IQ 31,096, embora a US$ 8 por milhão de saída — outra ordem de grandeza.

Um detalhe operacional: o catálogo não publicou preço de cache hit. Se sua operação depende de cache agressivo para economizar, esse é um dado que falta antes de colocar em produção.

O que falta para fechar a compra

O cenário muda quando o índice de inteligência do modelo entrar no catálogo. Aí dá para comparar com Maverick e Scout na mesma régua, e a decisão deixa de ser sobre preço e arquitetura para ser sobre capacidade medida. Com 27 modelos lançados nos últimos 30 dias e mais de 219 listados no total, a fila de medições anda. Mas "andando" não é "publicada".

O ERNIE 4.5 VL 28B A3B, hoje, é uma boa opção para quem precisa decidir multimodal antes da régua — desde que aceite medir por conta própria depois. Para todo o resto, o caminho mais seguro ainda é esperar o número do catálogo.

Em uma frase

Se você precisa decidir multimodal agora e aceita medir por conta própria, o preço e a arquitetura valem o teste; caso contrário, espere o IQ do catálogo para comparar de verdade com Llama 4 e os modelos abertos da OpenAI.

Perguntas frequentes

ERNIE 4.5 VL 28B A3B é gratuito?

Não. Custa US$ 0,14 por milhão de tokens de entrada e US$ 0,56 por milhão de tokens de saída, sem tier gratuito listado no catálogo.

Por que o modelo da Baidu não tem IQ publicado?

O catálogo mede inteligência continuamente, mas 21 dias após o lançamento ainda não soltou índice de inteligência, coding ou agentic para esse modelo. Pode entrar a qualquer momento.

Serve bem para tarefas de código?

Não dá para afirmar. O catálogo não publicou índice de coding para o ERNIE 4.5 VL 28B A3B, então qualquer afirmação de performance em código seria chute até a régua aparecer.

Leia também