Baidu ERNIE 4.5 VL 28B A3B, 21 dias sem benchmark publicado
Modelo multimodal da Baidu cobra US$ 0,14 de entrada e US$ 0,56 de saída, mas o catálogo ainda não publicou índice de inteligência, coding ou agentic.
A conta antes da nota
Vinte e um dias após o lançamento, o catálogo segue sem índice de inteligência publicado para o ERNIE 4.5 VL 28B A3B. Isso não é necessariamente ruim — pode significar que a medição ainda não caiu, não que o modelo seja fraco. Mas te coloca numa posição chata: você está olhando para um multimodal da Baidu que custa US$ 0,14 por milhão de tokens de entrada e US$ 0,56 por milhão de tokens de saída, sem o número que normalmente orienta a escolha.
| Campo | Valor |
|---|---|
| Identificador | baidu/ernie-4.5-vl-28b-a3b |
| Criador | baidu |
| Preço de entrada | US$ 0.140 / M tokens |
| Preço de saída | US$ 0.560 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image->text |
Onde ele entra no tabuleiro
O preço de entrada está entre os mais baixos do catálogo para multimodal: US$ 0,14 por milhão. O de saída, US$ 0,56, não é o mais barato — os modelos abertos da OpenAI, gpt-oss-120b e gpt-oss-20b, saem por US$ 0,17 e US$ 0,13, respectivamente. Mas esses dois são só texto. Quando você compara com pares multimodais que aparecem no topo do ranking de inteligência hoje, a história muda: Llama 4 Maverick custa US$ 0,696 de saída e Llama 4 Scout, US$ 0,30. O ERNIE 4.5 VL entra entre os dois, ainda com a vantagem de trazer 131 mil tokens de contexto — o mesmo tamanho dos Llama 4 e maior do que boa parte do meio do catálogo.
Só que preço sem nota de inteligência é só metade da história. Para comparar com o Llama 4 Maverick (IQ 14,477) ou com o Scout (IQ 10,256), falta a régua. E para piorar, o catálogo também não publicou índices de coding nem de agentic. Você está decidindo às cegas nesses eixos.
O MoE heterogêneo, em uma frase
A descrição fala em "heterogeneous MoE structure with modality-isolated routing". Traduzindo sem jargão: são 28 bilhões de parâmetros no total, mas só 3 bilhões "acordam" por token processado. Pense num hospital com 28 especialistas no quadro — para cada paciente, só 3 são acionados. Isso reduz custo de inferência sem precisar de um modelo pequeno. O detalhe que importa é o "modality-isolated routing": os especialistas que olham imagens não são os mesmos que processam texto. Visão não polui raciocínio textual, e vice-versa. É uma escolha de arquitetura pensando em multimodal de verdade, não em texto com imagem colada por cima.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
Para quem faz sentido agora
Você toca produto multimodal e o orçamento da API pesa. Texto puro está descartado. Aí o ERNIE 4.5 VL começa a aparecer: contexto longo, preço de entrada baixo, multimodal nativo. Para fluxos onde o gargalo é processar muitas imagens com prompt curto, US$ 0,14 de entrada é competitivo. E o roteamento isolado por modalidade sugere que a parte de visão não degrada o raciocínio textual — ou ao menos foi desenhada para isso.
Para quem não muda nada
Se você já roda Llama 4 Scout ou Maverick, tem multimodal medido e cobertura conhecida, o argumento de trocar hoje é fraco — você estaria trocando benchmark conhecido por arquitetura nova sem nota. Se seu workload é só texto, os modelos abertos da OpenAI citados acima entregam mais barato. E se você precisa de raciocínio de ponta, o3 está lá em cima com IQ 31,096, embora a US$ 8 por milhão de saída — outra ordem de grandeza.
Um detalhe operacional: o catálogo não publicou preço de cache hit. Se sua operação depende de cache agressivo para economizar, esse é um dado que falta antes de colocar em produção.
O que falta para fechar a compra
O cenário muda quando o índice de inteligência do modelo entrar no catálogo. Aí dá para comparar com Maverick e Scout na mesma régua, e a decisão deixa de ser sobre preço e arquitetura para ser sobre capacidade medida. Com 27 modelos lançados nos últimos 30 dias e mais de 219 listados no total, a fila de medições anda. Mas "andando" não é "publicada".
O ERNIE 4.5 VL 28B A3B, hoje, é uma boa opção para quem precisa decidir multimodal antes da régua — desde que aceite medir por conta própria depois. Para todo o resto, o caminho mais seguro ainda é esperar o número do catálogo.
Se você precisa decidir multimodal agora e aceita medir por conta própria, o preço e a arquitetura valem o teste; caso contrário, espere o IQ do catálogo para comparar de verdade com Llama 4 e os modelos abertos da OpenAI.
Perguntas frequentes
ERNIE 4.5 VL 28B A3B é gratuito?
Não. Custa US$ 0,14 por milhão de tokens de entrada e US$ 0,56 por milhão de tokens de saída, sem tier gratuito listado no catálogo.
Por que o modelo da Baidu não tem IQ publicado?
O catálogo mede inteligência continuamente, mas 21 dias após o lançamento ainda não soltou índice de inteligência, coding ou agentic para esse modelo. Pode entrar a qualquer momento.
Serve bem para tarefas de código?
Não dá para afirmar. O catálogo não publicou índice de coding para o ERNIE 4.5 VL 28B A3B, então qualquer afirmação de performance em código seria chute até a régua aparecer.