111 modelos leem imagem, vídeo e áudio — e o mais caro não é o melhor
No recorte multimodal do catálogo, o topo de inteligência custa o triplo da melhor razão custo/benefício. A escolha prática está em outro lugar.
O recorte que ninguém olha junto
Dos 270 modelos listados hoje, 111 aceitam algum tipo de entrada além de texto — imagem, vídeo, áudio, arquivo. É quase metade do catálogo. Mas quando alguém precisa escolher um multimodal, a conversa costuma girar em torno do "melhor" modelo, e raramente se pergunta: melhor pelo quê? Pelo índice de inteligência? Pelo preço? Pelo tamanho de contexto? O padrão que aparece quando se olha o recorte inteiro é que essas três variáveis não andam juntas.
O topo de inteligência não cabe no orçamento de todo mundo
O multimodal mais inteligente do catálogo hoje é o OpenAI o3, com IQ 31,096. O segundo é o Claude Haiku 4.5, com 29,892. A diferença de capacidade entre eles é pequena — pouco mais de um ponto de IQ. A diferença de preço, não: o3 cobra US$ 8 por milhão de tokens de saída, Haiku 4.5 cobra US$ 5. Em entrada, a diferença é maior: US$ 2 contra US$ 1. Para um pipeline que processa milhão de tokens por dia, isso é quase US$ 3 mil por mês só no delta de entrada.
E aí vem o detalhe que o release da Anthropic não grita: Haiku 4.5 é descrito como "near-frontier intelligence at a fraction of the cost". A fração é real, mas não é 1/10. É cerca de 60% do preço do o3, com 96% da inteligência medida. Cabe no bolso se você roda em escala. Não cabe se você está prototipando.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Nemotron Nano 12B 2 VL | nvidia | 8.8 | 0.6 | 131k |
| Llama 3.2 11B Vision Instruc | meta-llama | 3.0 | 0.345 | 131k |
| Auto Router | openrouter | — | -1000000 | 2M |
Onde o custo-benefício muda de verdade
Olha o Llama 4 Maverick: IQ 14,477, preço de saída US$ 0,696 por milhão. É menos da metade da inteligência do o3, mas custa menos de 9% do preço de saída. Em cenários onde a tarefa multimodal é classificar, extrair texto de imagem, ou descrever cenas — e não raciocinar sobre elas —, esse delta de IQ raramente aparece no produto final. O mesmo vale para o Llama 4 Scout, ainda mais barato: US$ 0,30 por milhão de saída, IQ 10,256, e com 1,3 milhão de tokens de contexto. Para resumir um vídeo longo ou processar um PDF gigante, é a melhor razão custo/benefício do recorte multimodal hoje.
E tem um terceiro eixo que quase ninguém menciona: pesos abertos. Maverick e Scout são open weights. Se você roda on-prem, o custo de inferência é o da sua GPU, não o do token. Para empresas com volume alto e dados sensíveis, o "preço" do catálogo vira só o ponto de partida.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O caso estranho da Amazon
O Amazon Nova Premier 1.0 é o multimodal mais caro do recorte: US$ 12,50 por milhão de saída, US$ 2,50 de entrada, com IQ 12,718. É mais caro que o o3 e tem menos de 41% da inteligência medida. A descrição diz que é "o mais capaz da família Nova para tarefas complexas" — e pode ser, dentro da família. Mas no recorte multimodal amplo, ele perde para modelos 11 vezes mais baratos em quase todos os eixos. Vale para quem já está dentro do ecossistema AWS e precisa de SLA ou compliance específico. Fora disso, é difícil justificar.
Para quem isso muda alguma coisa — e para quem não muda nada
Se você está rodando um agente multimodal em produção e a conta da API está incomodando, o caminho é testar Haiku 4.5 contra o3 na sua tarefa específica — não no benchmark genérico. A diferença de IQ é pequena, mas a diferença de custo é grande.
Se você está extraindo informação de imagem ou vídeo e não precisa de raciocínio pesado, Maverick ou Scout entregam 90% do valor por uma fração do preço. E se o volume justifica, on-prem com pesos abertos zera a variável token.
Se você já está preso a um provedor por contrato ou compliance, Nova Premier pode fazer sentido mesmo com o preço salgado — mas saiba que está pagando por algo que o catálogo geral mede como inferior.
Para quem está só experimentando e não mediu custo por tarefa, nada disso importa até você colocar no ar e ver a fatura.
Meça o custo por tarefa multimodal antes de escolher pelo topo do benchmark — Haiku 4.5 e os Llama 4 entregam a maior parte do valor por uma fração do preço do o3.
Perguntas frequentes
Qual o modelo multimodal mais barato com boa inteligência?
Hoje, o Llama 4 Maverick (US$ 0,696/M de saída) e o Llama 4 Scout (US$ 0,30/M) são os que melhor equilibram preço e capacidade no recorte multimodal. O Claude Haiku 4.5 lidera em inteligência por dólar entre os modelos fechados de fronteira.
Multimodal mais inteligente é sempre o mais caro?
Não. O multimodal mais caro do recorte é o Amazon Nova Premier (US$ 12,50/M de saída), com IQ 12,718 — abaixo do Claude Haiku 4.5, que custa US$ 5/M. Inteligência e preço não andam juntos no recorte multimodal atual.
Vale a pena rodar multimodal com pesos abertos?
Depende do volume. Llama 4 Maverick e Scout têm pesos abertos e preço de API baixo; em volume alto, rodar on-prem zera o custo por token, mas exige capital em GPU e equipe de MLOps. Para protótipos e volumes pequenos, a API sai mais barata.