120 modelos leem imagem. O caro não é o melhor.
Quase metade dos 282 modelos do catálogo já é multimodal — e a diferença de preço entre o topo e o meio do pacote chega a 41 vezes.
O multimodal virou padrão, não upgrade
Em 29 de novembro de 2025, o catálogo tem 282 modelos. Destes, 120 aceitam imagem, áudio, vídeo ou arquivo como entrada. São 42,5% — quase um em cada dois. Se você paga API e ainda trata multimodal como recurso premium, está olhando para o mercado errado.
A pergunta já não é "este modelo aceita imagem?". A pergunta é "qual multimodal eu uso para esta tarefa?". E a resposta depende menos do modelo e mais do que você está tentando fazer.
O topo é caro, mas não é monopólio
Os dois modelos multimodais com maior IQ do recorte são OpenAI o3 (IQ 31,096) e Claude Haiku 4.5 (IQ 29,892). Custam US$ 8 e US$ 5 por milhão de tokens de saída, respectivamente. Diferença pequena de IQ, diferença razoável de preço.
O detalhe sujo: o Haiku 4.5 é da linha "leve" da Anthropic. O nome diz "Haiku" — historicamente, o modelo barato da família. E hoje ele está a menos de 4% de IQ do o3, que é o flagship da OpenAI. Isso não acontecia há um ano. Para tarefas que não exigem raciocínio de fronteira, o Haiku 4.5 já cobre o suficiente — e ainda tem cache de US$ 0,10 por milhão, o que muda a conta em workloads com prompt repetido.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Nemotron Nano 12B 2 VL | nvidia | 8.8 | 0.6 | 131k |
| Llama 3.2 11B Vision Instruc | meta-llama | 3.0 | 0.345 | 131k |
| Auto Router | openrouter | — | -1000000 | 2M |
O meio do pacote é onde mora a conta
Se a tarefa não precisa de raciocínio de fronteira, o custo despenca. O Llama 4 Scout, da Meta, é multimodal (aceita texto e imagem), tem IQ 10,256 e custa US$ 0,30 por milhão de tokens de saída. É 26 vezes mais barato que o o3 para entregar um terço da inteligência.
Para extrair dados de nota fiscal, classificar imagem de produto ou descrever screenshot, essa conta fecha melhor. Você paga 26x menos e entrega 3x menos IQ. Em produção, com prompt bem-feito, isso costuma ser o suficiente. O Maverick, da mesma família, vai um pouco além em IQ (14,477) por US$ 0,696 — ainda uma fração do preço do topo.
E tem modelo que é mau negócio em qualquer cenário
O Amazon Nova Premier 1.0 é o caso. Multimodal, contexto de 1 milhão de tokens, mas IQ 12,718 e preço de US$ 12,50 por milhão de tokens de saída. É o multimodal mais caro do recorte e tem IQ menor que o Llama 4 Maverick, que custa US$ 0,696.
Pense nele como um restaurante caro que serve prato parecido com o do shopping. Você pode até gostar do ambiente, mas a conta não fecha. Não há cenário em que pagar 41 vezes mais por um modelo com IQ menor faça sentido olhando só número.
Para quem isso muda o jogo
Se você roda multimodal em produção, vale testar o Haiku 4.5 antes de assumir que precisa do o3. Para tarefas de extração e classificação, Scout e Maverick entregam o suficiente por uma fração do custo. E se você está começando um projeto novo, ignore o Nova Premier — não há cenário em que ele seja a escolha certa olhando só número.
Se você já está no o3 e o resultado está bom, não mexa. A diferença de IQ não vai se traduzir em ganho visível para o usuário final na maioria dos produtos.
O tabuleiro em uma data
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| INTELLECT-3 | 15.7 | 1.1 |
O catálogo ganhou 14 modelos novos nos últimos 30 dias. A maior parte é multimodal. Olhando para o que já está no catálogo, a direção prática é simples: rotear por complexidade. Usar o topo só quando a tarefa exige, e o meio do pacote para o resto. É assim que a conta fecha em 29 de novembro de 2025.
Se você roda multimodal em produção, teste o Haiku 4.5 antes de pagar o3; para tarefas de extração e classificação, Scout e Maverick cortam a conta sem perder o que importa.
Perguntas frequentes
Qual o modelo multimodal mais barato do catálogo?
Entre os modelos multimodais listados, o Llama 4 Scout, da Meta, custa US$ 0,30 por milhão de tokens de saída. Aceita texto e imagem, tem contexto de 1,3 milhão de tokens e IQ 10,256.
Multimodal vale a pena ou é hype?
Depende da tarefa. Para extração de dados, classificação de imagem e descrição de documentos, modelos baratos como Llama 4 Scout e Maverick já entregam o suficiente. Para raciocínio visual complexo, o topo (o3, Haiku 4.5) ainda justifica o preço.
Por que o Amazon Nova Premier é caro e tem IQ baixo?
O Premier custa US$ 12,50 por milhão de tokens de saída — o multimodal mais caro do recorte — mas tem IQ 12,718, abaixo do Llama 4 Maverick (14,477), que custa US$ 0,696. Para a maioria dos casos de uso, não há razão para escolher o Premier.