FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

120 modelos leem imagem. O caro não é o melhor.

Quase metade dos 282 modelos do catálogo já é multimodal — e a diferença de preço entre o topo e o meio do pacote chega a 41 vezes.

Redação FalaVIP IA 3 min de leitura
120 de 282modelos do catálogo são multimodais
US$ 0,30por milhão de tokens de saída no Llama 4 Scout
US$ 12,50por milhão de tokens de saída no Nova Premier (41x mais caro)

O multimodal virou padrão, não upgrade

Em 29 de novembro de 2025, o catálogo tem 282 modelos. Destes, 120 aceitam imagem, áudio, vídeo ou arquivo como entrada. São 42,5% — quase um em cada dois. Se você paga API e ainda trata multimodal como recurso premium, está olhando para o mercado errado.

A pergunta já não é "este modelo aceita imagem?". A pergunta é "qual multimodal eu uso para esta tarefa?". E a resposta depende menos do modelo e mais do que você está tentando fazer.

Inteligência × preço no recorte
o3Claude Haiku 4.5Llama 4 MaverickNova Premier 1.0Llama 4 ScoutNemotron Nano 12B 2 VLLlama 3.2 11B Vision InstrucUS$ por milhão (saída, escala log)índice de inteligência

O topo é caro, mas não é monopólio

Os dois modelos multimodais com maior IQ do recorte são OpenAI o3 (IQ 31,096) e Claude Haiku 4.5 (IQ 29,892). Custam US$ 8 e US$ 5 por milhão de tokens de saída, respectivamente. Diferença pequena de IQ, diferença razoável de preço.

O detalhe sujo: o Haiku 4.5 é da linha "leve" da Anthropic. O nome diz "Haiku" — historicamente, o modelo barato da família. E hoje ele está a menos de 4% de IQ do o3, que é o flagship da OpenAI. Isso não acontecia há um ano. Para tarefas que não exigem raciocínio de fronteira, o Haiku 4.5 já cobre o suficiente — e ainda tem cache de US$ 0,10 por milhão, o que muda a conta em workloads com prompt repetido.

Destaques do recorte: entrada multimodal
ModeloCriadorInteligênciaSaída US$/MContexto
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
Llama 4 Maverickmeta-llama14.50.6961.05M
Nova Premier 1.0amazon12.712.51M
Llama 4 Scoutmeta-llama10.30.31.31M
Nemotron Nano 12B 2 VLnvidia8.80.6131k
Llama 3.2 11B Vision Instrucmeta-llama3.00.345131k
Auto Routeropenrouter-10000002M

O meio do pacote é onde mora a conta

Se a tarefa não precisa de raciocínio de fronteira, o custo despenca. O Llama 4 Scout, da Meta, é multimodal (aceita texto e imagem), tem IQ 10,256 e custa US$ 0,30 por milhão de tokens de saída. É 26 vezes mais barato que o o3 para entregar um terço da inteligência.

Para extrair dados de nota fiscal, classificar imagem de produto ou descrever screenshot, essa conta fecha melhor. Você paga 26x menos e entrega 3x menos IQ. Em produção, com prompt bem-feito, isso costuma ser o suficiente. O Maverick, da mesma família, vai um pouco além em IQ (14,477) por US$ 0,696 — ainda uma fração do preço do topo.

E tem modelo que é mau negócio em qualquer cenário

O Amazon Nova Premier 1.0 é o caso. Multimodal, contexto de 1 milhão de tokens, mas IQ 12,718 e preço de US$ 12,50 por milhão de tokens de saída. É o multimodal mais caro do recorte e tem IQ menor que o Llama 4 Maverick, que custa US$ 0,696.

Pense nele como um restaurante caro que serve prato parecido com o do shopping. Você pode até gostar do ambiente, mas a conta não fecha. Não há cenário em que pagar 41 vezes mais por um modelo com IQ menor faça sentido olhando só número.

Para quem isso muda o jogo

Se você roda multimodal em produção, vale testar o Haiku 4.5 antes de assumir que precisa do o3. Para tarefas de extração e classificação, Scout e Maverick entregam o suficiente por uma fração do custo. E se você está começando um projeto novo, ignore o Nova Premier — não há cenário em que ele seja a escolha certa olhando só número.

Se você já está no o3 e o resultado está bom, não mexa. A diferença de IQ não vai se traduzir em ganho visível para o usuário final na maioria dos produtos.

O tabuleiro em uma data

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
INTELLECT-315.71.1
Entre os 282 modelos disponíveis no catálogo nesta data.

O catálogo ganhou 14 modelos novos nos últimos 30 dias. A maior parte é multimodal. Olhando para o que já está no catálogo, a direção prática é simples: rotear por complexidade. Usar o topo só quando a tarefa exige, e o meio do pacote para o resto. É assim que a conta fecha em 29 de novembro de 2025.

Em uma frase

Se você roda multimodal em produção, teste o Haiku 4.5 antes de pagar o3; para tarefas de extração e classificação, Scout e Maverick cortam a conta sem perder o que importa.

Perguntas frequentes

Qual o modelo multimodal mais barato do catálogo?

Entre os modelos multimodais listados, o Llama 4 Scout, da Meta, custa US$ 0,30 por milhão de tokens de saída. Aceita texto e imagem, tem contexto de 1,3 milhão de tokens e IQ 10,256.

Multimodal vale a pena ou é hype?

Depende da tarefa. Para extração de dados, classificação de imagem e descrição de documentos, modelos baratos como Llama 4 Scout e Maverick já entregam o suficiente. Para raciocínio visual complexo, o topo (o3, Haiku 4.5) ainda justifica o preço.

Por que o Amazon Nova Premier é caro e tem IQ baixo?

O Premier custa US$ 12,50 por milhão de tokens de saída — o multimodal mais caro do recorte — mas tem IQ 12,718, abaixo do Llama 4 Maverick (14,477), que custa US$ 0,696. Para a maioria dos casos de uso, não há razão para escolher o Premier.

Leia também