FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

140 modelos leem imagem. Só 2 valem o preço

O multimodal virou quase metade do catálogo em janeiro. O topo continua caro — e o meio do pacote esconde uma armadilha.

Redação FalaVIP IA 3 min de leitura
140 de 326modelos com entrada multimodal no catálogo
US$ 0,10 / US$ 0,30preço por milhão de tokens do Llama 4 Scout, o mais barato do recorte
12 pontos de IQvale entre o top 2 (o3, Haiku 4.5) e o 3º colocado (Nova 2 Lite)

O multimodal virou quase metade do catálogo — e isso é o problema

Você já parou pra contar quantos modelos do catálogo leem imagem, vídeo ou PDF? Nesta data, são mais de 140 de mais de 326. Quase 43%. É o maior recorte do portfólio. Só que quando você cruza isso com o índice de inteligência, a multidão desaparece: só dois modelos do recorte multimodal aparecem no top 5 geral do mercado.

A regra, então, é simples: se o seu produto precisa enxergar imagem, você não tem mais desculpa de opção. Tem decisão de quanto quer pagar — e o que aceita perder no caminho.

O topo é caro, mas tem motivo

O OpenAI o3 lidera o recorte multimodal com IQ 31,096 e cobra US$ 2 por milhão de tokens de entrada e US$ 8 por milhão de saída. Logo atrás vem o Claude Haiku 4.5, da Anthropic, a US$ 1 e US$ 5. Ambos têm cache de leitura barato (US$ 0,50 e US$ 0,10) e raciocínio ativado.

Paga-se caro, sim. Mas a lacuna até o terceiro colocado é brutal: o o3 tem IQ 31 e o Amazon Nova 2 Lite, terceiro do recorte, tem IQ 19,24. São quase 12 pontos de IQ separando a fronteira do meio do pacote. Se você está montando um agente que precisa interpretar gráficos, screenshots ou formulários com qualidade, essa diferença aparece na taxa de erro — e na conta de retentativas.

O meio do pacote tem uma armadilha

Entre o IQ 30+ e o IQ 15 mora o território mais traiçoeiro. O Amazon Nova 2 Lite é interessante por um motivo específico: é o único modelo deste recorte que aceita vídeo como entrada (text+image+file+video->text), além de custar US$ 0,30 / US$ 2,50 por milhão. Para fluxos com frames de câmera ou análise de clipes, é a única opção da lista que faz isso hoje.

Mas atenção ao trade-off. O Mistral Large 3 2512 (francês, open weights, Apache 2.0) tem IQ 15,919 e custa US$ 0,50 / US$ 1,50. É barato, é aberto, tem 41B de parâmetros ativos num MoE de 675B. O que ele não tem: raciocínio ativado. Comparado ao Nova 2 Lite, que tem raciocínio, o preço menor esconde uma diferença qualitativa em tarefas que exigem cadeia de pensamento. O Nova 2 Lite também é o mais rápido do recorte (153 tokens por segundo) e tem contexto de 1 milhão.

Destaques do recorte: entrada multimodal
ModeloCriadorInteligênciaSaída US$/MContexto
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
Nova 2 Liteamazon19.22.51M
Mistral Large 3 2512mistralai15.91.5262k
Llama 4 Maverickmeta-llama14.50.6961.05M
Nova Premier 1.0amazon12.712.51M
Ministral 3 14B 2512mistralai11.20.2262k
Llama 4 Scoutmeta-llama10.30.31.31M

O fundo do poço tem seus usos

O Llama 4 Scout, da Meta, custa US$ 0,10 / US$ 0,30 por milhão e tem contexto de 1.310.720 tokens — o maior do recorte. É multimodal (text+image) e open weights. Para casos como indexar PDFs enormes, classificar imagem em massa ou rodar inferência on-premise, esse é o preço de entrada.

O Ministral 3 14B (Mistral) é a versão leve: US$ 0,20 / US$ 0,20, 14B de parâmetros densos, open weights, IQ 11,243. Não faz milagre, mas roda em hardware modesto e serve pra prototipar multimodal sem gastar nada de API.

Inteligência × preço no recorte
o3Claude Haiku 4.5Nova 2 LiteMistral Large 3 2512Llama 4 MaverickNova Premier 1.0Ministral 3 14B 2512Llama 4 ScoutUS$ por milhão (saída, escala log)índice de inteligência

Para quem muda o jogo — e para quem não muda nada

Se você está subindo multimodal em produção agora, o caminho mais curto continua sendo: o3 ou Haiku 4.5, com cache de leitura habilitado. O ganho de IQ compensa o dólar extra.

Se você está rodando multimodal em escala (milhares de imagens por dia, OCR, indexação, classificação), os modelos de baixo custo da Meta e da Mistral existem exatamente pra isso. A IQ é menor, mas o custo por requisição cai de 10× a 30× frente à fronteira.

Se você precisa de vídeo como entrada, a escolha de hoje é uma só no recorte: Amazon Nova 2 Lite. Não tem concorrente.

E se você está só experimentando, nada disso te afeta — o caminho continua sendo testar com a fronteira antes de otimizar custo.

O tabuleiro hoje

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 326 modelos disponíveis no catálogo nesta data.

Olhando o catálogo inteiro em janeiro de 2026, a fronteira multimodal ainda é americana. Das oito opções deste recorte, seis vêm dos EUA (OpenAI, Anthropic, Amazon, Meta) e duas da França (Mistral). Nenhuma chinesa aparece — a Xiaomi, que lidera o ranking geral de IQ, não tem modelo multimodal nesta listagem. Quem procura multimodal open weights tem duas portas: Mistral ou Meta. A escolha entre elas é hoje mais sobre idioma, licença e hardware do que sobre preço.

Em uma frase

Pague caro pelo topo (o3 ou Haiku 4.5) quando a taxa de erro importar; desça pro Llama 4 Scout ou Ministral quando volume e custo dominarem; e não tente substituir o Nova 2 Lite se o seu fluxo depende de vídeo — ele é o único do recorte que faz isso.

Perguntas frequentes

Qual o melhor modelo multimodal barato em janeiro de 2026?

Depende do uso. Para multimodal com raciocínio, o melhor custo-benefício do recorte é o Claude Haiku 4.5 (US$ 1 / US$ 5, IQ 29,892). Para volume massivo, o Llama 4 Scout a US$ 0,10 / US$ 0,30 é a entrada mais barata, com 1,3 milhão de tokens de contexto.

Existe modelo multimodal que aceita vídeo?

Sim, dentro do recorte o único é o Amazon Nova 2 Lite, com modalidade text+image+file+video->text, IQ 19,24 e preço de US$ 0,30 / US$ 2,50 por milhão de tokens.

Quais modelos multimodais são open weights?

No recorte de janeiro, são quatro: Mistral Large 3 2512 (675B total / 41B ativos, Apache 2.0), Llama 4 Maverick (402B / 17B ativos), Ministral 3 14B (14B densos) e Llama 4 Scout (109B / 17B ativos). Todos exigem hardware próprio ou servidor dedicado.

Leia também