140 modelos leem imagem. Só 2 valem o preço
O multimodal virou quase metade do catálogo em janeiro. O topo continua caro — e o meio do pacote esconde uma armadilha.
O multimodal virou quase metade do catálogo — e isso é o problema
Você já parou pra contar quantos modelos do catálogo leem imagem, vídeo ou PDF? Nesta data, são mais de 140 de mais de 326. Quase 43%. É o maior recorte do portfólio. Só que quando você cruza isso com o índice de inteligência, a multidão desaparece: só dois modelos do recorte multimodal aparecem no top 5 geral do mercado.
A regra, então, é simples: se o seu produto precisa enxergar imagem, você não tem mais desculpa de opção. Tem decisão de quanto quer pagar — e o que aceita perder no caminho.
O topo é caro, mas tem motivo
O OpenAI o3 lidera o recorte multimodal com IQ 31,096 e cobra US$ 2 por milhão de tokens de entrada e US$ 8 por milhão de saída. Logo atrás vem o Claude Haiku 4.5, da Anthropic, a US$ 1 e US$ 5. Ambos têm cache de leitura barato (US$ 0,50 e US$ 0,10) e raciocínio ativado.
Paga-se caro, sim. Mas a lacuna até o terceiro colocado é brutal: o o3 tem IQ 31 e o Amazon Nova 2 Lite, terceiro do recorte, tem IQ 19,24. São quase 12 pontos de IQ separando a fronteira do meio do pacote. Se você está montando um agente que precisa interpretar gráficos, screenshots ou formulários com qualidade, essa diferença aparece na taxa de erro — e na conta de retentativas.
O meio do pacote tem uma armadilha
Entre o IQ 30+ e o IQ 15 mora o território mais traiçoeiro. O Amazon Nova 2 Lite é interessante por um motivo específico: é o único modelo deste recorte que aceita vídeo como entrada (text+image+file+video->text), além de custar US$ 0,30 / US$ 2,50 por milhão. Para fluxos com frames de câmera ou análise de clipes, é a única opção da lista que faz isso hoje.
Mas atenção ao trade-off. O Mistral Large 3 2512 (francês, open weights, Apache 2.0) tem IQ 15,919 e custa US$ 0,50 / US$ 1,50. É barato, é aberto, tem 41B de parâmetros ativos num MoE de 675B. O que ele não tem: raciocínio ativado. Comparado ao Nova 2 Lite, que tem raciocínio, o preço menor esconde uma diferença qualitativa em tarefas que exigem cadeia de pensamento. O Nova 2 Lite também é o mais rápido do recorte (153 tokens por segundo) e tem contexto de 1 milhão.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Nova Premier 1.0 | amazon | 12.7 | 12.5 | 1M |
| Ministral 3 14B 2512 | mistralai | 11.2 | 0.2 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
O fundo do poço tem seus usos
O Llama 4 Scout, da Meta, custa US$ 0,10 / US$ 0,30 por milhão e tem contexto de 1.310.720 tokens — o maior do recorte. É multimodal (text+image) e open weights. Para casos como indexar PDFs enormes, classificar imagem em massa ou rodar inferência on-premise, esse é o preço de entrada.
O Ministral 3 14B (Mistral) é a versão leve: US$ 0,20 / US$ 0,20, 14B de parâmetros densos, open weights, IQ 11,243. Não faz milagre, mas roda em hardware modesto e serve pra prototipar multimodal sem gastar nada de API.
Para quem muda o jogo — e para quem não muda nada
Se você está subindo multimodal em produção agora, o caminho mais curto continua sendo: o3 ou Haiku 4.5, com cache de leitura habilitado. O ganho de IQ compensa o dólar extra.
Se você está rodando multimodal em escala (milhares de imagens por dia, OCR, indexação, classificação), os modelos de baixo custo da Meta e da Mistral existem exatamente pra isso. A IQ é menor, mas o custo por requisição cai de 10× a 30× frente à fronteira.
Se você precisa de vídeo como entrada, a escolha de hoje é uma só no recorte: Amazon Nova 2 Lite. Não tem concorrente.
E se você está só experimentando, nada disso te afeta — o caminho continua sendo testar com a fronteira antes de otimizar custo.
O tabuleiro hoje
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Olhando o catálogo inteiro em janeiro de 2026, a fronteira multimodal ainda é americana. Das oito opções deste recorte, seis vêm dos EUA (OpenAI, Anthropic, Amazon, Meta) e duas da França (Mistral). Nenhuma chinesa aparece — a Xiaomi, que lidera o ranking geral de IQ, não tem modelo multimodal nesta listagem. Quem procura multimodal open weights tem duas portas: Mistral ou Meta. A escolha entre elas é hoje mais sobre idioma, licença e hardware do que sobre preço.
Pague caro pelo topo (o3 ou Haiku 4.5) quando a taxa de erro importar; desça pro Llama 4 Scout ou Ministral quando volume e custo dominarem; e não tente substituir o Nova 2 Lite se o seu fluxo depende de vídeo — ele é o único do recorte que faz isso.
Perguntas frequentes
Qual o melhor modelo multimodal barato em janeiro de 2026?
Depende do uso. Para multimodal com raciocínio, o melhor custo-benefício do recorte é o Claude Haiku 4.5 (US$ 1 / US$ 5, IQ 29,892). Para volume massivo, o Llama 4 Scout a US$ 0,10 / US$ 0,30 é a entrada mais barata, com 1,3 milhão de tokens de contexto.
Existe modelo multimodal que aceita vídeo?
Sim, dentro do recorte o único é o Amazon Nova 2 Lite, com modalidade text+image+file+video->text, IQ 19,24 e preço de US$ 0,30 / US$ 2,50 por milhão de tokens.
Quais modelos multimodais são open weights?
No recorte de janeiro, são quatro: Mistral Large 3 2512 (675B total / 41B ativos, Apache 2.0), Llama 4 Maverick (402B / 17B ativos), Ministral 3 14B (14B densos) e Llama 4 Scout (109B / 17B ativos). Todos exigem hardware próprio ou servidor dedicado.