FalaVIP IA o que os modelos custam,
medido todo dia
2026-09 (20)2026-08 (96)2026-07 (57)2026-06 (52)2026-05 (58)2026-04 (57)2026-03 (61)2026-02 (55)2026-01 (59)2025-12 (61)2025-11 (59)2025-10 (56)2025-09 (58)

Arquivo

749 reportagens desde setembro de 2025.

Lançamentos

GLM 4.7 Flash da Z.ai entra a US$ 0,40 por milhão de tokens de saída

Modelo de 30B parâmetros chega ao catálogo hoje mirando uso em agentes de código; preço de saída é o mais barato entre os rivais diretos, mas o índice de inteligência ainda não foi medido.

Retrospectiva

Semana de um lançamento só: GPT-5.2-Codex a US$ 14 por milhão

Sete dias de calendário, uma única novidade, nenhuma mudança de preço — e o topo do ranking continua sem ser da OpenAI nem da Anthropic.

Análise

Mistral Large 3 2512 cobra mais caro que o Nemotron da NVIDIA

Os dois são modelos abertos e rodam bem em uma GPU só — só que um fala francês e custa em dólar, o outro fala inglês e custa em centavo.

Preços

89 modelos custam menos de US$ 1 por milhão de tokens — e poucos valem a pena

A faixa barata do catálogo concentra modelos open-weight de China, EUA e França, mas só três entregam inteligência competitiva; Xiaomi, OpenAI e NVIDIA dominam a conversa.

Análise

Nova Premier cobra 8,3× mais caro que Mistral Large 3 e perde em inteligência

Contexto de 1 milhão de tokens é o único argumento a favor do modelo da AWS; em quase todo o resto, o francês entrega mais por menos — e ainda é open weights.

Análise

Xiaomi lidera raciocínio no catálogo e cobra 26 vezes menos que OpenAI o3

MiMo-V2-Flash, modelo de pesos abertos da chinesa Xiaomi, lidera o recorte de raciocínio com IQ 34 e custa US$ 0,30 por milhão de tokens de saída — contra US$ 8 do o3.

Análise

Mistral Large 3 2512 cobra 5 vezes mais caro que o Qwen3 Next 80B A3B

Comparativo entre dois modelos abertos com MoE esparsa, mesma janela de contexto e preços em patamares opostos

Análise

Janela de 1 milhão de tokens custa o mesmo que um café — se você não se importar com a inteligência

38 modelos no catálogo prometem contextos gigantes. Alguns cobram barato. Nenhum dos dois entrega o pacote completo.

Análise

Contexto de 1 milhão de tokens já é commodity: 38 modelos, e o melhor custa US$ 0,30

Oito deles processam livros inteiros de uma vez. Só que pagar barato pela janela não significa pagar barato pelo modelo — e o ranking de inteligência mostra quem entrega e quem só decora.

Lançamentos

GPT-5.2-Codex entra em cartaz a US$ 14 por milhão de saída

Sucessor do 5.1-Codex chega com contexto de 400 mil tokens e preço 75% mais alto que o do o3 — o que muda (e o que não muda) na fatura de quem programa com IA.

Análise

GPT-5.2-Codex cobra US$ 14 por milhão de saída — sem benchmark no catálogo

Modelo da OpenAI para coding e agentic entra mais caro que o o3 e sem nota de IQ publicada no catálogo.

Preços

Mistral Large 3 custa 7,5x mais que o Nemotron Nano por token de saída

Os dois são modelos abertos lançados em dezembro; o francês pesa 11x mais em parâmetros ativos, mas o americano é 3x mais rápido e tem raciocínio nativo.

Análise

Os 24 pesos abertos do catálogo entregam o melhor da fronteira por uma fração do preço

Modelos com pesos publicados já ocupam o topo do ranking de inteligência e cobram até 26 vezes menos que o o3 da OpenAI por token de saída.

Preços

Cache de prompt custa 10% do preço de entrada em 141 modelos

Dois em cada três modelos do catálogo cobram cache a um décimo do token de input — e isso muda a conta de quem repete contexto.

Análise

Mistral Large 3 a US$ 1,50 vs gpt-oss-20b a US$ 0,13: vale a diferença?

Dois modelos abertos com IQ parecido, mas preço de saída quase 12 vezes maior. O que cada um entrega de verdade.

Mercado

Xiaomi MiMo-V2-Flash lidera ranking de IA com saída a US$ 0,30

Um modelo chinês de baixo custo destoa do topo do catálogo na semana em que a única novidade foi um 32B open source da AllenAI.

Análise

Mistral Large 3 2512 e INTELLECT-3 custam quase o mesmo e tiram quase a mesma nota

Dois modelos abertos com arquiteturas parecidas, preços parecidos e um IQ separados por 0,2 ponto — mas só um deles tem modo de raciocínio

Análise

Qwen3 Next Thinking cobra 8x mais no output que o Ministral 3 8B

Dois modelos open-weights disputam o meio de tabela: um emite traços de pensamento, o outro responde direto. O preço na fatura é menos óbvio do que parece.

Análise

MiMo-V2-Flash lidera catálogo inteiro e custa 26 vezes menos que o3

MoE assume o topo do ranking de inteligência do catálogo nesta data. A diferença de preço para os modelos densos é o que muda a conta em produção.

Análise

Qwen3 Next 80B Thinking custa mais caro na saída que o Ministral 3 14B

Comparativo frente a frente entre dois modelos chineses e franceses de pesos abertos, e o que essa diferença de preço significa na fatura do final do mês.

← anteriores página 25 de 38 próximas →