Gemini 3 Pro Imagem estreia a US$ 12 por milhão de saída: vale o que cobra
O novo modelo de imagem do Google chega caro e sem benchmark de raciocínio — só faz sentido para quem realmente precisa gerar e editar imagem com linguagem.
Você provavelmente viu o anúncio do Nano Banana Pro — o nome-código que o Google colou no Gemini 3 Pro Image Preview — e já saiu olhando preço. Faz sentido: foi lançado hoje, 20 de novembro, e a pergunta que interessa é simples. Quanto custa colocar esse modelo para rodar na sua aplicação e em que situação ele paga o investimento?
O preço que ninguém traduz
A tabela da Google diz "$2 por milhão de entrada, $12 por milhão de saída". Traduzindo do marketing para a fatura: cada imagem que sai do modelo cobra como se fosse texto. Pior — cobra caro como se fosse texto de raciocínio. Para um desenvolvedor que está bolando um pipeline de geração em massa, isso muda tudo. Uma chamada típica de edição de imagem devolve alguns milhares de tokens de saída; multiplique por volume e a conta explode rápido.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3-pro-image-preview |
| Criador | |
| Preço de entrada | US$ 2.00 / M tokens |
| Preço de saída | US$ 12.00 / M tokens |
| Janela de contexto | 66k |
| Modalidade | text+image->text+image |
| Leitura de cache | US$ 0.200 / M (90% de desconto) |
O detalhe que costuma passar batido é o cache: US$ 0,20 por milhão. É um alívio real para quem repete prompts parecidos — por exemplo, um sistema que mantém um personagem consistente entre várias cenas. Se o seu fluxo reusa contexto, o cache derruba o custo efetivo. Se cada requisição é única, esse número não te salva.
Onde ele se encaixa no tabuleiro
O catálogo hoje tem 278 modelos ativos de 42 criadores diferentes, e 17 deles foram lançados nos últimos 30 dias. Ou seja: você não está olhando para um lançamento em um deserto. O topo de inteligência geral continua sendo da OpenAI, com o3 marcando 31,1 de IQ e custando US$ 8 por milhão de saída — mais barato na saída do que o Nano Banana Pro, mesmo sendo um modelo de texto puro.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O Claude Haiku 4.5 da Anthropic aparece logo abaixo, com IQ de 29,9 e US$ 5 por milhão de saída. É mais barato que o Gemini de imagem e, nos benchmarks de texto, é mais inteligente. A comparação não é justa — eles não fazem a mesma coisa — mas ela responde à pergunta que todo mundo faz: "será que um modelo de texto mais barato resolve meu problema?". Se você só precisa descrever uma imagem, sim. Se você precisa que a imagem volte editada, não.
O que o catálogo não está te contando
Aqui mora o problema. O Gemini 3 Pro Image Preview chega sem nota de inteligência, sem benchmark de código, sem nota agentic, sem velocidade publicada, sem contagem de parâmetros. Não é desconfiança — é ausência de dado. Você está pagando US$ 12 por milhão de saída em um modelo cujo custo-benefício relativo ninguém ainda mediu de forma independente.
A janela de contexto de 65.536 tokens é generosa. Para edição de imagem com instruções longas — pense em briefing de campanha, múltiplas referências, instruções de estilo — esse espaço é confortável. Para quem vinha se arrastando em modelos de imagem com contexto curto, é um salto real.
Para quem vale — e para quem não
Vale para você se: gera ou edita imagem em volume moderado a alto e precisa de raciocínio multimodal de verdade (manter coerência entre várias gerações, entender instruções complexas de composição, ancorar a imagem em referências do mundo real). O cache de US$ 0,20 ajuda quem repete contexto. O preço de US$ 12 só dói em escala.
Não muda nada para você se: está usando um modelo de imagem mais barato para tarefas simples, ou se a maior parte do seu custo é texto. Um Haiku 4.5 ou um o3 resolve descrição, sumarização e raciocínio por uma fração do preço. Pagar US$ 12 por milhão de saída para gerar texto é mau negócio.
Também não vale se: você precisa de pesos abertos para rodar local, ou se a sua aplicação roda em jurisdição onde o dado não pode sair para a API do Google. O modelo é fechado e hospedado — não há alternativa on-prem.
O que fazer com isso agora
Antes de trocar seu pipeline de imagem, meça o custo por imagem gerada no seu fluxo atual e compare com US$ 12 vezes os tokens de saída estimados do Nano Banana Pro. Se a diferença for pequena e a qualidade multimodal justificar, vale um piloto curto. Se a diferença for grande, espere: 17 modelos novos em 30 dias significa que a próxima rodada de comparação está a caminho, e o preço de entrada tende a cair quando o concorrente aparece.
Teste o Nano Banana Pro só se imagem é o produto final e você consegue reaproveitar contexto para usar o cache; para tudo que termina em texto, um Haiku 4.5 ou um o3 entrega mais por menos.
Perguntas frequentes
Quanto custa o Gemini 3 Pro Image Preview na API?
Custa US$ 2 por milhão de tokens de entrada, US$ 12 por milhão de tokens de saída e US$ 0,20 por milhão de tokens em cache. O valor é o mesmo para prompts com ou sem imagem, e não há camada gratuita publicada.
O Nano Banana Pro é melhor que o Claude Haiku 4.5?
Não dá para comparar diretamente — eles fazem coisas diferentes. O Haiku 4.5 é um modelo de texto com IQ 29,9 e custa US$ 5 por milhão de saída; o Nano Banana Pro gera e edita imagem, mas não tem nota de inteligência publicada no catálogo.
Vale a pena trocar meu gerador de imagem atual pelo Nano Banana Pro?
Só se você precisa de raciocínio multimodal sobre a imagem — coerência entre cenas, instruções longas, referências do mundo real — e consegue reusar contexto para amortizar com o cache de US$ 0,20. Para edição simples, o custo de US$ 12 por milhão de saída raramente se paga.