Gemini 3.5 Flash cobra US$ 9, GPT-5.3-Codex cobra US$ 14: vale a diferença?
O Flash da Google chega mais barato, mais rápido e com índice de inteligência maior que o Codex da OpenAI — mas a janela de contexto e a especialização contam.
O Flash chegou mais barato E mais inteligente que o Codex
Você viu o lançamento do Gemini 3.5 Flash na terça passada e provavelmente pensou: "mais um modelo da Google, vou abrir o comparativo". Faz sentido. Mas o número que importa não é o lançamento em si — é que, três dias depois, ele já aparece custando US$ 9 por milhão de tokens de saída enquanto o GPT-5.3-Codex, da OpenAI, segue em US$ 14. E, ao mesmo tempo, o Flash entrega índice de inteligência 46,67 contra 45,51 do Codex. Em outras palavras: o modelo mais barato do comparativo também é o que pontua mais alto no benchmark agregado.
Onde o Flash não entrega tudo o que o Codex entrega
Antes de trocar o agente de coding do seu pipeline, vale olhar para três coisas em que o Codex ainda manda.
Janela de contexto. O Flash aceita 1.048.576 tokens (1M); o Codex, 400.000. Em repositórios inteiros ou bases de código muito grandes, isso pode pesar — e o Flash ganha aqui, não perde.
Modalidades. O Flash lê texto, imagem, arquivo, áudio e vídeo e devolve texto. O Codex lê texto, imagem e arquivo e devolve texto. Se você joga áudio ou vídeo para o modelo — transcrição, análise de reunião, resumo de palestra —, o Codex está fora do jogo.
Velocidade. 194,53 tokens por segundo contra 118,36. Em fluxos agentic com muitos ciclos curtos, essa diferença aparece no tempo de parede.
| Critério | Gemini 3.5 Flash | GPT-5.3-Codex |
|---|---|---|
| Índice de inteligência | 46.7 | 45.5 |
| Entrada US$/M | 1.5 | 1.75 |
| Saída US$/M | 9 | 14 |
| Contexto | 1.05M | 400k |
| Pesos abertos | não | não |
| Velocidade (tok/s) | 195 | 118 |
| Índice de código | — | — |
| Índice agêntico | — | — |
O custo real por token, sem o marketing
O release da Google diz "eficiência de tier Flash". Traduzindo: a OpenAI cobra US$ 1,75 por milhão de entrada e US$ 14 por milhão de saída; a Google cobra US$ 1,50 e US$ 9. No cache, US$ 0,15 contra US$ 0,175 — diferença pequena em valor absoluto, mas o Flash cobra menos em todas as três linhas.
O custo blended (mistura típica de 3:1 entre entrada e saída) sai a US$ 3,375 por milhão no Flash e US$ 4,8125 no Codex. Em um pipeline que gasta, digamos, 500 milhões de tokens de saída por mês, essa diferença vira cerca de US$ 2.800 a mais na fatura — todo mês, sem ganho de qualidade visível.
E o "specialist" de coding?
Aqui mora a pegadinha. O GPT-5.3-Codex é descrito pela própria OpenAI como o modelo agentic de coding mais avançado deles, combinando a engenharia de software do 5.2-Codex com raciocínio amplo do 5.2. O Flash é descrito pela Google como "near-Pro level coding and reasoning" com otimização para "parallel agentic execution". Os dois são modelos de raciocínio, os dois miram coding agentic — mas a OpenAI construiu o Codex como produto vertical; a Google está oferecendo o Flash como modelo horizontal de alta eficiência.
Na prática, para tarefas agentic longas e bem definidas (refactor grande, migração de framework, debugging profundo com múltiplos arquivos), o Codex tende a ser a aposta mais conservadora. Para workloads de alta vazão — geração de testes em massa, snippets, code review em PRs curtos, classificação de código — o Flash entrega mais pelo mesmo dinheiro.
O tabuleiro em 22 de maio de 2026
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
O topo do índice de inteligência hoje tem Gemini 3.1 Pro Preview (47,74 / US$ 12), Gemini 3.5 Flash (46,67 / US$ 9), GPT-5.3-Codex (45,51 / US$ 14), DeepSeek V4 Pro (45,27 / US$ 1,74) e Xiaomi MiMo-V2.5-Pro (42,88 / US$ 0,87). O Flash é o segundo mais inteligente do catálogo e o segundo mais barato entre os acima de IQ 45. O Codex está em terceiro em inteligência e é o mais caro dos quatro.
Quem escolhe o quê
Se o seu gargalo é custo por token e você roda o modelo em volume, vai no Gemini 3.5 Flash. Você paga menos, recebe mais velocidade e abre mão de nada mensurável no índice agregado.
Se o seu gargalo é uma cadeia agentic longa, com contexto pesado e você confia no tuning vertical da OpenAI para coding, fica no GPT-5.3-Codex — e aceita pagar o prêmio.
Se você precisa de áudio ou vídeo no mesmo modelo, o Flash é o único dos dois que entra.
E se o orçamento for o fator decisivo de verdade, o DeepSeek V4 Pro (US$ 1,74 de saída, IQ 45,27) está aí, três posições abaixo do Codex e dez vezes mais barato. Mas isso já é outra pauta.
Trocar Codex por Flash corta ~36% do custo por milhão de tokens de saída sem perder índice de inteligência — só não vale se a cadeia agentic depender do tuning vertical da OpenAI.
Perguntas frequentes
Gemini 3.5 Flash é melhor que GPT-5.3-Codex para programar?
No índice agregado de inteligência, sim: 46,67 contra 45,51. Em tarefas agentic verticais muito longas, o Codex ainda é a aposta mais conservadora porque a OpenAI construiu o modelo especificamente para coding agentic. Para geração de código em volume, o Flash entrega mais pelo mesmo dinheiro.
Quanto custa a diferença entre os dois na fatura?
Por milhão de tokens de saída, US$ 9 contra US$ 14. No custo blended (mistura 3:1 entrada/saída), US$ 3,375 contra US$ 4,8125. Em workloads de 500 milhões de tokens de saída por mês, isso é cerca de US$ 2.800 a mais por mês com o Codex.
Qual dos dois aceita áudio e vídeo?
Só o Gemini 3.5 Flash. O GPT-5.3-Codex lê texto, imagem e arquivo e devolve texto; o Flash lê texto, imagem, arquivo, áudio e vídeo. Se o pipeline depende de transcrição ou análise de vídeo, o Codex está fora.