FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Coder Flash cobra US$ 0,98 por milhão de saída e mira o seu agente

Versão enxuta do coder da Alibaba chega com contexto de 1M, cache barato e preço que incomoda a OpenAI no segmento de programação.

Redação FalaVIP IA 3 min de leitura
US$ 0,98por milhão de tokens de saída
US$ 0,039por milhão de tokens em cache
1.000.000tokens de contexto

Você está olhando para a fatura da API e vendo o peso de um agente de código rodando o dia inteiro. É exatamente aí que a Alibaba acaba de colocar uma pedra no sapato da concorrência.

Hoje chega ao catálogo o Qwen3 Coder Flash, a versão "enxuta" da linha de programação da Qwen. O nome entrega o jogo: é o Flash, não o Plus. Mas o que importa para quem paga a conta é o que ele cobra pelo que entrega — e o que ele não entrega.

O preço que abre o texto

A conta é simples. Entrada: US$ 0,195 por milhão de tokens. Saída: US$ 0,975 por milhão. E aqui está o detalhe que faz diferença em agente: o cache de prompt sai por US$ 0,039 por milhão — cinco vezes mais barato que a entrada.

Em um agente de código, o histórico de conversa, o snippet do arquivo e as instruções de sistema ficam repetidos em praticamente toda chamada. Quando isso entra no cache, o custo de cada iteração seguinte despenca. É como pagar pedágio só na primeira vez que passa pela praça: a cada nova tool call, o trecho que se repete viaja de carona.

Ficha técnica — Qwen3 Coder Flash
CampoValor
Identificadorqwen/qwen3-coder-flash
Criadorqwen
Preço de entradaUS$ 0.195 / M tokens
Preço de saídaUS$ 0.975 / M tokens
Janela de contexto1M
Modalidadetext->text
Leitura de cacheUS$ 0.039 / M (80% de desconto)

O que o Flash é — e o que ele não é

A descrição oficial trata o Flash como a versão "rápida e econômica" do Qwen3 Coder Plus, focada em agente autônomo com tool calling. É um modelo text-to-text, com 1 milhão de tokens de contexto e corte de conhecimento em junho de 2025.

O catálogo, porém, não publicou nota de inteligência, nem benchmark de código, nem de agentic, nem de raciocínio. E não divulgou parâmetros, velocidade, nem país de origem. Você está comprando um coder com base no preço e na família — não em um número de benchmark para comparar com o do concorrente.

Onde ele se encaixa no tabuleiro

Para situar o Flash, vale olhar quem está na frente hoje. O topo do catálogo em inteligência tem o OpenAI o3 com IQ 31,096 e saída a US$ 8 por milhão — quase oito vezes mais caro que o Flash por token de saída. O gpt-oss-120b (IQ 24,126) sai por US$ 0,17, mas é um modelo aberto, com perfil diferente. O Qwen3 Next 80B A3B Thinking (IQ 16,867) cobra US$ 1,20 de saída. E o Llama 4 Maverick (IQ 14,477) sai por US$ 0,696.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 228 modelos disponíveis no catálogo nesta data.

Repare: o Flash cobra mais barato de saída do que o Maverick e o Qwen3 Next Thinking, e mais caro do que o gpt-oss-120b. Mas nenhum desses é um coder especializado com 1M de contexto. É nessa trincheira — modelo de código dedicado, contexto longo, preço agressivo — que o Flash entra.

Para quem vale — e para quem não muda nada

Vale para você se roda agente de código em produção e gasta a maior parte da fatura com saída de tokens. Cenário típico: ferramenta que lê repositório, planeja, chama tools, escreve diffs. Cada turno pesa, e o cache barato muda a equação.

Também vale se você quer um coder secundário para tarefas mais mecânicas — geração de testes, refatoração simples, tradução entre linguagens — sem queimar o orçamento no modelo principal.

Não muda nada para você se o gargalo é raciocínio de código pesado e você já está no o3 ou em um frontier de raciocínio. O Flash é o Flash, não o Plus. Se o seu fluxo depende de planner forte em problemas novos, o Plus (ou o o3) continua sendo o caminho.

Também não muda nada se você precisa comparar números antes de adotar: sem benchmark público de coding neste lançamento, a única forma de saber se ele serve para o seu stack é testando no seu próprio benchmark interno.

O que fazer agora

Se a sua fatura de API tem peso de agente de código, monte um teste A/B entre o Flash e o que você usa hoje. Meça três coisas: qualidade do diff gerado, custo por tarefa concluída e latência por tool call. O cache a US$ 0,039 é o argumento mais forte — mas só se o seu padrão de chamada realmente reutilizar contexto.

Se o teste passar, o Flash vira default para o grosso do volume, e o modelo mais caro fica reservado para os casos em que o agente empaca.

Em uma frase

Rode um A/B de uma semana: meça custo por tarefa, não custo por token, e veja se o cache a US$ 0,039 realmente segura o seu padrão de chamadas antes de migrar o agente.

Perguntas frequentes

Quanto custa o Qwen3 Coder Flash por token?

US$ 0,195 por milhão de tokens de entrada, US$ 0,975 por milhão de saída e US$ 0,039 por milhão em cache de prompt. O cache é cinco vezes mais barato que a entrada, o que pesa em agente de código com muito contexto repetido.

O Qwen3 Coder Flash serve para agente autônomo?

A descrição oficial posiciona o modelo como coder agent com tool calling e 1M de contexto. Não há benchmark público de agentic publicado no catálogo neste lançamento, então a validação depende de teste no seu próprio fluxo.

Qwen3 Coder Flash vs Qwen3 Coder Plus, qual a diferença?

O Flash é a versão enxuta e econômica do Plus, segundo a Alibaba. O Plus tende a ser o modelo principal da família; o Flash é o que entra quando o critério é preço e velocidade, não raciocínio máximo.

Leia também