FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Coder Flash cobra US$ 0,98/M de saída e não é o mais barato do mercado

A Alibaba prometeu uma versão enxuta do Qwen3 Coder Plus. O preço de tabela mostra que a economia é relativa à família, não ao mercado como um todo.

Redação FalaVIP IA 4 min de leitura
US$ 0,975por milhão de tokens de saída
1.000.000tokens de contexto
7,5xmais caro que o gpt-oss-20b no output

A conta que o "Flash" não entrega

A Alibaba rotulou de "Flash" a versão econômica do Qwen3 Coder Plus. Faz sentido no papel: o irmão mais velho é um modelo de código pesado, voltado a agentes de programação com tool calling. Um Flash seria a versão rápida, mais barata, para tarefas que não precisam do canhão.

Só que o preço diz outra coisa. O token de saída do Qwen3 Coder Flash custa US$ 0,975 por milhão. Em comparação direta, o gpt-oss-20b da OpenAI sai por US$ 0,13 — 7,5 vezes mais barato. O modelo de raciocínio da própria Qwen, o Qwen3 Next 80B A3B Thinking, cobra US$ 1,20 pelo mesmo token. O Llama 4 Maverick, da Meta, fica em US$ 0,696. O topo da tabela, o o3, cobra US$ 8 por milhão de saída.

"Flash", então, é uma posição relativa à família Qwen3 Coder — não ao mercado como um todo. Se você vem de outro ecossistema, ele está longe de ser a opção mais barata. Está no meio do pelotão de preço.

Ficha técnica — Qwen3 Coder Flash
CampoValor
Identificadorqwen/qwen3-coder-flash
Criadorqwen
Preço de entradaUS$ 0.195 / M tokens
Preço de saídaUS$ 0.975 / M tokens
Janela de contexto1M
Modalidadetext->text
Leitura de cacheUS$ 0.039 / M (80% de desconto)

O que ele traz de concreto

O ponto de venda do Qwen3 Coder Flash não é inteligência bruta. O catálogo não publicou índice de IQ, score de coding nem de agentic para esse modelo — então qualquer comparação por "esperteza" é chute, e você não vai achar benchmark oficial para colocar lado a lado com o o3 ou o Maverick.

O que está documentado e importa:

  • Janela de contexto de 1 milhão de tokens. Cabe um repositório inteiro na memória, com histórico longo de tool calls.
  • Especialização em coding agent via tool calling. Não é um modelo de uso geral que "se vira bem em código": foi desenhado para ser orquestrado por outro agente, executar tarefas de programação e devolver resultado.
  • Preço de entrada baixo: US$ 0,195 por milhão de tokens de input.
  • Cache de US$ 0,039 por milhão — cinco vezes mais barato que o input. Em workloads com prompts repetidos e trechos grandes de código, esse é o número que de fato move a conta.
  • Knowledge cutoff de junho de 2025, então conhece APIs e bibliotecas até o meio do ano.

O "Flash" aqui é velocidade de turnaround para o agente, não economia absoluta de token.

Onde ele se encaixa no tabuleiro

Em 17 de setembro de 2025, o catálogo tinha mais de 228 modelos, vindos de 38 criadores. 14 foram lançados nos últimos 30 dias. O topo por inteligência medida hoje:

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 228 modelos disponíveis no catálogo nesta data.

O Qwen3 Coder Flash não disputa essa ponta. Ele não tem IQ medido, e o modelo de raciocínio da própria Qwen está em terceiro no ranking por IQ — basicamente o mesmo preço de saída (US$ 1,20) que o Flash, mas com score público. A diferença entre os dois é que o Next 80B A3B Thinking foi desenhado para pensar, enquanto o Flash foi desenhado para executar.

Em resumo de preço de saída: mais barato que o3 e que o Qwen3 Next 80B A3B Thinking, mais caro que gpt-oss-120b, gpt-oss-20b e Llama 4 Maverick. Posição: meio de tabela, com proposta de uso específica.

Para quem vale — e para quem não

Vale para quem está construindo um agente de programação que faz muitas chamadas de tool, lê repositórios grandes e roda em loops longos. O preço de cache de US$ 0,039/M reduz custo em prompts repetidos com porções grandes de código. Casos típicos: backend que orquestra outros modelos, agent loops em IDE, automações de refactor que precisam de contexto amplo.

Não vale para quem quer pagar o mínimo absoluto por token. gpt-oss-20b e gpt-oss-120b são ordens de magnitude mais baratos no output. Também não vale se você quer comparar inteligência geral ou coding score — não há benchmark público para esse modelo, e o catálogo não traz país de origem, tamanho, velocidade, nem se os pesos são abertos.

Se seu gargalo é custo puro, vá de gpt-oss-20b. Se seu gargalo é raciocínio de fronteira, vá de o3. O Flash vive no meio, e só compensa quando o caso de uso é, de fato, coding agent com tool calling e janela grande.

A implicação prática

Antes de trocar seu coding agent atual, meça quantos tokens de saída você consome por mês. Se a conta for grande, a diferença entre US$ 0,13 e US$ 0,975 por milhão pode ser a margem inteira do seu produto — sete vezes e meia de diferença multiplica. Se a conta for pequena, escolha pelo encaixe técnico (tool calling + 1M de contexto), não pelo preço de tabela.

E teste o cache: a US$ 0,039 por milhão, o Flash começa a fazer sentido para workloads que reusam grandes blocos de código entre chamadas.

Em uma frase

Use o Qwen3 Coder Flash quando o gargalo for tool calling com contexto longo e cache reusado; para economizar de verdade no token de saída, o gpt-oss-20b continua sendo outra ordem de grandeza mais barato.

Perguntas frequentes

Quanto custa o Qwen3 Coder Flash por token?

Cobra US$ 0,195 por milhão de tokens de entrada, US$ 0,975 por milhão de saída e US$ 0,039 por milhão em cache. No output, é cerca de 7,5 vezes mais caro que o gpt-oss-20b da OpenAI.

Qwen3 Coder Flash é melhor que o o3?

Não dá para comparar diretamente: o catálogo não publicou índice de IQ nem benchmark de coding para o Flash. O o3 lidera o ranking de inteligência medida hoje, mas custa US$ 8 por milhão de tokens de saída, mais de oito vezes o preço do Flash.

Para que tipo de tarefa o Qwen3 Coder Flash foi feito?

Foi desenhado como agente de programação com tool calling e janela de 1 milhão de tokens. O caso típico é orquestrar tarefas de código em loops longos, lendo repositórios inteiros, e não servir como modelo de uso geral.

Leia também