Qwen3 Coder Flash cobra US$ 0,98/M de saída e não é o mais barato do mercado
A Alibaba prometeu uma versão enxuta do Qwen3 Coder Plus. O preço de tabela mostra que a economia é relativa à família, não ao mercado como um todo.
A conta que o "Flash" não entrega
A Alibaba rotulou de "Flash" a versão econômica do Qwen3 Coder Plus. Faz sentido no papel: o irmão mais velho é um modelo de código pesado, voltado a agentes de programação com tool calling. Um Flash seria a versão rápida, mais barata, para tarefas que não precisam do canhão.
Só que o preço diz outra coisa. O token de saída do Qwen3 Coder Flash custa US$ 0,975 por milhão. Em comparação direta, o gpt-oss-20b da OpenAI sai por US$ 0,13 — 7,5 vezes mais barato. O modelo de raciocínio da própria Qwen, o Qwen3 Next 80B A3B Thinking, cobra US$ 1,20 pelo mesmo token. O Llama 4 Maverick, da Meta, fica em US$ 0,696. O topo da tabela, o o3, cobra US$ 8 por milhão de saída.
"Flash", então, é uma posição relativa à família Qwen3 Coder — não ao mercado como um todo. Se você vem de outro ecossistema, ele está longe de ser a opção mais barata. Está no meio do pelotão de preço.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-coder-flash |
| Criador | qwen |
| Preço de entrada | US$ 0.195 / M tokens |
| Preço de saída | US$ 0.975 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text->text |
| Leitura de cache | US$ 0.039 / M (80% de desconto) |
O que ele traz de concreto
O ponto de venda do Qwen3 Coder Flash não é inteligência bruta. O catálogo não publicou índice de IQ, score de coding nem de agentic para esse modelo — então qualquer comparação por "esperteza" é chute, e você não vai achar benchmark oficial para colocar lado a lado com o o3 ou o Maverick.
O que está documentado e importa:
- Janela de contexto de 1 milhão de tokens. Cabe um repositório inteiro na memória, com histórico longo de tool calls.
- Especialização em coding agent via tool calling. Não é um modelo de uso geral que "se vira bem em código": foi desenhado para ser orquestrado por outro agente, executar tarefas de programação e devolver resultado.
- Preço de entrada baixo: US$ 0,195 por milhão de tokens de input.
- Cache de US$ 0,039 por milhão — cinco vezes mais barato que o input. Em workloads com prompts repetidos e trechos grandes de código, esse é o número que de fato move a conta.
- Knowledge cutoff de junho de 2025, então conhece APIs e bibliotecas até o meio do ano.
O "Flash" aqui é velocidade de turnaround para o agente, não economia absoluta de token.
Onde ele se encaixa no tabuleiro
Em 17 de setembro de 2025, o catálogo tinha mais de 228 modelos, vindos de 38 criadores. 14 foram lançados nos últimos 30 dias. O topo por inteligência medida hoje:
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
O Qwen3 Coder Flash não disputa essa ponta. Ele não tem IQ medido, e o modelo de raciocínio da própria Qwen está em terceiro no ranking por IQ — basicamente o mesmo preço de saída (US$ 1,20) que o Flash, mas com score público. A diferença entre os dois é que o Next 80B A3B Thinking foi desenhado para pensar, enquanto o Flash foi desenhado para executar.
Em resumo de preço de saída: mais barato que o3 e que o Qwen3 Next 80B A3B Thinking, mais caro que gpt-oss-120b, gpt-oss-20b e Llama 4 Maverick. Posição: meio de tabela, com proposta de uso específica.
Para quem vale — e para quem não
Vale para quem está construindo um agente de programação que faz muitas chamadas de tool, lê repositórios grandes e roda em loops longos. O preço de cache de US$ 0,039/M reduz custo em prompts repetidos com porções grandes de código. Casos típicos: backend que orquestra outros modelos, agent loops em IDE, automações de refactor que precisam de contexto amplo.
Não vale para quem quer pagar o mínimo absoluto por token. gpt-oss-20b e gpt-oss-120b são ordens de magnitude mais baratos no output. Também não vale se você quer comparar inteligência geral ou coding score — não há benchmark público para esse modelo, e o catálogo não traz país de origem, tamanho, velocidade, nem se os pesos são abertos.
Se seu gargalo é custo puro, vá de gpt-oss-20b. Se seu gargalo é raciocínio de fronteira, vá de o3. O Flash vive no meio, e só compensa quando o caso de uso é, de fato, coding agent com tool calling e janela grande.
A implicação prática
Antes de trocar seu coding agent atual, meça quantos tokens de saída você consome por mês. Se a conta for grande, a diferença entre US$ 0,13 e US$ 0,975 por milhão pode ser a margem inteira do seu produto — sete vezes e meia de diferença multiplica. Se a conta for pequena, escolha pelo encaixe técnico (tool calling + 1M de contexto), não pelo preço de tabela.
E teste o cache: a US$ 0,039 por milhão, o Flash começa a fazer sentido para workloads que reusam grandes blocos de código entre chamadas.
Use o Qwen3 Coder Flash quando o gargalo for tool calling com contexto longo e cache reusado; para economizar de verdade no token de saída, o gpt-oss-20b continua sendo outra ordem de grandeza mais barato.
Perguntas frequentes
Quanto custa o Qwen3 Coder Flash por token?
Cobra US$ 0,195 por milhão de tokens de entrada, US$ 0,975 por milhão de saída e US$ 0,039 por milhão em cache. No output, é cerca de 7,5 vezes mais caro que o gpt-oss-20b da OpenAI.
Qwen3 Coder Flash é melhor que o o3?
Não dá para comparar diretamente: o catálogo não publicou índice de IQ nem benchmark de coding para o Flash. O o3 lidera o ranking de inteligência medida hoje, mas custa US$ 8 por milhão de tokens de saída, mais de oito vezes o preço do Flash.
Para que tipo de tarefa o Qwen3 Coder Flash foi feito?
Foi desenhado como agente de programação com tool calling e janela de 1 milhão de tokens. O caso típico é orquestrar tarefas de código em loops longos, lendo repositórios inteiros, e não servir como modelo de uso geral.