Qwen3 Coder Flash cobra US$ 0,98 por milhão de saída e mira o seu agente
Versão enxuta do coder da Alibaba chega com contexto de 1M, cache barato e preço que incomoda a OpenAI no segmento de programação.
Você está olhando para a fatura da API e vendo o peso de um agente de código rodando o dia inteiro. É exatamente aí que a Alibaba acaba de colocar uma pedra no sapato da concorrência.
Hoje chega ao catálogo o Qwen3 Coder Flash, a versão "enxuta" da linha de programação da Qwen. O nome entrega o jogo: é o Flash, não o Plus. Mas o que importa para quem paga a conta é o que ele cobra pelo que entrega — e o que ele não entrega.
O preço que abre o texto
A conta é simples. Entrada: US$ 0,195 por milhão de tokens. Saída: US$ 0,975 por milhão. E aqui está o detalhe que faz diferença em agente: o cache de prompt sai por US$ 0,039 por milhão — cinco vezes mais barato que a entrada.
Em um agente de código, o histórico de conversa, o snippet do arquivo e as instruções de sistema ficam repetidos em praticamente toda chamada. Quando isso entra no cache, o custo de cada iteração seguinte despenca. É como pagar pedágio só na primeira vez que passa pela praça: a cada nova tool call, o trecho que se repete viaja de carona.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-coder-flash |
| Criador | qwen |
| Preço de entrada | US$ 0.195 / M tokens |
| Preço de saída | US$ 0.975 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text->text |
| Leitura de cache | US$ 0.039 / M (80% de desconto) |
O que o Flash é — e o que ele não é
A descrição oficial trata o Flash como a versão "rápida e econômica" do Qwen3 Coder Plus, focada em agente autônomo com tool calling. É um modelo text-to-text, com 1 milhão de tokens de contexto e corte de conhecimento em junho de 2025.
O catálogo, porém, não publicou nota de inteligência, nem benchmark de código, nem de agentic, nem de raciocínio. E não divulgou parâmetros, velocidade, nem país de origem. Você está comprando um coder com base no preço e na família — não em um número de benchmark para comparar com o do concorrente.
Onde ele se encaixa no tabuleiro
Para situar o Flash, vale olhar quem está na frente hoje. O topo do catálogo em inteligência tem o OpenAI o3 com IQ 31,096 e saída a US$ 8 por milhão — quase oito vezes mais caro que o Flash por token de saída. O gpt-oss-120b (IQ 24,126) sai por US$ 0,17, mas é um modelo aberto, com perfil diferente. O Qwen3 Next 80B A3B Thinking (IQ 16,867) cobra US$ 1,20 de saída. E o Llama 4 Maverick (IQ 14,477) sai por US$ 0,696.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Repare: o Flash cobra mais barato de saída do que o Maverick e o Qwen3 Next Thinking, e mais caro do que o gpt-oss-120b. Mas nenhum desses é um coder especializado com 1M de contexto. É nessa trincheira — modelo de código dedicado, contexto longo, preço agressivo — que o Flash entra.
Para quem vale — e para quem não muda nada
Vale para você se roda agente de código em produção e gasta a maior parte da fatura com saída de tokens. Cenário típico: ferramenta que lê repositório, planeja, chama tools, escreve diffs. Cada turno pesa, e o cache barato muda a equação.
Também vale se você quer um coder secundário para tarefas mais mecânicas — geração de testes, refatoração simples, tradução entre linguagens — sem queimar o orçamento no modelo principal.
Não muda nada para você se o gargalo é raciocínio de código pesado e você já está no o3 ou em um frontier de raciocínio. O Flash é o Flash, não o Plus. Se o seu fluxo depende de planner forte em problemas novos, o Plus (ou o o3) continua sendo o caminho.
Também não muda nada se você precisa comparar números antes de adotar: sem benchmark público de coding neste lançamento, a única forma de saber se ele serve para o seu stack é testando no seu próprio benchmark interno.
O que fazer agora
Se a sua fatura de API tem peso de agente de código, monte um teste A/B entre o Flash e o que você usa hoje. Meça três coisas: qualidade do diff gerado, custo por tarefa concluída e latência por tool call. O cache a US$ 0,039 é o argumento mais forte — mas só se o seu padrão de chamada realmente reutilizar contexto.
Se o teste passar, o Flash vira default para o grosso do volume, e o modelo mais caro fica reservado para os casos em que o agente empaca.
Rode um A/B de uma semana: meça custo por tarefa, não custo por token, e veja se o cache a US$ 0,039 realmente segura o seu padrão de chamadas antes de migrar o agente.
Perguntas frequentes
Quanto custa o Qwen3 Coder Flash por token?
US$ 0,195 por milhão de tokens de entrada, US$ 0,975 por milhão de saída e US$ 0,039 por milhão em cache de prompt. O cache é cinco vezes mais barato que a entrada, o que pesa em agente de código com muito contexto repetido.
O Qwen3 Coder Flash serve para agente autônomo?
A descrição oficial posiciona o modelo como coder agent com tool calling e 1M de contexto. Não há benchmark público de agentic publicado no catálogo neste lançamento, então a validação depende de teste no seu próprio fluxo.
Qwen3 Coder Flash vs Qwen3 Coder Plus, qual a diferença?
O Flash é a versão enxuta e econômica do Plus, segundo a Alibaba. O Plus tende a ser o modelo principal da família; o Flash é o que entra quando o critério é preço e velocidade, não raciocínio máximo.