Voxtral Small 24B custa 30 centavos por áudio: vale o que cobra?
O modelo de áudio da Mistral chega 4 dias depois do lançamento cobrando US$ 0,10 de entrada e US$ 0,30 de saída — barato para transcrição, mas sem nota de QI publicada.
Você está olhando para um modelo que custa US$ 0,30 por milhão de tokens de saída e provavelmente pensando: "isso é barato ou caro?" Depende do que você está comparando. Para áudio, é uma das tarifas mais agressivas já publicadas por um modelo desse porte. Para texto puro, é um preço intermediário que não impressiona ninguém.
O que a Mistral está vendendo, na prática
O Voxtral Small 24B 2507 foi apresentado como uma extensão do Mistral Small 3 com capacidade de áudio no input. A descrição oficial é direta: transcrição, tradução e compreensão de áudio. O detalhe que importa está na modalidade: text+file+audio->text. Você manda texto, arquivo e áudio; recebe texto. Não é um modelo que fala de volta. Não é um TTS. É um ouvinte que escreve.
Para entender o que isso muda, pense no fluxo antigo: você tinha um modelo de texto bom e barato, e contratava Whisper ou um serviço de transcrição à parte para transformar áudio em texto antes de processar. O Voxtral elimina essa etapa. Você joga o áudio na mesma chamada e o modelo devolve a transcrição — ou a resposta já sobre o conteúdo do áudio.
Preço: o que ficou barato e o que não
Vamos aos números sem maquiagem:
- Entrada: US$ 0,10 por milhão de tokens
- Saída: US$ 0,30 por milhão de tokens
- Cache: US$ 0,01 por milhão de tokens
| Campo | Valor |
|---|---|
| Identificador | mistralai/voxtral-small-24b-2507 |
| Criador | mistralai |
| Preço de entrada | US$ 0.100 / M tokens |
| Preço de saída | US$ 0.300 / M tokens |
| Janela de contexto | 33k |
| Modalidade | text+file+audio->text |
| Leitura de cache | US$ 0.010 / M (90% de desconto) |
O cache a um centavo é o detalhe que paga a conta para quem roda áudio em volume: se você está reenviando o mesmo podcast, a mesma chamada de suporte, o mesmo arquivo de reunião, o custo de reprocessamento fica quase simbólico. É o tipo de economia que só aparece na segunda ou terceira fatura, mas aparece.
O que não mudou: 32.768 tokens de contexto, sem nota de inteligência publicada no catálogo. Isso significa que você não tem como comparar o desempenho do Voxtral em raciocínio puro contra o o3 ou o Claude Haiku 4.5 — porque a Mistral não submeteu (ou o catálogo não收录) esses números. Para áudio, a régua é outra.
Onde ele entra no tabuleiro
Olhe o topo do catálogo hoje, 3 de novembro de 2025:
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O o3 da OpenAI lidera com IQ 31 e cobra US$ 8 por milhão de saída. O Claude Haiku 4.5 vem logo abaixo com IQ 29,9 e US$ 5. O gpt-oss-120b, da própria OpenAI, marca IQ 24 cobrando US$ 0,17. O Voxtral Small entra em outra categoria: não está brigando por topo de raciocínio, está brigando por uma fatia específica — entrada multimodal de áudio a preço baixo.
A origem é francesa (Mistral, Paris). O país importa quando você pensa em soberania de dados: empresas europeias com restrição de GDPR podem olhar para um modelo de áudio de fornecedor europeu com outros olhos do que para um serviço rodando em datacenter americano.
Para quem vale
Você atende call center, processa reuniões, transcreve podcasts ou tem um produto que recebe áudio do usuário final? O Voxtral Small 24B provavelmente entra no seu curto-lista. O preço de saída a US$ 0,30 é competitivo para o segmento, e o cache a um centavo torna viável reprocessar arquivos longos sem estourar a fatura.
Você precisa de raciocínio profundo, agentic coding, ou está construindo um agente que toma decisões? Esse não é o modelo. A Mistral não publicou benchmarks de coding ou agentic para ele, e a descrição não promete isso. Para essas tarefas, o tabuleiro continua sendo liderado por o3, Claude Haiku 4.5 e os modelos de raciocínio da Qwen.
Você quer gerar voz? Também não. O Voxtral ouve e escreve. Não fala.
O que fazer com isso amanhã
Se você já paga Whisper ou um serviço de transcrição separado, faça uma conta rápida: pegue seu volume mensal de áudio, multiplique pelos tokens de saída esperados (uma hora de áudio ≈ centenas de milhares de tokens, dependendo da granularidade) e compare com sua fatura atual. Se o número vier perto ou abaixo, vale um piloto de duas semanas. Se vier muito acima, o Whisper ainda tem seu lugar.
Se você nunca processou áudio e está pensando em adicionar essa capability ao produto, o Voxtral é uma porta de entrada barata para testar a hipótese antes de comprometer orçamento com um pipeline dedicado.
O que não vale: trocar seu modelo de texto principal por este. O Voxtral não está aqui para isso.
Use Voxtral Small 24B quando áudio entra no fluxo e você quer pagar US$ 0,30 por milhão de saída com cache a um centavo; ignore quando o que importa é raciocínio, código ou agentic — para isso, o tabuleiro continua sendo outro.
Perguntas frequentes
O Voxtral Small 24B é gratuito?
Não. O catálogo lista o modelo como pago, com entrada a US$ 0,10 e saída a US$ 0,30 por milhão de tokens. Não há tier gratuito publicado para este modelo.
O Voxtral gera áudio ou só entende?
Só entende. A modalidade é `text+file+audio->text`: você envia áudio, recebe texto. Para gerar voz (TTS) você precisa de outro modelo.
Como o Voxtral se compara ao Whisper?
O catálogo não publicou nota de inteligência nem benchmark de transcrição para o Voxtral, então a comparação direta de qualidade não é possível pelos dados públicos. A diferença prática está no preço-cache (US$ 0,01 por milhão) e na possibilidade de fazer transcrição + análise em uma única chamada, sem pipeline separado.