FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Voxtral Small 24B custa 30 centavos por áudio: vale o que cobra?

O modelo de áudio da Mistral chega 4 dias depois do lançamento cobrando US$ 0,10 de entrada e US$ 0,30 de saída — barato para transcrição, mas sem nota de QI publicada.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída
US$ 0,10por milhão de tokens de entrada
US$ 0,01cache por milhão de tokens

Você está olhando para um modelo que custa US$ 0,30 por milhão de tokens de saída e provavelmente pensando: "isso é barato ou caro?" Depende do que você está comparando. Para áudio, é uma das tarifas mais agressivas já publicadas por um modelo desse porte. Para texto puro, é um preço intermediário que não impressiona ninguém.

O que a Mistral está vendendo, na prática

O Voxtral Small 24B 2507 foi apresentado como uma extensão do Mistral Small 3 com capacidade de áudio no input. A descrição oficial é direta: transcrição, tradução e compreensão de áudio. O detalhe que importa está na modalidade: text+file+audio->text. Você manda texto, arquivo e áudio; recebe texto. Não é um modelo que fala de volta. Não é um TTS. É um ouvinte que escreve.

Para entender o que isso muda, pense no fluxo antigo: você tinha um modelo de texto bom e barato, e contratava Whisper ou um serviço de transcrição à parte para transformar áudio em texto antes de processar. O Voxtral elimina essa etapa. Você joga o áudio na mesma chamada e o modelo devolve a transcrição — ou a resposta já sobre o conteúdo do áudio.

Preço: o que ficou barato e o que não

Vamos aos números sem maquiagem:

  • Entrada: US$ 0,10 por milhão de tokens
  • Saída: US$ 0,30 por milhão de tokens
  • Cache: US$ 0,01 por milhão de tokens
Ficha técnica — Voxtral Small 24B 2507
CampoValor
Identificadormistralai/voxtral-small-24b-2507
Criadormistralai
Preço de entradaUS$ 0.100 / M tokens
Preço de saídaUS$ 0.300 / M tokens
Janela de contexto33k
Modalidadetext+file+audio->text
Leitura de cacheUS$ 0.010 / M (90% de desconto)

O cache a um centavo é o detalhe que paga a conta para quem roda áudio em volume: se você está reenviando o mesmo podcast, a mesma chamada de suporte, o mesmo arquivo de reunião, o custo de reprocessamento fica quase simbólico. É o tipo de economia que só aparece na segunda ou terceira fatura, mas aparece.

O que não mudou: 32.768 tokens de contexto, sem nota de inteligência publicada no catálogo. Isso significa que você não tem como comparar o desempenho do Voxtral em raciocínio puro contra o o3 ou o Claude Haiku 4.5 — porque a Mistral não submeteu (ou o catálogo não收录) esses números. Para áudio, a régua é outra.

Onde ele entra no tabuleiro

Olhe o topo do catálogo hoje, 3 de novembro de 2025:

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 269 modelos disponíveis no catálogo nesta data.

O o3 da OpenAI lidera com IQ 31 e cobra US$ 8 por milhão de saída. O Claude Haiku 4.5 vem logo abaixo com IQ 29,9 e US$ 5. O gpt-oss-120b, da própria OpenAI, marca IQ 24 cobrando US$ 0,17. O Voxtral Small entra em outra categoria: não está brigando por topo de raciocínio, está brigando por uma fatia específica — entrada multimodal de áudio a preço baixo.

A origem é francesa (Mistral, Paris). O país importa quando você pensa em soberania de dados: empresas europeias com restrição de GDPR podem olhar para um modelo de áudio de fornecedor europeu com outros olhos do que para um serviço rodando em datacenter americano.

Para quem vale

Você atende call center, processa reuniões, transcreve podcasts ou tem um produto que recebe áudio do usuário final? O Voxtral Small 24B provavelmente entra no seu curto-lista. O preço de saída a US$ 0,30 é competitivo para o segmento, e o cache a um centavo torna viável reprocessar arquivos longos sem estourar a fatura.

Você precisa de raciocínio profundo, agentic coding, ou está construindo um agente que toma decisões? Esse não é o modelo. A Mistral não publicou benchmarks de coding ou agentic para ele, e a descrição não promete isso. Para essas tarefas, o tabuleiro continua sendo liderado por o3, Claude Haiku 4.5 e os modelos de raciocínio da Qwen.

Você quer gerar voz? Também não. O Voxtral ouve e escreve. Não fala.

O que fazer com isso amanhã

Se você já paga Whisper ou um serviço de transcrição separado, faça uma conta rápida: pegue seu volume mensal de áudio, multiplique pelos tokens de saída esperados (uma hora de áudio ≈ centenas de milhares de tokens, dependendo da granularidade) e compare com sua fatura atual. Se o número vier perto ou abaixo, vale um piloto de duas semanas. Se vier muito acima, o Whisper ainda tem seu lugar.

Se você nunca processou áudio e está pensando em adicionar essa capability ao produto, o Voxtral é uma porta de entrada barata para testar a hipótese antes de comprometer orçamento com um pipeline dedicado.

O que não vale: trocar seu modelo de texto principal por este. O Voxtral não está aqui para isso.

Em uma frase

Use Voxtral Small 24B quando áudio entra no fluxo e você quer pagar US$ 0,30 por milhão de saída com cache a um centavo; ignore quando o que importa é raciocínio, código ou agentic — para isso, o tabuleiro continua sendo outro.

Perguntas frequentes

O Voxtral Small 24B é gratuito?

Não. O catálogo lista o modelo como pago, com entrada a US$ 0,10 e saída a US$ 0,30 por milhão de tokens. Não há tier gratuito publicado para este modelo.

O Voxtral gera áudio ou só entende?

Só entende. A modalidade é `text+file+audio->text`: você envia áudio, recebe texto. Para gerar voz (TTS) você precisa de outro modelo.

Como o Voxtral se compara ao Whisper?

O catálogo não publicou nota de inteligência nem benchmark de transcrição para o Voxtral, então a comparação direta de qualidade não é possível pelos dados públicos. A diferença prática está no preço-cache (US$ 0,01 por milhão) e na possibilidade de fazer transcrição + análise em uma única chamada, sem pipeline separado.

Leia também