FalaVIP IA o que os modelos custam,
medido todo dia
Preços

Pareto custa US$ 2,50, mas voz ainda não fecha a conta

O novo modelo chega com contexto de 262.144 tokens e saída a US$ 7,50 por milhão. Já a promessa de comparar APIs de voz por hora esbarra na ausência de preços de áudio nos dados disponíveis.

Redação FalaVIP IA 4 min de leitura
US$ 2,50por milhão de tokens de entrada do Pareto
US$ 7,50por milhão de tokens de saída do Pareto
262.144tokens na janela de contexto do Pareto

O Pareto chega ao OpenRouter custando US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. A janela de contexto é de 262.144 tokens. Para quem escolhe modelo para produção, esse é o dado concreto do lançamento — e ele não confirma a parte mais chamativa da pauta: uma tabela confiável de custos de voz por hora.

O anúncio de conversas por voz com o Gemini 3.8 Live coloca a modalidade no centro da discussão. Mas os dados de preço disponíveis registram o Google Gemini 3.8 Flash como uma API cobrada por tokens, não como um produto Live com tarifa de áudio por hora. A diferença importa porque uma arquitetura de atendimento telefônico não é orçada da mesma forma que um chatbot de texto.

O Pareto amplia o espaço, não derruba o preço

O novo modelo oferece contexto suficiente para aplicações corporativas com instruções extensas, histórico de conversa e documentos de apoio. Ainda assim, a entrada a US$ 2,50 por milhão e a saída a US$ 7,50 por milhão posicionam o Pareto acima de várias alternativas de menor custo no mesmo catálogo.

O modelo gratuito Union Alpha, lançado no dia anterior, aparece com entrada e saída a US$ 0 e contexto de 262.144 tokens. O Qwen3.8 27B também tem uma variante gratuita, com a mesma janela de contexto, enquanto sua versão paga cobra US$ 0,214 por milhão de tokens de entrada e US$ 2,55 por milhão de saída.

Isso não transforma o Pareto em uma opção ruim. Significa que o preço precisa ser justificado por qualidade, estabilidade, limites operacionais ou desempenho em uma tarefa específica — atributos que não aparecem nas fichas fornecidas para o modelo. Para um CTO, contexto grande sozinho não paga a fatura.

Gemini 3.8 Flash tem preço de texto, não de voz

No OpenRouter, o Gemini 3.8 Flash aparece com entrada a US$ 0,75 por milhão de tokens, saída a US$ 3,75 e cache a US$ 0,075. A janela de contexto chega a 1.048.576 tokens. A versão batch reduz entrada para US$ 0,375 e saída para US$ 1,875, com cache a US$ 0,0375.

Esses números ajudam a dimensionar cargas textuais e processamento assíncrono. Eles não permitem converter uma ligação em uma tarifa horária de áudio. Faltam, nos dados, a unidade de cobrança da voz, o volume de áudio processado, a participação de entrada e saída e qualquer custo separado de síntese ou reconhecimento.

O vídeo do canal Inteligência Mil Grau apresenta o Gemini 3.8 Live e a construção de um chat de voz, mas a existência desse fluxo não substitui uma tabela de preços. A faixa de custo por hora mencionada na pauta não pode ser conferida contra os preços listados no OpenRouter.

A conta de produção continua sensível ao modelo

As mudanças de preço dos últimos dias reforçam o risco de montar uma arquitetura com uma cotação congelada. O DeepSeek V4 Pro 0813 aparece em registros que mostram alta de US$ 1,738 para US$ 2,95 por milhão, queda de US$ 2,95 para US$ 1,738 e outros ajustes no mesmo período. O Kimi K3 subiu de US$ 13,283 para US$ 15, enquanto o Nemotron 3 Ultra passou de US$ 2,4 para US$ 3,125.

Também houve reduções: o Meta Muse Glimmer 30B caiu de US$ 1,5 para US$ 1,1, e o DeepSeek V4 Flash 0423 foi de US$ 0,177 para US$ 0,14 em um dos registros. A própria repetição de movimentos para um mesmo modelo mostra que o preço observado pode depender da versão ou do momento da consulta.

Para quem opera texto, o Pareto entra como alternativa de contexto amplo e preço intermediário entre ofertas do catálogo. Para quem opera voz, nada nos dados permite afirmar que ele, o Gemini 3.8 Live ou qualquer concorrente tenha custo horário comparável.

Quem deve prestar atenção

O Pareto interessa a equipes que precisam de contexto extenso e aceitam testar uma tarifa de saída maior. Também pode entrar em uma shortlist corporativa quando o custo de carregar instruções é relevante, mas a decisão exige benchmark próprio: não há notas de inteligência, código ou uso agêntico associadas ao modelo.

Ele muda pouco para quem procura simplesmente a menor fatura por token. Nesse grupo, há opções gratuitas e modelos com entrada e saída bem abaixo do Pareto. Também não muda a decisão de quem precisa de uma API de voz com preço previsível por hora, porque essa informação não está disponível nos dados apresentados.

Se você usa voz em produção, trate o preço por token do Gemini 3.8 Flash como referência de texto, não como orçamento de ligação. Antes de trocar a arquitetura, peça a tarifa específica de áudio, meça o consumo real por sessão e só então compare com o Pareto ou com outra API.

Em uma frase

O Pareto é uma opção de contexto amplo a US$ 2,50 na entrada, mas qualquer decisão sobre voz exige uma tabela de áudio que os preços disponíveis ainda não fornecem.

Perguntas frequentes

Quanto custa o Pareto por milhão de tokens?

O Pareto custa US$ 2,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída no OpenRouter. Sua janela de contexto é de 262.144 tokens.

O preço do Gemini 3.8 Flash indica quanto custa uma hora de voz?

Não. O OpenRouter lista preços por token para o Gemini 3.8 Flash, mas os dados disponíveis não informam uma tarifa de áudio por hora nem os parâmetros necessários para fazer essa conversão.

O Pareto é mais barato que as opções gratuitas?

Não em preço nominal. O Union Alpha aparece com entrada e saída a US$ 0, e o Qwen3.8 27B tem uma variante gratuita; o Pareto cobra US$ 2,50 na entrada e US$ 7,50 na saída.

Fontes

Leia também