FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

OCR da Baidu cobra US$ 4,40 por milhão de saída — e ninguém te diz o que ele lê

Qianfan-OCR-Fast é um modelo especializado em extrair texto de imagem. Vale para você? Depende do que você joga nele.

Redação FalaVIP IA 3 min de leitura
US$ 0,68por milhão de tokens de entrada
US$ 2,81por milhão de tokens de saída
65.536tokens de contexto

O que está na mesa

Você está olhando para uma fatura de API e quer saber se vale trocar o extrator de texto que roda hoje por um modelo da Baidu. A resposta curta: talvez — e só se o seu problema for especificamente ler imagem e devolver texto. O Qianfan-OCR-Fast não é um modelo de raciocínio, não é um coder, não é um agente. É uma ferramenta de uma função só, e a conta mostra isso de um jeito curioso.

Lançado em 20 de abril, o modelo completa 20 dias de catálogo. O preço de entrada é US$ 0,68 por milhão de tokens; o de saída, US$ 2,81. Some os dois para uma única chamada curta e você gasta centavos. Some para um pipeline que processa 100 mil notas fiscais por mês e a conversa muda.

O que ele faz, de verdade

A descrição oficial é direta: é um modelo multimodal treinado especificamente para OCR, construído em cima de dados próprios de reconhecimento óptico de caracteres, mas sem perder a capacidade multimodal geral. Em outras palavras, a Baidu pegou um multimodal e apertou o foco na tarefa de "imagem vira texto".

O contexto de 65.536 tokens é o padrão da categoria — espaço de sobra para documentos longos, mas não excepcional. A modalidade text+image->text confirma o escopo: entra texto e imagem, sai texto. Nada de geração de imagem, nada de áudio.

Ficha técnica — Qianfan-OCR-Fast
CampoValor
Identificadorbaidu/qianfan-ocr-fast
Criadorbaidu
Preço de entradaUS$ 0.680 / M tokens
Preço de saídaUS$ 2.81 / M tokens
Janela de contexto66k
Modalidadetext+image->text

O tabuleiro em 10 de maio de 2026

Aqui é onde a conta começa a chiar. O catálogo tem hoje 441 modelos listados, vindos de 60 criadores. Nos últimos 30 dias, 51 modelos novos entraram — ou seja, o mercado não está parado, está trocando de pele.

O topo de inteligência hoje, segundo o índice atual do catálogo, é o Gemini 3.1 Pro Preview, com IQ 47,7 e saída a US$ 12 por milhão. Logo atrás vem o GPT-5.3-Codex, IQ 45,5, US$ 14 de saída. O DeepSeek V4 Pro aparece em terceiro com IQ 45,2 e US$ 1,74 de saída — o mais barato entre os modelos acima de IQ 45.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
MiMo-V2.538.00.28
Entre os 441 modelos disponíveis no catálogo nesta data.

Mas comparar esses modelos com o Qianfan-OCR-Fast pelo IQ é comparar trator com sedan: eles não estão fazendo a mesma corrida. Nenhum desses três é especializado em OCR. O índice de inteligência do Qianfan não foi publicado — e isso já é uma pista. Quando o catálogo não mede, geralmente é porque a régua通用 não se aplica.

Para quem vale

Vale para você se o seu gargalo é transformar imagem em texto estruturado em volume: notas fiscais, recibos, contratos escaneados, formulários preenchidos à mão, placas, cardápios. A especialização tende a pagar o preço em cenários onde o modelo genérico erra demais e você paga retrabalho.

Vale também se você já está no ecossistema Baidu Qianfan e quer manter o fornecedor único. Vale se você precisa de um modelo que aceite texto e imagem na mesma chamada sem montar um pipeline de duas etapas.

Para quem NÃO vale

Não vale se você quer um modelo de uso geral com OCR como feature colateral. Para isso, Gemini, GPT-5.3-Codex e o próprio DeepSeek V4 Pro entregam OCR razoável dentro de um pacote que também escreve, raciocina e programa.

Não vale se você está rodando volumes pequenos e esporádicos — o ganho de precisão especializada raramente compensa a troca de fornecedor para uma nota fiscal por semana. E não vale se você precisa comparar benchmark contra benchmark: o catálogo não publicou IQ, coding, agentic nem raciocínio para esse modelo, então qualquer comparação numérica com os três do topo é chute.

O que você faz com isso

Se OCR é o seu produto, monte um teste cego: pegue 200 amostras reais do seu fluxo, rode no seu pipeline atual e no Qianfan-OCR-Fast, meça taxa de acerto por campo e custo por documento processado. O preço público está aí — US$ 0,68 entrando, US$ 2,81 saindo por milhão de tokens. O que falta medir é o quanto você deixa de gastar em pós-correção quando o modelo erra menos.

Se OCR é só uma peça entre dez, ignore. O custo de mais um fornecedor na pilha costuma comer a economia.

Em uma frase

Use Qianfan-OCR-Fast só se OCR for o seu produto principal; para tudo o mais, um multimodal genérico de ponta já cobre e unifica a fatura.

Perguntas frequentes

Qianfan-OCR-Fast serve para gerar imagem?

Não. A modalidade é text+image->text: entra texto e imagem, sai apenas texto. É um extrator, não um gerador.

Quanto custa rodar o Qianfan-OCR-Fast?

US$ 0,68 por milhão de tokens de entrada e US$ 2,81 por milhão de tokens de saída. O catálogo não publicou preço de cache para este modelo.

Tem benchmark de IQ para o Qianfan-OCR-Fast?

Não. O índice de inteligência não foi publicado no catálogo, então qualquer comparação numérica com Gemini, GPT ou DeepSeek é comparativo fora da régua — eles medem raciocínio geral, não OCR especializado.

Leia também