FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

OCR grátis da Baidu entra no catálogo com 65k de contexto

Modelo especializado em leitura de imagem roda sem cobrança, mas não tem nota de inteligência nem benchmark de código — só serve para o que foi treinado.

Redação FalaVIP IA 3 min de leitura
0custo de entrada e saída por milhão de tokens
65.536tokens de contexto
21 diasdesde o lançamento

Você provavelmente não vai colocar o Qianfan-OCR-Fast no mesmo lugar onde está o Gemini 3.1 Pro Preview. Nem deveria. A pergunta que importa é outra: vale a pena ter um modelo desses rodando de graça no seu pipeline?

O que ele é, de verdade

A Baidu publicou no catálogo, em 20 de abril, um modelo com uma única missão: ler texto em imagem. A descrição oficial é direta — "purpose-built for OCR" — e o nome não esconde nada. É a versão rápida de um OCR anterior, com a promessa de ganho de desempenho sem perder a base multimodal que a Qianfan já tinha.

A modalidade é text+image->text: você manda imagem (e texto opcional) e recebe texto de volta. O contexto é de 65.536 tokens, mais do que a maioria dos documentos que alguém jogaria num extrator. E o preço é o que define o resto da conversa: zero na entrada, zero na saída. É o único campo free: true que aparece na ficha deste modelo.

O que os dados não dizem

Aqui começa o cuidado. O índice de inteligência veio vazio. O benchmark de código, o agentic, o blended, a velocidade — todos sem valor. O catálogo não publicou.

Não dá para escrever "o modelo é bom em X" sem dado. O que dá para dizer é o seguinte: ele foi treinado para uma tarefa específica, e benchmarks gerais não são o critério certo para avaliá-lo. Quem precisa medir qualidade de OCR precisa testar com os próprios documentos — notas de fiscal, recibos, carteirinhas, PDFs escaneados. É o tipo de modelo em que a avaliação caseira vale mais que qualquer ranking.

Onde ele se encaixa no tabuleiro

Olha o topo do catálogo hoje: o Gemini 3.1 Pro Preview lidera com IQ 47,7 e custa US$ 12 por milhão de saída. O GPT-5.3-Codex vem logo atrás a US$ 14. O DeepSeek V4 Pro é o mais barato acima de IQ 45, a US$ 1,74.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
MiMo-V2.538.00.28
Entre os 441 modelos disponíveis no catálogo nesta data.

O Qianfan-OCR-Fast não está nessa disputa. Não está nem no ranking. É uma ferramenta de prateleira específica — o equivalente a um leitor de código de barras num supermercado que também vende carne importada. Você não compara o leitor com o açougueiro.

Ficha técnica — Qianfan-OCR-Fast (free)
CampoValor
Identificadorbaidu/qianfan-ocr-fast:free
Criadorbaidu
Preço de entradaUS$ 0.000 / M tokens
Preço de saídaUS$ 0.000 / M tokens
Janela de contexto66k
Modalidadetext+image->text

Para quem vale

  • Equipes que precisam processar alto volume de documentos escaneados e querem zerar o custo da camada de extração.
  • Produtos que já têm um LLM forte rodando para raciocínio e querem delegar só a parte chata — passar imagem para texto — para algo especializado.
  • Times que testam OCR há meses e estão cansados de pagar por um modelo geral para fazer trabalho de extrator.

Para quem não muda nada

  • Quem precisa de um modelo de uso geral (escrever, raciocinar, programar). Esse não é o lugar.
  • Quem precisa de OCR com nota publicada para comparar com outros candidatos. Aqui você vai no teste empírico.
  • Quem opera em jurisdições com restrição de dados sensíveis em provedores chineses — o criador é Baidu, e o dado de país de origem não foi publicado na ficha, mas o criador é.

A implicação prática

Se você já tem um pipeline de extração de texto de imagem, vale rodar o Qianfan-OCR-Fast por uma semana em paralelo com o que está usando hoje. Se a acurácia nos seus documentos for parecida e o custo cair para zero, a conta é simples. Se for pior, você perdeu uma semana e aprendeu que grátis não basta quando o erro custa mais que a fatura da API.

O catálogo tem 441 modelos listados hoje, 60 criadores diferentes. Modelos gratuitos e especializados são uma categoria própria — não competem com os topos de IQ, competem com a sua planilha de custos. Trate como isso.

Em uma frase

Use o Qianfan-OCR-Fast como peça de OCR num pipeline maior; não tente substituir um modelo de uso geral por ele, e meça a acurácia nos seus próprios documentos antes de migrar.

Perguntas frequentes

O Baidu Qianfan-OCR-Fast é realmente grátis?

Sim. Tanto a entrada quanto a saída estão com preço zero por milhão de tokens na ficha do catálogo. O contexto máximo é de 65.536 tokens e a modalidade é text+image->text.

Esse modelo serve para programar ou raciocinar?

Não. A descrição oficial diz que ele foi treinado especificamente para OCR. Os campos de IQ, coding, agentic e velocidade vieram sem valor no catálogo, e a comparação com modelos como Gemini 3.1 Pro Preview ou GPT-5.3-Codex não se aplica.

Como saber se ele é bom no que faz?

Testando com os seus próprios documentos. Como o catálogo não publicou benchmark de OCR, a única forma confiável de avaliar é rodar em paralelo com o que você usa hoje e comparar acurácia nos casos reais — recibos, notas fiscais, PDFs escaneados, carteirinhas.

Leia também