OCR grátis da Baidu entra no catálogo com 65k de contexto
Modelo especializado em leitura de imagem roda sem cobrança, mas não tem nota de inteligência nem benchmark de código — só serve para o que foi treinado.
Você provavelmente não vai colocar o Qianfan-OCR-Fast no mesmo lugar onde está o Gemini 3.1 Pro Preview. Nem deveria. A pergunta que importa é outra: vale a pena ter um modelo desses rodando de graça no seu pipeline?
O que ele é, de verdade
A Baidu publicou no catálogo, em 20 de abril, um modelo com uma única missão: ler texto em imagem. A descrição oficial é direta — "purpose-built for OCR" — e o nome não esconde nada. É a versão rápida de um OCR anterior, com a promessa de ganho de desempenho sem perder a base multimodal que a Qianfan já tinha.
A modalidade é text+image->text: você manda imagem (e texto opcional) e recebe texto de volta. O contexto é de 65.536 tokens, mais do que a maioria dos documentos que alguém jogaria num extrator. E o preço é o que define o resto da conversa: zero na entrada, zero na saída. É o único campo free: true que aparece na ficha deste modelo.
O que os dados não dizem
Aqui começa o cuidado. O índice de inteligência veio vazio. O benchmark de código, o agentic, o blended, a velocidade — todos sem valor. O catálogo não publicou.
Não dá para escrever "o modelo é bom em X" sem dado. O que dá para dizer é o seguinte: ele foi treinado para uma tarefa específica, e benchmarks gerais não são o critério certo para avaliá-lo. Quem precisa medir qualidade de OCR precisa testar com os próprios documentos — notas de fiscal, recibos, carteirinhas, PDFs escaneados. É o tipo de modelo em que a avaliação caseira vale mais que qualquer ranking.
Onde ele se encaixa no tabuleiro
Olha o topo do catálogo hoje: o Gemini 3.1 Pro Preview lidera com IQ 47,7 e custa US$ 12 por milhão de saída. O GPT-5.3-Codex vem logo atrás a US$ 14. O DeepSeek V4 Pro é o mais barato acima de IQ 45, a US$ 1,74.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
| MiMo-V2.5 | 38.0 | 0.28 |
O Qianfan-OCR-Fast não está nessa disputa. Não está nem no ranking. É uma ferramenta de prateleira específica — o equivalente a um leitor de código de barras num supermercado que também vende carne importada. Você não compara o leitor com o açougueiro.
| Campo | Valor |
|---|---|
| Identificador | baidu/qianfan-ocr-fast:free |
| Criador | baidu |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 66k |
| Modalidade | text+image->text |
Para quem vale
- Equipes que precisam processar alto volume de documentos escaneados e querem zerar o custo da camada de extração.
- Produtos que já têm um LLM forte rodando para raciocínio e querem delegar só a parte chata — passar imagem para texto — para algo especializado.
- Times que testam OCR há meses e estão cansados de pagar por um modelo geral para fazer trabalho de extrator.
Para quem não muda nada
- Quem precisa de um modelo de uso geral (escrever, raciocinar, programar). Esse não é o lugar.
- Quem precisa de OCR com nota publicada para comparar com outros candidatos. Aqui você vai no teste empírico.
- Quem opera em jurisdições com restrição de dados sensíveis em provedores chineses — o criador é Baidu, e o dado de país de origem não foi publicado na ficha, mas o criador é.
A implicação prática
Se você já tem um pipeline de extração de texto de imagem, vale rodar o Qianfan-OCR-Fast por uma semana em paralelo com o que está usando hoje. Se a acurácia nos seus documentos for parecida e o custo cair para zero, a conta é simples. Se for pior, você perdeu uma semana e aprendeu que grátis não basta quando o erro custa mais que a fatura da API.
O catálogo tem 441 modelos listados hoje, 60 criadores diferentes. Modelos gratuitos e especializados são uma categoria própria — não competem com os topos de IQ, competem com a sua planilha de custos. Trate como isso.
Use o Qianfan-OCR-Fast como peça de OCR num pipeline maior; não tente substituir um modelo de uso geral por ele, e meça a acurácia nos seus próprios documentos antes de migrar.
Perguntas frequentes
O Baidu Qianfan-OCR-Fast é realmente grátis?
Sim. Tanto a entrada quanto a saída estão com preço zero por milhão de tokens na ficha do catálogo. O contexto máximo é de 65.536 tokens e a modalidade é text+image->text.
Esse modelo serve para programar ou raciocinar?
Não. A descrição oficial diz que ele foi treinado especificamente para OCR. Os campos de IQ, coding, agentic e velocidade vieram sem valor no catálogo, e a comparação com modelos como Gemini 3.1 Pro Preview ou GPT-5.3-Codex não se aplica.
Como saber se ele é bom no que faz?
Testando com os seus próprios documentos. Como o catálogo não publicou benchmark de OCR, a única forma confiável de avaliar é rodar em paralelo com o que você usa hoje e comparar acurácia nos casos reais — recibos, notas fiscais, PDFs escaneados, carteirinhas.