Baidu lança OCR a US$ 0,68 por milhão de entrada — e grátis na porta de trás
Qianfan-OCR-Fast chega hoje em duas versões: uma paga e outra com tarifa zero, mirando o gargalo de quem digitaliza documento em escala.
O que está em jogo hoje
A conta de API de quem processa documento em volume tem três vilões: o token de entrada, o token de saída e a qualidade do OCR. A Baidu entrou nessa briga HOJE com o Qianfan-OCR-Fast, um modelo multimodal treinado especificamente para reconhecimento óptico de caracteres — não é um modelo de uso geral com OCR de brinde. A descrição oficial deixa isso explícito: dados de treino dedicados a OCR, com a inteligência multimodal preservada como plano de fundo.
A pergunta que importa é simples: quanto custa extrair texto de uma imagem, e quanto custa errar?
O preço, traduzido
A versão paga cobra US$ 0,68 por milhão de tokens de entrada e US$ 2,81 por milhão de tokens de saída. Janela de contexto: 65.536 tokens. Modalidade: texto e imagem gerando texto — ou seja, você manda a foto do documento e recebe o texto reconhecido.
Em paralelo, a Baidu soltou a variante :free, com tarifa zero em ambas as direções e a mesma janela de contexto. É a mesma arquitetura, mesma especialização, só que sem cobrança. Para quem roda pipeline com fila grande, isso muda a conta no fim do mês.
| Campo | Valor |
|---|---|
| Identificador | moonshotai/kimi-k2.6 |
| Criador | moonshotai |
| Preço de entrada | US$ 0.950 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.160 / M (83% de desconto) |
Onde ele se encaixa no tabuleiro
Olhe para o topo do catálogo hoje: o Gemini 3.1 Pro Preview lidera o índice de inteligência com 47,7 e cobra US$ 12 por milhão de saída. O GPT-5.3-Codex vem logo atrás, com IQ de 45,5 e US$ 14 por milhão de saída. O Xiaomi MiMo-V2-Omni, também chinês e multimodal, cobra US$ 2 por milhão de saída — e mesmo assim é mais caro do que a saída do Qianfan-OCR-Fast.
A diferença é brutal: a saída do OCR da Baidu custa cerca de um quarto do que o MiMo cobra, e menos de um quarto do que cobram Gemini e GPT-5.3-Codex. Mas atenção: esses três rivais são modelos de uso geral medidos por índice de inteligência geral. O Qianfan-OCR-Fast não tem IQ publicado no catálogo — e isso não é furo de transparência, é a natureza da proposta. É uma ferramenta especializada, não um generalista.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Kimi K2.6 (o novo) | — | 0.95 | 4 | 262k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| MiMo-V2-Omni | 35.9 | 0.4 | 2 | 262k |
Para quem vale — e para quem não muda nada
Vale para você se: o seu gargalo é extrair texto de PDF escaneado, nota fiscal, contrato, formulário ou qualquer documento que chega como imagem. Volume alto, onde cada centavo por token multiplica por milhões. A versão gratuita elimina o custo variável; a paga dá previsibilidade sem amarrar o orçamento.
Não muda nada para você se: você precisa de raciocínio geral, codificação ou agente — o índice de inteligência do catálogo não cobre esse modelo, e a descrição não sugere uso nessas frentes. Para essas tarefas, o tabuleiro segue o mesmo: Gemini 3.1 Pro Preview no topo por IQ, GPT-5.3-Codex logo abaixo, MiMo-V2-Omni como opção chinesa multimodal de uso geral.
A linha completa da Baidu hoje
O pacote não veio sozinho. A versão :free é a outra peça do lançamento, e a tabela abaixo mostra a família completa.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Kimi K2.6 (free) | 0 | 0 | 262k |
Para quem está montando pipeline de digitalização, a leitura prática é direta: teste a versão gratuita primeiro, meça acurácia no seu tipo de documento específico, e só pague se a taxa de erro justificar o custo. Para quem já tem contrato com Gemini ou GPT-5.3-Codex e usa o OCR como acessório, o Qianfan-OCR-Fast provavelmente não substitui o generalista — mas pode rodar em paralelo para o tráfego de alto volume e baixo risco, deixando o modelo caro para os casos onde a interpretação multimodal importa de verdade.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Se o seu custo de API está dominado por OCR em escala, roteie esse tráfego para a versão gratuita do Qianfan-OCR-Fast e reserve os modelos generalistas caros para o que exige raciocínio multimodal de verdade.
Perguntas frequentes
Quanto custa o Qianfan-OCR-Fast da Baidu?
A versão paga cobra US$ 0,68 por milhão de tokens de entrada e US$ 2,81 por milhão de tokens de saída, com janela de contexto de 65.536 tokens. Existe também uma variante gratuita com tarifa zero nas duas direções.
O Qianfan-OCR-Fast serve para tarefas que não sejam OCR?
A descrição do modelo indica treinamento especializado em OCR, preservando capacidade multimodal geral como plano de fundo. O catálogo não publica índice de inteligência, codificação ou uso agêntico para ele — então, para essas frentes, os generalistas do topo do catálogo seguem sendo a referência.
Como o preço do OCR da Baidu se compara com Gemini e GPT-5.3-Codex?
A saída do Qianfan-OCR-Fast custa US$ 2,81 por milhão de tokens, contra US$ 12 do Gemini 3.1 Pro Preview e US$ 14 do GPT-5.3-Codex. São modelos de categorias diferentes — o da Baidu é especializado em OCR, os outros são generalistas com IQ medido — mas, em preço bruto por token de saída, a diferença é de 4x a 5x.