OCR: escanea tus facturas
prácticaOCR: un lector de papeles
OCR es un lector de papeles. Le pasas la foto de una factura o del recibo del mercado y te devuelve lo que dice escrito, como texto que puedes copiar y sumar. Viene en dos formas: como librería gratis que corre en tu máquina, Tesseract, la del ejemplo de hoy, y como servicios en internet que cobran por página. Te importa porque la información de tu negocio vive en papeles que alguien pasa a mano. Ese alguien casi siempre eres tú, y esa hora nadie te la paga.
Por qué no se lo dejas al agente
Tu agente también puede mirar la foto. El problema es cómo se equivoca: un modelo leyó un recibo de tres líneas que sumaban 42,50 y reportó 45,20, redondo y con cara de verdad. El OCR es lo contrario: te dice dónde estaba cada dato y te marca cada palabra de la que duda. El error del OCR se nota. El del modelo se ve bien.
# 12,00 + 18,50 + 12,00 = 42,50# lo que reportó: 45,20# el OCR, en cambio, entrega por página:# texto ordenado · posición de cada bloque · confianza por palabraGratis, contra 10,89 dólares a mano
El punto de comparación no es otro software, es tu tiempo: procesar una sola factura a mano cuesta 10,89 dólares, según midió Ardent Partners. Tesseract es gratis, corre en tu computador y no pide cuenta ni internet. La letra chica: gratis en dinero, no en calidad. Para fotos muy difíciles existen servicios de pago que leen mejor y cobran por página. Empieza por lo gratis y sube solo si tu papel lo exige.
# una factura procesada a mano: 10,89 USD (Ardent Partners)# con Tesseract: 0 USD, corre en tu máquina# servicios de pago, si la foto viene difícil: ~4 USD / 1.000 páginasEl OCR no entiende nada
El OCR te devuelve el texto y hasta ahí llega. No sabe cuál renglón es el proveedor ni cuál número es el total. Para eso necesitas una segunda pieza que ordene: en el ejemplo lo hace el script con reglas de búsqueda, y con papeles revueltos lo hace un modelo, el mismo tipo de agente del módulo 3. Son dos piezas, no una. Saberlo hoy te evita la sorpresa después.
Si tu PDF es digital, no lo uses
Te ahorro una decisión. Una factura electrónica que descargaste ya trae el texto adentro: no hay nada que descifrar. PyMuPDF te lo saca directo, en una línea y sin OCR. El OCR guárdalo para fotos y escaneos, donde el texto vive atrapado dentro de una imagen. Las facturas del ejemplo son de esas: imagen pura, sin texto adentro.
# PDF descargado del proveedor -> PyMuPDF saca el texto directo# Foto del celular o escaneo -> Tesseract, letra por letraInstalarlo: un motor y su puente
El OCR del ejemplo se instala igual que las librerías de la clase pasada. Tesseract es el motor: un programa que lee imágenes, instalado una sola vez. pytesseract es el puente para llamarlo desde Python. Y van dos ayudantes: PyMuPDF convierte el PDF en imagen y Pillow, la misma del logo, le sube el contraste para que el motor lea mejor. Dos comandos, cero cuentas, cero llaves.
brew install tesseract tesseract-lang # el motor, con español incluidopip install pytesseract pymupdf pillow # el puente y las dos ayudantes# sin cuenta y sin llave: todo corre en tu máquinaTres fotos y un total
Tres facturas en una carpeta. Le pides a Claude Code que las lea con Tesseract y te sume los totales. Él escribe el script, tú miras correr. Al final sale un número, y ese número es el resultado de la clase: tres papeles que se volvieron algo que se puede sumar. Costo en servicios: cero.
# 1. la carpeta facturas/ con las tres del ejemplo# 2. a Claude Code, tal cual:"lee las tres facturas de facturas/ con Tesseract, sácame proveedor, fecha y total de cada una, y súmame los totales"# 3. el script lo escribe él. Tú lees el total en la terminal.# TOTAL GENERAL: $ 1,460,130 COP · costo del OCR: 0La que no supo leer
Casi siempre una de las tres sale rara: ticket borroso, sello encima del total, letra a mano. El OCR te la marca con confianza baja, y ahí se acaba lo que yo sé. Hoy esas las paso a mano y sigo. No tengo una regla que sirva para todos los casos. Si te sale una, súbela a la comunidad y la miramos.