Cómo usar el OCR
- Sube una imagen, arrástrala o usa la cámara directamente desde el navegador si tu dispositivo tiene una.
- Recorta la región de interés si solo necesitas una parte de la imagen, por ejemplo un párrafo dentro de una foto de una página completa.
- Aplica filtros si el texto es difícil de leer: brillo, contraste, rotación, escala de grises, binarizado o invertir colores mejoran la precisión en fotos con mala iluminación o fondos con textura.
- Elige el idioma del texto: español, inglés, español + inglés combinado, francés, alemán, italiano, portugués o catalán.
- Lanza el escaneo y copia el resultado o descárgalo en TXT, JSON o CSV.
Cómo interpretar el resultado
El OCR muestra un nivel de confianza por palabra reconocida y permite ver las cajas delimitadoras sobre la imagen original:
- Confianza superior al 90%: texto impreso nítido, buena iluminación; el resultado suele ser exacto sin revisión.
- Confianza entre 70% y 90%: revisa el texto extraído antes de usarlo, sobre todo números, símbolos o palabras poco frecuentes.
- Confianza por debajo del 70%: foto borrosa, letra manuscrita o fondo con mucho ruido visual; prueba a recortar la región, aumentar el contraste o repetir la foto con mejor luz antes de fiarte del resultado.
Cuándo usar cada filtro
El binarizado (blanco y negro puro) ayuda con fotos de recibos o documentos con fondo amarillento. La escala de grises reduce el ruido de fotos tomadas con el móvil en condiciones de luz irregular. La rotación corrige fotos tomadas en ángulo o con el documento girado.
Qué NO te dice esta herramienta
- No reconoce letra manuscrita con fiabilidad: Tesseract está entrenado principalmente para texto impreso, no para caligrafía a mano.
- No estructura automáticamente el resultado como una tabla o un formulario; extrae el texto plano y su posición, no la relación entre columnas de una tabla compleja.
- El primer escaneo de cada sesión tarda algo más porque el navegador descarga el motor de reconocimiento; los siguientes son más rápidos.
- No sustituye un sistema de captura de facturas o documentos a escala con validación automática de campos, que suele combinar OCR con reglas de negocio específicas por proveedor.
Si lo que buscas es automatizar la lectura de documentos o facturas de forma recurrente en tu negocio, en automatización sin código con Make, Zapier o n8n explico cómo conectar este tipo de procesos con el resto de tus herramientas, y en automatización con Python y APIs cubro la opción de construir algo a medida cuando el volumen lo justifica.
Si necesitas digitalizar documentos de forma recurrente y conectarlos con tu facturación o tu CRM, en automatización con IA tienes el detalle de cómo lo planteo para pymes.
Casos de uso habituales
- Recibos y tickets de gastos: fotografía el ticket con el móvil y extrae el texto para copiarlo a tu hoja de gastos, sin teclear cada importe a mano.
- Capturas de pantalla con texto: extraer un párrafo de una imagen compartida por WhatsApp o de un PDF que no permite seleccionar texto.
- Carteles y señalética en otro idioma: escanea el texto de una foto y cópialo a un traductor aparte cuando viajas.
- Páginas de libros o documentos impresos que necesitas citar o consultar sin volver a escribir el párrafo entero.
Sobre la cámara y la privacidad
Si tu navegador y tu dispositivo lo permiten, puedes capturar la foto directamente desde la cámara sin pasar antes por la galería. El acceso a la cámara lo autoriza tu navegador, no la herramienta, y puedes revocarlo en cualquier momento desde los ajustes del sitio. Como todo el procesamiento posterior ocurre en local, ni la foto ni el texto extraído salen de tu dispositivo salvo que tú mismo decidas descargarlos o copiarlos a otro sitio.
Preguntas frecuentes
¿Se sube mi imagen a algún servidor?
No. Todo el reconocimiento de texto ocurre en tu navegador con Tesseract.js; la imagen no se envía a ningún servidor externo en ningún momento. Es la única de las herramientas de IA de este apartado que funciona 100% en local.
¿Reconoce texto manuscrito?
Con fiabilidad limitada. Tesseract está entrenado principalmente para reconocer texto impreso -libros, documentos, carteles, tickets-; con letra manuscrita el resultado suele tener muchos más errores y conviene revisarlo palabra por palabra antes de darlo por bueno o usarlo en otro sitio.
¿Qué formatos de imagen admite?
Admite los formatos de imagen habituales que reconoce el navegador -JPG, PNG, WebP-, tanto subidos como archivo o arrastrados directamente a la ventana, como capturados con la cámara del dispositivo en el momento, si tu navegador tiene permiso de acceso a ella.
¿Por qué el primer escaneo tarda más que los siguientes?
Porque el navegador tiene que descargar el motor de Tesseract.js y el paquete del idioma elegido la primera vez que lo usas en la sesión. A partir de ahí queda en caché y los siguientes escaneos son notablemente más rápidos.
¿Puedo exportar el resultado a Excel?
Puedes descargar el resultado en formato CSV, que se abre directamente en Excel o Google Sheets sin necesitar conversión adicional, además de TXT para texto plano o JSON si necesitas las coordenadas exactas de cada palabra reconocida sobre la imagen original.
¿Necesitas digitalizar documentos de forma recurrente?
Conecto la lectura de documentos y facturas con tu facturación o tu CRM para que no lo hagas a mano cada vez.
Ver automatización con IA →