#100 · Herramienta de Texto y OCR de PDF

Aplicar OCR a páginas seleccionadas de un PDF

Reconoce texto únicamente en las páginas que selecciones. Cada página se rasteriza con PDF.js y Tesseract analiza la imagen para generar un archivo TXT.

Herramienta PDF

Procesamiento local
Espacio publicitario

Cómo usar esta herramienta PDF

  1. Selecciona un PDF.
  2. Escribe las páginas para OCR.
  3. Elige idioma y resolución.
  4. Inicia el reconocimiento y descarga el TXT.

Qué hace esta herramienta

Rasteriza cada página seleccionada y ejecuta OCR con Tesseract.js. La salida es texto plano, no un PDF con capa de texto.

Páginas seleccionadas → canvas → Tesseract OCR → texto por página → TXT.

El OCR consume bastante CPU y memoria. La precisión depende de la resolución, el idioma elegido y la calidad del escaneo.

Formatos y límites compatibles

PDF como entrada; TXT como salida de OCR.

ProcesoPrivacidad
Se ejecuta en el navegadorEl archivo del usuario no se envía a un servidor de Callpdf
Archivos grandesLimitados por la memoria disponible del dispositivo

Consejos para obtener mejores resultados

  • Usa 2× o 3× para escaneos pequeños o borrosos.
  • Selecciona el idioma correcto para mejorar el reconocimiento.
  • Procesa pocas páginas a la vez en móviles.

Preguntas frecuentes

¿Puedo aplicar OCR solo a ciertas páginas del PDF?

Sí. Escribe rangos como 3-6,10 y solo esas páginas se envían al motor OCR local.

¿Qué idiomas de OCR incluye esta página?

Incluye español, inglés y portugués como opciones de la interfaz; Tesseract descarga el modelo necesario al ejecutar el OCR.

¿El resultado del OCR se añade al PDF como capa de texto?

No. Esta herramienta genera un archivo TXT con el texto reconocido.

¿Por qué el OCR tarda más que convertir páginas a imágenes?

Porque además del renderizado, Tesseract analiza visualmente cada página y ejecuta reconocimiento de caracteres.

¿El documento sale del navegador durante el OCR?

El PDF se procesa localmente. Tesseract puede descargar desde CDN sus archivos de ejecución y datos de idioma, pero el documento no se envía a un servicio de OCR.

Módulos utilizados

MóduloUso
pdfjsLectura y renderizado PDF
tessReconocimiento OCR
API del navegadorCanvas, Blob y descarga local

Explora más herramientas PDF

Categorías