Cómo usar esta herramienta PDF
- Selecciona un único archivo PDF.
- Indica Todas, un rango como 1-5 o páginas como 1,3,7.
- Pulsa el botón de procesamiento y espera a que termine el análisis local.
- Revisa la vista previa y descarga el archivo generado.
Reconoce el texto visible de páginas escaneadas y crea un informe TXT que puedes buscar, copiar o archivar. El OCR se ejecuta localmente en el navegador y admite selección de páginas.
Reconoce el texto visible de páginas escaneadas y crea un informe TXT que puedes buscar, copiar o archivar. El OCR se ejecuta localmente en el navegador y admite selección de páginas.
El OCR depende de la nitidez, el idioma y la orientación del escaneo. No modifica el PDF original ni crea una capa OCR dentro del PDF.
Entrada: PDF con páginas escaneadas o mixtas. Salida: informe TXT. Los PDF cifrados sin contraseña, páginas muy grandes o escaneos poco legibles pueden fallar o requerir más memoria.
| Elemento | Compatibilidad |
|---|---|
| Entrada | |
| Procesamiento | Local en navegador |
| Salida | TXT |
Sí. Esta herramienta renderiza las páginas y ejecuta el OCR en tu navegador; el archivo no se envía a un servidor.
No. Genera un informe TXT buscable con el texto reconocido. No inserta una capa de texto dentro del PDF original.
Puedes indicar Todas, rangos como 1-4 o una lista como 1,3,7. Las páginas fuera del documento se ignoran con un aviso.
Tesseract trabaja sobre la imagen renderizada. Baja resolución, inclinación, columnas complejas y fondos con ruido reducen la precisión.
PDF.js puede rechazar archivos cifrados, corruptos o incompatibles. En ese caso la herramienta muestra un error y no genera un resultado falso.
| Módulo | Uso |
|---|---|
| PDF.js | Lectura y extracción de páginas |
| Tesseract.js | OCR local de imágenes renderizadas |
| Blob API | Generación del archivo descargable |