Cómo usar esta herramienta PDF
- Selecciona un PDF.
- Escribe las páginas para OCR.
- Elige idioma y resolución.
- Inicia el reconocimiento y descarga el TXT.
Reconoce texto únicamente en las páginas que selecciones. Cada página se rasteriza con PDF.js y Tesseract analiza la imagen para generar un archivo TXT.
Rasteriza cada página seleccionada y ejecuta OCR con Tesseract.js. La salida es texto plano, no un PDF con capa de texto.
El OCR consume bastante CPU y memoria. La precisión depende de la resolución, el idioma elegido y la calidad del escaneo.
PDF como entrada; TXT como salida de OCR.
| Proceso | Privacidad |
|---|---|
| Se ejecuta en el navegador | El archivo del usuario no se envía a un servidor de Callpdf |
| Archivos grandes | Limitados por la memoria disponible del dispositivo |
Sí. Escribe rangos como 3-6,10 y solo esas páginas se envían al motor OCR local.
Incluye español, inglés y portugués como opciones de la interfaz; Tesseract descarga el modelo necesario al ejecutar el OCR.
No. Esta herramienta genera un archivo TXT con el texto reconocido.
Porque además del renderizado, Tesseract analiza visualmente cada página y ejecuta reconocimiento de caracteres.
El PDF se procesa localmente. Tesseract puede descargar desde CDN sus archivos de ejecución y datos de idioma, pero el documento no se envía a un servicio de OCR.
| Módulo | Uso |
|---|---|
| pdfjs | Lectura y renderizado PDF |
| tess | Reconocimiento OCR |
| API del navegador | Canvas, Blob y descarga local |