Cómo usar esta herramienta PDF
- Selecciona un archivo PDF válido.
- Define el rango de páginas y las opciones específicas.
- Pulsa el botón de procesamiento y revisa las métricas.
- Descarga el archivo nuevo generado por el navegador.
Evalúa la calidad de reconocimiento OCR de páginas PDF rasterizadas. Produce un informe con confianza media y términos de baja confianza para localizar rápidamente páginas que conviene revisar o volver a escanear.
Evalúa la calidad de reconocimiento OCR de páginas PDF rasterizadas. Produce un informe con confianza media y términos de baja confianza para localizar rápidamente páginas que conviene revisar o volver a escanear.
La confianza de OCR es una señal orientativa, no una garantía de exactitud. Imágenes borrosas, tablas y tipografías decorativas pueden reducirla.
PDF como entrada y JSON como salida. Cada página seleccionada se rasteriza antes de pasarla por Tesseract.js; archivos grandes pueden tardar y consumir memoria.
| Entrada | PDF (.pdf) |
|---|---|
| Salida | JSON |
| Procesamiento | Local en el navegador |
El informe calcula la confianza media de Tesseract y enumera palabras por debajo del umbral de confianza.
Indica que el motor tiene dudas importantes sobre esas palabras; son buenos candidatos para una revisión manual.
El documento se procesa en el navegador. Los recursos del motor OCR se cargan desde la biblioteca, pero el archivo PDF no se envía como contenido.
Sí. Es recomendable usar un rango para reducir tiempo y memoria.
No. Es una métrica orientativa; nombres, cifras, tablas o imágenes degradadas pueden requerir comprobación manual.
| Módulo | Uso |
|---|---|
| PDF.js / pdf-lib / Tesseract.js | Solo se cargan los componentes necesarios para esta herramienta. |
| Blob API | Genera el archivo de salida descargable sin reutilizar el original sin cambios. |