Cómo usar esta herramienta PDF
- Selecciona un archivo PDF válido.
- Define el rango de páginas y las opciones específicas.
- Pulsa el botón de procesamiento y revisa las métricas.
- Descarga el archivo nuevo generado por el navegador.
Encuentra líneas que aparecen de forma repetida en la parte superior de muchas páginas. Sirve para identificar encabezados, nombres de capítulo, referencias de expediente o texto recurrente antes de limpiar o analizar un PDF.
Encuentra líneas que aparecen de forma repetida en la parte superior de muchas páginas. Sirve para identificar encabezados, nombres de capítulo, referencias de expediente o texto recurrente antes de limpiar o analizar un PDF.
Encabezados con números de página, fechas variables o pequeños cambios pueden no agruparse como una misma línea.
PDF con texto digital como entrada y TXT como informe. No aplica OCR a páginas escaneadas.
| Entrada | PDF (.pdf) |
|---|---|
| Salida | TXT |
| Procesamiento | Local en el navegador |
La herramienta analiza la franja superior y cuenta las líneas normalizadas que aparecen en un porcentaje mínimo de páginas.
Solo si existe una capa de texto. No ejecuta OCR.
70 % suele ser un punto de partida útil. Usa 50 % para documentos con secciones y 90 % para patrones muy constantes.
Sí. Si el texto cambia por una numeración o fecha, puede contabilizarse como variantes distintas.
No. Esta herramienta solo identifica y reporta candidatos repetidos.
| Módulo | Uso |
|---|---|
| PDF.js / pdf-lib / Tesseract.js | Solo se cargan los componentes necesarios para esta herramienta. |
| Blob API | Genera el archivo de salida descargable sin reutilizar el original sin cambios. |