Cómo usar esta herramienta PDF
- Selecciona un único archivo PDF.
- Indica Todas, un rango como 1-5 o páginas como 1,3,7.
- Pulsa el botón de procesamiento y espera a que termine el análisis local.
- Revisa la vista previa y descarga el archivo generado.
Identifica líneas que probablemente funcionan como títulos o encabezados usando el tamaño de fuente, la longitud y la posición del texto. Exporta una lista por página para revisar la estructura del documento.
Identifica líneas que probablemente funcionan como títulos o encabezados usando el tamaño de fuente, la longitud y la posición del texto. Exporta una lista por página para revisar la estructura del documento.
La detección es heurística. Un PDF puede no contener etiquetas semánticas de encabezado, por lo que conviene revisar el resultado.
Entrada: PDF con texto. Salida: JSON con página, texto y tamaño estimado. No identifica encabezados en páginas que solo contienen imágenes.
| Elemento | Compatibilidad |
|---|---|
| Entrada | |
| Procesamiento | Local en navegador |
| Salida | JSON |
La herramienta compara tamaños de texto y longitud de líneas para señalar candidatos a encabezado por página.
No necesariamente. Muchos PDF no guardan jerarquía semántica; el resultado es una estimación visual basada en el texto.
No si el documento carece de capa de texto. Primero debes aplicar OCR.
Si usan el mismo tamaño de fuente que el cuerpo, están fragmentados o convertidos en imagen, la heurística puede no reconocerlos.
Permite revisar estructura, preparar un índice o analizar el documento con otras herramientas sin modificar el PDF.
| Módulo | Uso |
|---|---|
| PDF.js | Lectura y extracción de páginas |
| Blob API | Generación del archivo descargable |