Cómo usar esta herramienta PDF
- Selecciona un único archivo PDF.
- Indica Todas, un rango como 1-5 o páginas como 1,3,7.
- Pulsa el botón de procesamiento y espera a que termine el análisis local.
- Revisa la vista previa y descarga el archivo generado.
Obtén el contenido textual de un PDF como JSON estructurado por páginas. El resultado incluye texto, número de caracteres y número aproximado de palabras para integraciones o análisis posteriores.
Obtén el contenido textual de un PDF como JSON estructurado por páginas. El resultado incluye texto, número de caracteres y número aproximado de palabras para integraciones o análisis posteriores.
El JSON refleja la capa de texto disponible; no reconstruye tablas ni jerarquías semánticas complejas.
Entrada: PDF con texto seleccionable. Salida: JSON UTF-8. Los PDF escaneados requieren OCR previo.
| Elemento | Compatibilidad |
|---|---|
| Entrada | |
| Procesamiento | Local en navegador |
| Salida | JSON |
Incluye información básica del archivo y una matriz pages con número de página, texto, caracteres y recuento aproximado de palabras.
Sí. El archivo es JSON UTF-8 estándar y puede utilizarse como entrada para procesos posteriores.
No. Convierte la capa de texto por página; no reconstruye tablas ni formularios como esquemas semánticos.
La página aparece con texto vacío. Para contenido escaneado necesitas OCR.
Sí. PDF.js lee el archivo en tu navegador y el JSON se crea localmente.
| Módulo | Uso |
|---|---|
| PDF.js | Lectura y extracción de páginas |
| Blob API | Generación del archivo descargable |