#108 · Herramienta de Texto y OCR de PDF

Extraer URLs de PDF

Extrae URLs escritas directamente en el contenido del PDF y genera un inventario por página. Resulta útil para revisar referencias, migrar documentos o detectar enlaces visibles.

Herramienta PDF

Procesamiento local
páginas
Espacio publicitario

Cómo usar esta herramienta PDF

  1. Selecciona un único archivo PDF.
  2. Indica Todas, un rango como 1-5 o páginas como 1,3,7.
  3. Pulsa el botón de procesamiento y espera a que termine el análisis local.
  4. Revisa la vista previa y descarga el archivo generado.

Qué hace esta herramienta

Extrae URLs escritas directamente en el contenido del PDF y genera un inventario por página. Resulta útil para revisar referencias, migrar documentos o detectar enlaces visibles.

PDF.js obtiene el texto y una expresión regular identifica cadenas HTTP o HTTPS. Se limpian signos finales habituales y se deduplican las URLs.

Esta herramienta busca URLs visibles en texto. Para enlaces anotados detrás de frases como “sitio web”, usa Extraer enlaces de PDF.

Formatos compatibles

Entrada: PDF con texto. Salida: JSON. No abre, comprueba ni descarga ninguna URL detectada.

ElementoCompatibilidad
EntradaPDF
ProcesamientoLocal en navegador
SalidaJSON

Consejos para obtener mejores resultados

  • Usa Extraer enlaces si el PDF contiene hipervínculos no visibles como URL.
  • Revisa signos de puntuación al final de URLs complejas.
  • No abras enlaces desconocidos sin una comprobación de seguridad independiente.

Preguntas frecuentes

¿Cómo sacar todas las URLs visibles de un PDF?

Carga el PDF y procesa las páginas. Se buscan cadenas que empiecen por http:// o https:// y se exportan sin duplicados.

¿Detecta un enlace si el PDF muestra solo “Visitar sitio” y oculta la URL?

No con la búsqueda de texto visible. Para ese caso usa Extraer enlaces de PDF, que también consulta anotaciones.

¿La herramienta comprueba si las URLs siguen activas?

No. No hace solicitudes de red ni valida el estado HTTP de los enlaces.

¿Puedo saber en qué página estaba cada URL?

Sí. El JSON registra las páginas en las que se encontró cada dirección.

¿Se procesan localmente los documentos?

Sí. PDF.js analiza el PDF dentro del navegador y no sube el archivo.

Resumen técnico

MóduloUso
PDF.jsLectura y extracción de páginas
Blob APIGeneración del archivo descargable

Explora más herramientas PDF

Categorías de herramientas PDF