#162 · Conversión y codificación

HTML a texto

Extrae el contenido legible de un fragmento o documento HTML y conviértelo en texto plano. La herramienta elimina scripts, estilos y etiquetas, decodifica entidades como   y conserva separaciones útiles entre bloques. Puedes elegir una salida compacta o mantener saltos de línea para facilitar la reutilización del contenido.

Entrada de texto

Código HTML de origen
Espacio publicitario

Cómo usar esta herramienta de texto

  1. Pega el fragmento o documento HTML en la entrada.
  2. Deja activada la conservación de saltos si quieres separar títulos, párrafos y elementos de lista.
  3. Pulsa «Extraer texto».
  4. Revisa el texto resultante y cópialo o descárgalo.

Qué hace esta herramienta

Obtiene texto legible a partir de HTML y descarta la estructura de marcado. Los elementos script, style, noscript y template se eliminan antes de extraer el contenido.

El navegador analiza la entrada con DOMParser. Después se eliminan nodos no visibles y, si se conservan saltos, se insertan separadores alrededor de etiquetas de bloque antes de normalizar espacios.

El resultado refleja el contenido textual del HTML, no una representación visual exacta del diseño CSS.

Ejemplo

Entrada: <p>Hola <b>mundo</b></p>

Salida: Hola mundo

Casos de uso

  • Recuperar texto de plantillas HTML.
  • Limpiar contenido copiado desde un CMS.
  • Preparar texto para análisis, traducción o edición.

Consejos para obtener mejores resultados

  • Conserva saltos para artículos, listas o documentación.
  • Desactiva los saltos si necesitas una única línea compacta.
  • Comprueba tablas complejas, ya que el texto pierde la relación visual entre columnas.
  • No uses el resultado como sustituto de un sanitizador HTML si necesitas conservar marcado.

Detalles del procesamiento

La entrada se analiza con las capacidades DOM nativas del navegador. Las entidades HTML se decodifican durante el parseo.

No aplica CSS ni reproduce contenido generado dinámicamente por JavaScript; solo procesa el HTML proporcionado.

Preguntas frecuentes

¿Cómo extraer texto de HTML y conservar los párrafos separados?

Mantén activada la opción de conservar saltos; la herramienta añade separaciones alrededor de elementos de bloque antes de limpiar los espacios.

¿Se eliminan también las etiquetas script y style al pasar HTML a texto?

Sí. El contenido de script, style, noscript y template se elimina antes de extraer el texto.

¿Las entidades HTML como &amp;nbsp; y &amp;amp; se convierten a caracteres normales?

Sí. DOMParser decodifica las entidades válidas y el resultado muestra sus caracteres correspondientes.

¿Puedo convertir una página web completa pegando su código fuente?

Sí, siempre que pegues el HTML. La herramienta no descarga páginas desde una URL ni ejecuta sus scripts.

¿Qué pasa con tablas y columnas al convertir HTML en texto plano?

Se conserva el contenido textual, pero se pierde gran parte de la estructura visual y de las relaciones de columnas.

Etapas de extracción

MóduloFunción
Análisis DOMInterpreta HTML válido o parcialmente válido.
LimpiezaDescarta contenido no visible.
NormalizaciónOrdena espacios y saltos de línea.
Ver más herramientas de Conversión y codificación