Qué hace esta herramienta de audio
El etiquetador crea una segmentación básica basada en energía. No realiza reconocimiento de voz ni identificación automática de hablantes; su objetivo es preparar intervalos temporales que puedas nombrar manualmente.
Se calcula RMS por ventanas, se agrupan ventanas activas separadas por silencios cortos y se descartan segmentos demasiado breves. Las etiquetas se guardan con inicio y fin.
La detección por energía no distingue voz de música u otros sonidos fuertes. Para diarización real de hablantes se necesitaría un modelo especializado que no está incluido.