# Segmentación de actividad de voz

Detecta actividad probable en banda de voz y exporta rangos de voz/no voz en JSON, CSV, SRT o lista FFmpeg.

> Página canónica: https://elysiatools.com/es/tools/audio-voice-activity-segmentation

- **Categoría:** Media

- **Palabras clave:** actividad de voz, vad, segmentación de voz, silencio, srt

## Descripción general

Este VAD determinista analiza energía por ventana, energía de banda vocal y cruces por cero. Sirve para tiempos, preparación de cortes y subtítulos, pero no identifica palabras, hablantes ni idioma, ni prueba que un sonido sea voz humana.

## Entradas

- **Archivo de audio** (file): Select audio to segment
- **Sensibilidad** (select)
- **Voz mínima (s)** (number)
- **Silencio mínimo (s)** (number)
- **Formato de exportación** (select)

## Cuándo usarlo

- Cuando necesites identificar y separar rápidamente los fragmentos con voz de los silencios en grabaciones de audio largas.
- Antes de editar o limpiar pistas de audio, para generar una lista de cortes compatible con FFmpeg.
- Al preparar la estructura temporal de subtítulos (SRT) detectando cuándo empieza y termina de hablar una persona.

## Cómo funciona

- Sube tu archivo de audio en el campo correspondiente.
- Ajusta el nivel de sensibilidad (conservadora, equilibrada o sensible) y define los tiempos mínimos de duración para la voz y el silencio.
- Selecciona el formato de exportación deseado, como una cronología JSON/CSV, marcadores SRT o una lista de corte de FFmpeg.
- Procesa el archivo para descargar el documento con los segmentos de voz detectados.

## Casos de uso

- Limpieza de silencios en podcasts para agilizar la edición de audio eliminando pausas innecesarias.
- Generación de plantillas de subtítulos vacías basadas en la detección de voz para sincronizar textos manualmente después.
- Automatización de cortes de audio mediante scripts de FFmpeg utilizando la lista de segmentos generada.

## Preguntas frecuentes

### ¿Esta herramienta transcribe el contenido del audio?

No, esta herramienta solo detecta la presencia de actividad en la banda de voz y sus tiempos, no realiza transcripción de texto ni reconoce palabras.

### ¿Puede identificar quién está hablando en el audio?

No, el análisis es puramente energético y frecuencial; no identifica hablantes, géneros ni idiomas específicos.

### ¿Qué formatos de exportación están disponibles?

Puedes exportar los resultados en formato de cronología JSON, cronología CSV, marcadores de actividad SRT o una lista de corte para FFmpeg.

### ¿Cómo influye el ajuste de sensibilidad?

La sensibilidad determina el umbral para clasificar un sonido como voz: 'sensible' detectará más fragmentos (incluso con ruido), mientras que 'conservadora' evitará falsos positivos a costa de omitir susurros o voces bajas.

### ¿Qué significan los parámetros de voz y silencio mínimos?

Establecen la duración mínima en segundos para que un fragmento sea considerado un segmento de voz válido o un intervalo de silencio real, evitando segmentaciones excesivamente fragmentadas.

## Herramientas relacionadas

- [Detector de progresiones de acordes](https://elysiatools.com/es/tools/audio-chord-progression-detector): Estima localmente los acordes de un audio y descarga CSV, JSON, SVG y notas del método en un ZIP.
- [Mapa de Silencios](https://elysiatools.com/es/tools/audio-silence-map): Salida de silencios en JSON/CSV
- [Detector de desbalance y remuestreo](https://elysiatools.com/es/tools/dataset-imbalance-detector-resampler): Detecta desbalance de clases en datasets CSV o JSON, compara estrategias y previsualiza una salida balanceada
- [Visualizador de rutas JSON](https://elysiatools.com/es/tools/json-path-visualizer): Visualiza JSON o JSONL como un arbol expandible y copia expresiones JSONPath para cada nodo
- [Detector de conflictos de prefijos y abreviaturas en mock data](https://elysiatools.com/es/tools/mock-data-naming-conflict-detector): Detecta nombres de campo visualmente confusos y colisiones de prefijo en CSV, JSON o schemas
- [Detector de anomalias en series temporales](https://elysiatools.com/es/tools/time-series-anomaly-detector): Sube datos de series temporales en CSV o JSON, detecta anomalías con Z-Score e IQR y devuelve un informe con grafico
- [Generador PDF de entrenamiento fitness](https://elysiatools.com/es/tools/fitness-workout-pdf-generator): Genera un PDF imprimible de entrenamiento desde JSON o CSV con tablas, casillas de progreso y QR opcionales
- [Extractor de tablas PDF a CSV/JSON](https://elysiatools.com/es/tools/pdf-table-extractor-to-csv-json): Extrae tablas de PDF con OpenDataLoader y las exporta como JSON estructurado, CSV o HTML

## Ejemplos

- [Muestras FLAC Sin Derechos de Autor](https://elysiatools.com/es/samples/flac-samples): Colección de audio FLAC sin pérdidas para pruebas y desarrollo, incluyendo sonidos de la naturaleza y música de meditación
- [Muestras MP3 Sin Derechos de Autor](https://elysiatools.com/es/samples/mp3-samples): Colección de muestras de audio sin derechos de autor para pruebas y desarrollo, incluyendo sonidos de la naturaleza, música de meditación y audio ambiental
- [Muestras WAV Sin Derechos de Autor](https://elysiatools.com/es/samples/wav-samples): Colección de audio WAV sin compresión para pruebas y desarrollo, incluyendo sonidos de la naturaleza y música de meditación
- [Muestras de voz, aprendizaje y seguridad](https://elysiatools.com/es/samples/audio-learning-safety-samples): Entradas WAV sintéticas deterministas para comparación, dictado, alertas y privacidad.
