# Transcriptor de audio a texto (IA)

Transcribe voz de audio (wav/mp3/m4a/flac/ogg/webm/aac) a texto, SRT, VTT o JSON con el modelo grok-stt. Hasta 10 min.

> Página canónica: https://elysiatools.com/es/tools/audio-to-text-transcriber

- **Categoría:** AI Tools

- **Palabras clave:** audio, transcribir, voz a texto, stt, subtítulo, srt, vtt, grok

## Descripción general

Sube un archivo con voz y la herramienta lo transcribe con x-ai/grok-stt-1.0 vía OpenRouter. Para formatos con timestamps (SRT/VTT), el audio se divide en fragmentos transcritos por separado. Soporta WAV, MP3, M4A, FLAC, OGG, WebM y AAC. La duración sigue el límite de tu plan (gratis: 10 min, aplicado por la plataforma).

## Entradas

- **Archivo de audio** (file): Upload an audio/video file with speech
- **Formato de salida** (select)
- **Idioma** (select)
- **Duración máxima del bloque (s)** (number)

## Cuándo usarlo

- Cuando necesites convertir una entrevista, reunión o nota de voz en texto editable.
- Cuando quieras crear subtítulos SRT o VTT a partir de un audio o vídeo con voz.
- Cuando necesites una salida estructurada en JSON para revisar los segmentos de una transcripción.

## Cómo funciona

- Sube un archivo con voz en WAV, MP3, M4A, FLAC, OGG, WebM o AAC; también se aceptan archivos WebM y MP4.
- Selecciona el formato de salida: texto plano, SRT, VTT o lista de cues JSON.
- Elige la detección automática del idioma o indica uno de los idiomas disponibles.
- Opcionalmente, ajusta la duración máxima de los bloques entre 20 y 55 segundos antes de iniciar la transcripción.

## Casos de uso

- Convertir entrevistas y reuniones grabadas en transcripciones de texto.
- Crear subtítulos SRT o VTT para vídeos con voz.
- Obtener cues en JSON para revisar y organizar segmentos transcritos.

## Preguntas frecuentes

### ¿Qué formatos de audio admite?

Admite WAV, MP3, M4A, FLAC, OGG, WebM y AAC. También acepta archivos WebM y MP4 con voz.

### ¿Qué formatos de salida puedo generar?

Puedes generar texto plano, subtítulos SRT, subtítulos VTT o una lista de cues en JSON.

### ¿Cuál es la duración máxima?

El límite depende de tu plan. En el plan gratuito, la duración máxima es de 10 minutos.

### ¿Puedo indicar el idioma del audio?

Sí. Puedes usar la detección automática o seleccionar inglés, chino, español, ruso, francés, alemán o portugués.

### ¿Para qué sirve la duración máxima del bloque?

Define el tamaño de los fragmentos usados durante la transcripción. Puedes elegir entre 20 y 55 segundos.

## Herramientas relacionadas

- [Extractor de contorno melódico de audio](https://elysiatools.com/es/tools/audio-melody-contour-extractor): Extrae la melodía dominante y exporta MIDI, eventos de notas, contorno tonal, SVG y JSON en un ZIP.
- [Detector de progresiones de acordes](https://elysiatools.com/es/tools/audio-chord-progression-detector): Estima localmente los acordes de un audio y descarga CSV, JSON, SVG y notas del método en un ZIP.
- [Conversor de Audio en Lote](https://elysiatools.com/es/tools/audio-batch-converter): Convierte múltiples archivos de audio entre diferentes formatos como MP3, WAV, FLAC, AAC, OGG, Opus con configuración de calidad y procesamiento por lotes
- [Cambiar códec de audio](https://elysiatools.com/es/tools/audio-codec-swap): Cambiar el códec dentro de un formato de salida elegido
- [Convertidor de Formato de Audio](https://elysiatools.com/es/tools/audio-converter): Convierte archivos de audio entre diferentes formatos como MP3, WAV, FLAC, AAC, OGG con configuración de calidad y ajuste de volumen
- [Audio a MIDI Multitrack (Borrador)](https://elysiatools.com/es/tools/audio-to-multitrack-midi): Separa una mezcla en stems (batería/bajo/otros/voces) y transcribe cada uno a MIDI
- [Generador de Data URI](https://elysiatools.com/es/tools/data-uri-generator): Convierte archivos en Data URIs (Base64 o porcentaje-codificado) para incrustar imágenes, fuentes y recursos directamente en HTML, CSS o Markdown
- [Eliminador de Recorte de Audio](https://elysiatools.com/es/tools/audio-declip): Repara el audio recortado reconstruyendo picos que excedieron la amplitud máxima. Restaura audio distorsionado de grabaciones sobrecargadas o con exceso de ganancia

## Ejemplos

- [Muestras MP3 Sin Derechos de Autor](https://elysiatools.com/es/samples/mp3-samples): Colección de muestras de audio sin derechos de autor para pruebas y desarrollo, incluyendo sonidos de la naturaleza, música de meditación y audio ambiental
- [Muestras FLAC Sin Derechos de Autor](https://elysiatools.com/es/samples/flac-samples): Colección de audio FLAC sin pérdidas para pruebas y desarrollo, incluyendo sonidos de la naturaleza y música de meditación
- [Muestras WAV Sin Derechos de Autor](https://elysiatools.com/es/samples/wav-samples): Colección de audio WAV sin compresión para pruebas y desarrollo, incluyendo sonidos de la naturaleza y música de meditación
- [Ejemplos de Video](https://elysiatools.com/es/samples/video-samples): Archivos de video de muestra en diferentes formatos y orientaciones
