# Audio-zu-Text Transkriptor (KI)

Transkribiert Sprache aus Audio (wav/mp3/m4a/flac/ogg/webm/aac) in Text, SRT, VTT oder JSON mit grok-stt. Bis 10 Min.

> Kanonische Seite: https://elysiatools.com/de/tools/audio-to-text-transcriber

- **Kategorie:** AI Tools

- **Schlagwörter:** audio, transkribieren, sprache zu text, stt, untertitel, srt, vtt, grok

## Überblick

Laden Sie eine Sprachdatei hoch — das Werkzeug transkribiert sie über x-ai/grok-stt-1.0 (OpenRouter). Für zeitgestempelte Formate (SRT/VTT) wird das Audio in Segmente geteilt. Unterstützt WAV, MP3, M4A, FLAC, OGG, WebM und AAC. Die Dauer folgt dem Plan-Limit (kostenlos: 10 Min., von der Plattform erzwungen).

## Eingaben

- **Audiodatei** (file): Upload an audio/video file with speech
- **Ausgabeformat** (select)
- **Sprachhinweis** (select)
- **Maximale Blockdauer (s)** (number)

## Wann verwenden

- Wenn du Interviews, Besprechungen oder Sprachnotizen schnell in Text umwandeln möchtest.
- Wenn du aus einer Sprachaufnahme SRT- oder VTT-Untertitel erstellen willst.
- Wenn du eine strukturierte JSON-Cue-Liste für die weitere Verarbeitung benötigst.

## Funktionsweise

- Lade eine Audio- oder Videodatei mit Sprache hoch.
- Wähle das Ausgabeformat: Klartext, SRT, VTT oder JSON.
- Nutze die automatische Spracherkennung oder wähle einen Sprachhinweis aus.
- Optional kannst du die maximale Blockdauer zwischen 20 und 55 Sekunden festlegen und anschließend die Transkription herunterladen.

## Anwendungsfälle

- Interviews und Gespräche für redaktionelle Notizen transkribieren
- Untertitel für kurze Videos als SRT oder VTT erstellen
- Sprachnachrichten und Besprechungsaufnahmen in durchsuchbaren Text umwandeln

## Häufig gestellte Fragen

### Welche Dateiformate werden unterstützt?

Unterstützt werden WAV, MP3, M4A, FLAC, OGG, WebM und AAC. Außerdem können WebM- und MP4-Videodateien mit Sprache hochgeladen werden.

### Welche Ausgabeformate sind verfügbar?

Die Transkription kann als Klartext, SRT-Untertitel, VTT-Untertitel oder JSON-Cue-Liste ausgegeben werden.

### Wie lang darf die Audiodatei sein?

Im kostenlosen Tarif sind bis zu 10 Minuten möglich. Das jeweilige Plan-Limit wird von der Plattform durchgesetzt.

### Kann die Sprache automatisch erkannt werden?

Ja. Du kannst die automatische Erkennung verwenden oder Deutsch, Englisch, Chinesisch, Spanisch, Russisch, Französisch oder Portugiesisch angeben.

### Wie entstehen die Zeitstempel für SRT und VTT?

Das Audio wird für zeitgestempelte Formate in Segmente geteilt. Verfügbare Zeitstempel des Anbieters werden bevorzugt verwendet; andernfalls entstehen klar gekennzeichnete, an Stille ausgerichtete Näherungswerte.

## Ähnliche Tools

- [Audio-Melodiekontur-Extraktor](https://elysiatools.com/de/tools/audio-melody-contour-extractor): Extrahiert die dominante Melodie und bündelt MIDI, Notenereignisse, Tonhöhenkontur, SVG und JSON in einer ZIP-Datei.
- [Akkordfolgen-Detektor](https://elysiatools.com/de/tools/audio-chord-progression-detector): Schätzt lokal die Akkorde einer Audiodatei und bündelt CSV, JSON, SVG und Methodennotizen in einer ZIP-Datei.
- [Batch-Audio-Konverter](https://elysiatools.com/de/tools/audio-batch-converter): Konvertieren Sie mehrere Audiodateien zwischen verschiedenen Formaten wie MP3, WAV, FLAC, AAC, OGG, Opus mit Qualitätseinstellungen und Stapelverarbeitung
- [Audio-Codec wechseln](https://elysiatools.com/de/tools/audio-codec-swap): Codec eines Audiofiles im gewählten Ausgabeformat ändern
- [Audio-Format-Konverter](https://elysiatools.com/de/tools/audio-converter): Konvertieren Sie Audiodateien zwischen verschiedenen Formaten wie MP3, WAV, FLAC, AAC, OGG mit Qualitätseinstellungen und Lautstärkeanpassung
- [Audio zu Multitrack-MIDI (Entwurf)](https://elysiatools.com/de/tools/audio-to-multitrack-midi): Trennt einen Mix in Stems (Drums/Bass/Sonstiges/Vocals) und transkribiert jeden in MIDI
- [Data-URI-Generator](https://elysiatools.com/de/tools/data-uri-generator): Konvertiert Dateien in Data URIs (Base64 oder prozent-kodiert), um Bilder, Schriftarten und Ressourcen direkt in HTML, CSS oder Markdown einzubetten
- [Audio-Clipping-Korrektur](https://elysiatools.com/de/tools/audio-declip): Repariert geclipptes Audio durch Rekonstruktion von Spitzen, die die maximale Amplitude überschritten haben. Stellt verzerrtes Audio von übersteuerten Aufnahmen oder übermäßigem Gain wieder her

## Beispiele

- [MP3 Audio-Beispiele ohne Urheberrechte](https://elysiatools.com/de/samples/mp3-samples): Sammlung urheberrechtsfreier Audio-Beispiele zum Testen und Entwickeln, einschließlich Naturklänge, Meditationsmusik und Umgebungsgeräusche
- [FLAC Audio-Beispiele ohne Urheberrechte](https://elysiatools.com/de/samples/flac-samples): Sammlung verlustfreier FLAC-Audios für Tests und Entwicklung, einschließlich Naturklänge und Meditationsmusik
- [WAV Audio-Beispiele ohne Urheberrechte](https://elysiatools.com/de/samples/wav-samples): Sammlung unkomprimierter WAV-Audios für Tests und Entwicklung, einschließlich Naturklänge und Meditationsmusik
- [Video-Beispiele](https://elysiatools.com/de/samples/video-samples): Videobeispieldateien in verschiedenen Formaten und Ausrichtungen
