# 音频转文字转录器 (AI)

用 grok-stt AI 模型将语音(wav/mp3/m4a/flac/ogg/webm/aac)转录为文本、SRT、VTT 或 JSON。最长 10 分钟。

> 标准页面: https://elysiatools.com/zh/tools/audio-to-text-transcriber

- **分类:** AI Tools

- **关键词:** 音频, 转录, 语音转文字, stt, 字幕, srt, vtt, grok, whisper, 听写

## 概述

上传包含语音的音频或视频文件,工具通过 OpenRouter 的 x-ai/grok-stt-1.0 模型完成转录。长音频会在静音附近切分成有界 FLAC 片段。字幕优先使用服务商返回的词级或分段时间戳;若不可用,则使用明确标注的静音对齐近似时间。支持 WAV、MP3、M4A、FLAC、OGG、WebM 和 AAC。音频时长遵循套餐限制(免费版:10 分钟,由平台强制)。可自动检测或指定语言提示。

## 输入项

- **音频文件** (file): Upload an audio/video file with speech
- **输出格式** (select)
- **语言提示** (select)
- **最大分块时长 (秒)** (number)

## 适用场景

- 需要将会议录音、访谈或听写内容快速转换为可编辑文本时。
- 需要为包含语音的视频生成 SRT 或 VTT 字幕时。
- 需要以 JSON 格式获取转录结果，供后续文本处理或归档时。

## 工作原理

- 上传包含语音的音频或支持的视频文件，文件大小不超过 100 MB。
- 选择输出格式：纯文本、SRT、VTT 或 JSON。
- 选择自动检测语言，或指定中文、英语、西班牙语等语言提示。
- 提交转录；较长音频会在静音附近切分为片段后完成处理。

## 使用案例

- 将会议、访谈和课程录音转换为文字稿，便于查阅和整理。
- 为短视频、网络课程或采访视频生成 SRT 或 VTT 字幕。
- 将语音内容输出为 JSON，方便保存转录片段及其时间信息。

## 常见问题

### 支持哪些输入格式？

支持 WAV、MP3、M4A、FLAC、OGG、WebM 和 AAC，也可上传支持的 WebM 或 MP4 视频文件。

### 单个文件最长可以转录多久？

免费版最长为 10 分钟，实际时长受平台套餐限制。

### 可以输出字幕文件吗？

可以，输出格式支持 SRT 和 VTT，也支持纯文本与 JSON。

### 需要手动选择语言吗？

不需要。可以使用自动检测，也可以指定中文、英语、法语等语言提示。

### SRT 和 VTT 的时间轴是否精确？

优先使用服务商返回的词级或分段时间戳；如果没有，则使用明确标注的静音对齐近似时间。

## 相关工具

- [音频旋律轮廓提取器](https://elysiatools.com/zh/tools/audio-melody-contour-extractor): 从音频中提取主导旋律，并在一个 ZIP 中导出 MIDI、音符事件、音高轮廓、SVG 和 JSON。
- [音频和弦进行检测器](https://elysiatools.com/zh/tools/audio-chord-progression-detector): 在本地估算音频中的和弦顺序，并以 ZIP 下载 CSV、JSON、SVG 时间线和方法说明。
- [批量音频转换器](https://elysiatools.com/zh/tools/audio-batch-converter): 批量转换多个音频文件格式，支持 MP3、WAV、FLAC、AAC、OGG、Opus，支持质量设置和批量处理
- [音频编码切换](https://elysiatools.com/zh/tools/audio-codec-swap): 在选定输出格式内更换音频编码
- [音频格式转换器](https://elysiatools.com/zh/tools/audio-converter): 在不同音频格式之间转换文件，如 MP3、WAV、FLAC、AAC、OGG，支持质量设置和音量调节
- [音频转多轨 MIDI(草稿)](https://elysiatools.com/zh/tools/audio-to-multitrack-midi): 把整曲混音拆分为鼓/贝斯/其他/人声,逐轨转成 MIDI——多轨扒谱的起点
- [Data URI 生成器](https://elysiatools.com/zh/tools/data-uri-generator): 将文件转换为 Data URI（Base64 或百分号编码），用于直接在 HTML、CSS 或 Markdown 中内联图片、字体等资源
- [音频去削波失真](https://elysiatools.com/zh/tools/audio-declip): 通过重建超过最大振幅的峰值来修复削波音频。恢复来自过度驱动录音或增益过大的失真音频

## 示例

- [无版权MP3音频样本](https://elysiatools.com/zh/samples/mp3-samples): 免费使用和测试的无版权音频样本集合，包括自然声音、冥想音乐和环境音频，适用于测试和开发目的
- [无版权FLAC音频样本](https://elysiatools.com/zh/samples/flac-samples): 用于测试与开发的 FLAC 无损音频样本集合，包含自然声音与冥想音乐
- [无版权WAV音频样本](https://elysiatools.com/zh/samples/wav-samples): 用于测试与开发的未压缩 WAV 音频样本集合，包含自然声音与冥想音乐
- [视频示例](https://elysiatools.com/zh/samples/video-samples): 不同格式和方向的视频示例文件
