# 语音活动分割

检测可能的语音频段活动，并将语音/非语音区间导出为 JSON、CSV、SRT 标记或 FFmpeg 剪切列表。

> 标准页面: https://elysiatools.com/zh/tools/audio-voice-activity-segmentation

- **分类:** Media

- **关键词:** 语音活动检测, vad, 语音分割, 语音时间线, 静音检测, 字幕, ffmpeg

## 概述

这个确定性 VAD 分析窗口能量、语音频段能量和过零行为，以区分可能的语音活动和非语音。适用于时间线、剪辑准备和字幕对齐；它不识别词语、说话人或语言，也不能证明声音一定来自人声。可导出完整 JSON/CSV 时间线、SRT 活动标记和已检测活动区间的 FFmpeg 命令列表。

## 输入项

- **音频文件** (file): Select audio to segment
- **灵敏度** (select)
- **最短语音（秒）** (number)
- **最短静音（秒）** (number)
- **导出格式** (select)

## 适用场景

- 需要快速识别长音频文件中的有声区间与静音区间，以进行粗剪或去除无声部分时。
- 准备为视频制作字幕，需要快速生成包含语音活动时间戳的 SRT 标记文件时。
- 需要生成 FFmpeg 剪切命令列表，以便通过命令行自动化裁剪和拼接音频片段时。

## 工作原理

- 上传需要分析的音频文件，并根据音频背景噪音情况选择“保守”、“均衡”或“灵敏”的检测灵敏度。
- 设置最短语音持续时间和最短静音持续时间，以过滤掉短暂的杂音或微小的停顿。
- 选择所需的导出格式（如 JSON、CSV、SRT 或 FFmpeg 剪切列表），系统将通过分析窗口能量和过零行为计算出语音区间并生成对应文件。

## 使用案例

- 播客音频后期剪辑：快速定位并切除无声停顿，保留紧凑的对话内容。
- 字幕制作时间轴对齐：生成 SRT 标记文件，为后续的人工字幕翻译和打轴提供精准的时间区间。
- 语音数据集预处理：批量提取含有语音的音频片段，过滤掉无用的静音背景，用于机器学习训练。

## 常见问题

### 这个工具能识别音频里说话的具体内容或说话人是谁吗？

不能。该工具仅通过物理特征（如能量和过零率）检测是否存在语音活动，不具备语音识别（ASR）或说话人识别功能。

### 什么是“FFmpeg 剪切列表”导出格式？

它会生成一组 FFmpeg 命令行参数，方便您直接在终端运行命令，快速裁剪出所有检测到语音的音频片段。

### 如何处理背景噪音较多的音频？

您可以将灵敏度设置为“保守”（conservative），并适当增加“最短语音”和“最短静音”的秒数，以减少噪音引起的误报。

### 支持哪些音频格式？

支持常见的音频文件格式，您只需上传符合标准音频类型的音频文件即可。

### 导出的 SRT 文件可以直接用作字幕吗？

导出的 SRT 文件包含语音活动的时间戳标记，但文本内容为空白，适用于在字幕编辑器中快速定位并手动输入文本。

## 相关工具

- [音频和弦进行检测器](https://elysiatools.com/zh/tools/audio-chord-progression-detector): 在本地估算音频中的和弦顺序，并以 ZIP 下载 CSV、JSON、SVG 时间线和方法说明。
- [静音区间映射](https://elysiatools.com/zh/tools/audio-silence-map): 输出静音区间 JSON/CSV
- [数据集不平衡检测与重采样](https://elysiatools.com/zh/tools/dataset-imbalance-detector-resampler): 检测 CSV 或 JSON 数据集中的类别不平衡，对比重采样策略，并预览平衡后的输出数据集
- [JSON 路径可视化器](https://elysiatools.com/zh/tools/json-path-visualizer): 将 JSON 或 JSONL 以可展开树形结构展示，并为每个节点生成可复制的 JSONPath 表达式
- [Mock Data 命名前缀 / 缩写冲突检测器](https://elysiatools.com/zh/tools/mock-data-naming-conflict-detector): 检测 CSV、JSON 或 schema 中视觉易混淆的字段名和前缀冲突，并给出更清晰的改名建议
- [时间序列异常检测器](https://elysiatools.com/zh/tools/time-series-anomaly-detector): 上传 CSV 或 JSON 时间序列数据，基于 Z-Score 和 IQR 检测异常点，并输出带图表的报告
- [健身训练 PDF 生成器](https://elysiatools.com/zh/tools/fitness-workout-pdf-generator): 从 JSON 或 CSV 训练计划数据生成可打印 PDF，包含动作表格、进度格子和可选的视频二维码
- [PDF 表格提取到 CSV/JSON](https://elysiatools.com/zh/tools/pdf-table-extractor-to-csv-json): 用 OpenDataLoader 从 PDF 中抽取表格，并导出为结构化 JSON、扁平 CSV 或 HTML 表格

## 示例

- [无版权FLAC音频样本](https://elysiatools.com/zh/samples/flac-samples): 用于测试与开发的 FLAC 无损音频样本集合，包含自然声音与冥想音乐
- [无版权MP3音频样本](https://elysiatools.com/zh/samples/mp3-samples): 免费使用和测试的无版权音频样本集合，包括自然声音、冥想音乐和环境音频，适用于测试和开发目的
- [无版权WAV音频样本](https://elysiatools.com/zh/samples/wav-samples): 用于测试与开发的未压缩 WAV 音频样本集合，包含自然声音与冥想音乐
- [语音学习与安全音频样例](https://elysiatools.com/zh/samples/audio-learning-safety-samples): 用于发音对比、听写预检、警报降质和隐私变声工具的确定性合成 WAV 输入。
