微软开源 VibeVoice:Whisper 级语音识别 + 内置说话人分离,MIT 协议免费商用
微软在 GitHub 开源了 VibeVoice 语音 AI 模型,支持语音转文字(STT)、长文本转语音(TTS)和流式 TTS,内置说话人分离(Speaker Diarization),MIT 协议。17.3B 参数模型可通过 mlx-audio 在 Mac 上本地运行,1 小时音频处理仅需约 9 分钟。
核心结论
微软于 2026 年 1 月发布、4 月 27 日再次引发社区热议的 VibeVoice,是一个 MIT 协议的全栈语音 AI 开源项目。它不仅是 Whisper 级别的语音转文字(STT)模型,还内置了说话人分离(Speaker Diarization)功能,可直接识别"谁在什么时候说了什么"——这对内容创作者、播客制作者和自动化工作流来说,是一个值得关注的新选择。
关键要点
- 事件时间:模型首次发布于 2026 年 1 月 21 日,4 月 27 日因 Simon Willison 的评测再次引爆 HN
- 影响对象:内容创作者、AI 自动化流水线、播客转录工具用户
- 核心变化:微软以 MIT 协议开源了 17.3B 参数的语音 AI 模型,Mac 用户可用 mlx-audio 一行命令本地运行
背景与触发事件
4 月 27 日晚,知名 Python/AI 博主 Simon Willison 发布了一篇 VibeVoice 评测,展示了如何用一行命令在 MacBook Pro 上转录他最近的一期播客节目。评测结果显示:99 分钟播客音频,处理时间仅 524 秒(约 8 分 45 秒),输出 20,248 个 token,峰值内存约 30GB。
实测数据:99 分钟音频 → 8.7 分钟处理完成,每秒生成约 38.6 个 token,输出包含 speaker_id 的 JSON 结构化转录。
评测原文迅速在 Hacker News 上获得 35 分和大量讨论,社区反馈集中在:模型虽然推理较慢且显存占用高(30-60GB),但内置说话人分离功能在同类开源模型中独树一帜。
关键影响(按维度)
| 维度 | 变化 | 对自动化从业者意味着什么 | 建议动作 |
|---|---|---|---|
| 成本 | MIT 协议,完全免费商用 | 现成的开源语音转文字方案,没有 API 费用 | 评估替换 OpenAI Whisper API 的可行性 |
| 功能 | 内置说话人分离 | 单模型直接输出"谁说了什么",无需额外 pipeline | 尝试在播客转写/会议记录场景中落地 |
| 部署 | 支持 MLX、GGUF 量化 | 量化到 4-bit 仅 5.71GB,128GB Mac 可流畅运行 | 用 mlx-community/VibeVoice-ASR-4bit 做本地测试 |
| 时长 | 单次最多处理 1 小时音频 | 长音频需要切片+重叠策略 | 预切 55 分钟片段 + 1 分钟重叠,避免截断 |
| 多语言 | 多语言支持较弱 | 中文场景可能不如 Whisper 稳定 | 中文为主的项目暂不建议迁移 |
适配建议
VibeVoice 的出现意味着语音转文字领域有了一个 MIT 协议的新选项。对于使用 waytoclawearn 自动化内容生产线的读者来说,以下几个方向值得关注:
1. 本地转录取代云端 API
对于播客/视频音频内容的批量转写,VibeVoice + MLX 可以完全在本地 Mac 上完成,无需向任何第三方发送音频数据:
# 在 Mac 上运行 VibeVoice(需安装 mlx-audio)
uv run --with mlx-audio mlx_audio.stt.generate \
--model mlx-community/VibeVoice-ASR-4bit \
--audio interview.mp3 --output-path interview \
--format json --verbose --max-tokens 32768该命令会输出 JSON 格式的转录结果,每个 segment 包含 text、start、end、duration 和 speaker_id。
2. 多说话人场景直接输出结构化数据
VibeVoice 的 speaker_id 功能意味着播客分析、会议纪要多说话人场景可以直接输出结构化数据,无需额外的说话人聚类步骤。Simon 的测试显示它能准确区分对话双方,甚至能识别出主持人的赞助商广告语音作为独立说话人。
3. 长音频切片策略
由于模型限制单次最长 60 分钟音频,超长内容需要切片处理。最佳实践:以 55 分钟为一片,设置 1-2 分钟重叠,然后拼接时去重重叠部分的文本,并统一多段间的 speaker_id 映射。
任务清单
- 下载 VibeVoice-ASR-4bit(5.71GB)或完整 17.3GB 版,测试本地转录效果
- 对比现有 OpenAI Whisper API 的转录精度和成本
- 评估 speaker_id 功能是否足够稳定用于多说话人场景的生产环境
- 测试 VibeVoice 在中文/中英混合场景下的表现
示例:完整 JSON 输出结构
{
"text": "And an open question for me is how many other knowledge work fields are actually prone to these agent loops?",
"start": 13.85,
"end": 19.5,
"duration": 5.65,
"speaker_id": 0
},
{
"text": "Now that we have this power, people almost underestimate what they can do with it.",
"start": 19.5,
"end": 22.78,
"duration": 3.28,
"speaker_id": 1
}这个结构可以直接导入 Datasette Lite 等工具进行浏览,或作为自动化流水线的输入。
工具词条(触发工具悬浮卡)
正文中涉及的工具和模型:Microsoft、OpenAI(Whisper 对比)、MLX、llama.cpp(可通过 GGUF 格式跑)
内链引导
- 想用 AI 搭建内容自动化工作流?看:如何用 n8n + OpenAI 搭建自动化内容采集与发布工作流
- 声音内容自动化变现的真实案例:用 OpenClaw + Claude 构建自动化内容发布系统:月入 $1,500-$2,500 的真实案例
赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →