WayToClawEarn
中等影响Hacker News / GitHub

微软开源 VibeVoice:Whisper 级语音识别 + 内置说话人分离,MIT 协议免费商用

微软在 GitHub 开源了 VibeVoice 语音 AI 模型,支持语音转文字(STT)、长文本转语音(TTS)和流式 TTS,内置说话人分离(Speaker Diarization),MIT 协议。17.3B 参数模型可通过 mlx-audio 在 Mac 上本地运行,1 小时音频处理仅需约 9 分钟。

WayToClawEarn Editorial发布 2026年4月28日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

微软于 2026 年 1 月发布、4 月 27 日再次引发社区热议的 VibeVoice,是一个 MIT 协议的全栈语音 AI 开源项目。它不仅是 Whisper 级别的语音转文字(STT)模型,还内置了说话人分离(Speaker Diarization)功能,可直接识别"谁在什么时候说了什么"——这对内容创作者、播客制作者和自动化工作流来说,是一个值得关注的新选择。

关键要点

  • 事件时间:模型首次发布于 2026 年 1 月 21 日,4 月 27 日因 Simon Willison 的评测再次引爆 HN
  • 影响对象:内容创作者、AI 自动化流水线、播客转录工具用户
  • 核心变化:微软以 MIT 协议开源了 17.3B 参数的语音 AI 模型,Mac 用户可用 mlx-audio 一行命令本地运行

背景与触发事件

4 月 27 日晚,知名 Python/AI 博主 Simon Willison 发布了一篇 VibeVoice 评测,展示了如何用一行命令在 MacBook Pro 上转录他最近的一期播客节目。评测结果显示:99 分钟播客音频,处理时间仅 524 秒(约 8 分 45 秒),输出 20,248 个 token,峰值内存约 30GB。

实测数据:99 分钟音频 → 8.7 分钟处理完成,每秒生成约 38.6 个 token,输出包含 speaker_id 的 JSON 结构化转录。

评测原文迅速在 Hacker News 上获得 35 分和大量讨论,社区反馈集中在:模型虽然推理较慢且显存占用高(30-60GB),但内置说话人分离功能在同类开源模型中独树一帜。

关键影响(按维度)

维度变化对自动化从业者意味着什么建议动作
成本MIT 协议,完全免费商用现成的开源语音转文字方案,没有 API 费用评估替换 OpenAI Whisper API 的可行性
功能内置说话人分离单模型直接输出"谁说了什么",无需额外 pipeline尝试在播客转写/会议记录场景中落地
部署支持 MLX、GGUF 量化量化到 4-bit 仅 5.71GB,128GB Mac 可流畅运行用 mlx-community/VibeVoice-ASR-4bit 做本地测试
时长单次最多处理 1 小时音频长音频需要切片+重叠策略预切 55 分钟片段 + 1 分钟重叠,避免截断
多语言多语言支持较弱中文场景可能不如 Whisper 稳定中文为主的项目暂不建议迁移

适配建议

VibeVoice 的出现意味着语音转文字领域有了一个 MIT 协议的新选项。对于使用 waytoclawearn 自动化内容生产线的读者来说,以下几个方向值得关注:

1. 本地转录取代云端 API

对于播客/视频音频内容的批量转写,VibeVoice + MLX 可以完全在本地 Mac 上完成,无需向任何第三方发送音频数据:

terminal

# 在 Mac 上运行 VibeVoice(需安装 mlx-audio)
uv run --with mlx-audio mlx_audio.stt.generate \
  --model mlx-community/VibeVoice-ASR-4bit \
  --audio interview.mp3 --output-path interview \
  --format json --verbose --max-tokens 32768

该命令会输出 JSON 格式的转录结果,每个 segment 包含 textstartenddurationspeaker_id

2. 多说话人场景直接输出结构化数据

VibeVoice 的 speaker_id 功能意味着播客分析、会议纪要多说话人场景可以直接输出结构化数据,无需额外的说话人聚类步骤。Simon 的测试显示它能准确区分对话双方,甚至能识别出主持人的赞助商广告语音作为独立说话人。

3. 长音频切片策略

由于模型限制单次最长 60 分钟音频,超长内容需要切片处理。最佳实践:以 55 分钟为一片,设置 1-2 分钟重叠,然后拼接时去重重叠部分的文本,并统一多段间的 speaker_id 映射。

任务清单

  • 下载 VibeVoice-ASR-4bit(5.71GB)或完整 17.3GB 版,测试本地转录效果
  • 对比现有 OpenAI Whisper API 的转录精度和成本
  • 评估 speaker_id 功能是否足够稳定用于多说话人场景的生产环境
  • 测试 VibeVoice 在中文/中英混合场景下的表现

示例:完整 JSON 输出结构

json
{
  "text": "And an open question for me is how many other knowledge work fields are actually prone to these agent loops?",
  "start": 13.85,
  "end": 19.5,
  "duration": 5.65,
  "speaker_id": 0
},
{
  "text": "Now that we have this power, people almost underestimate what they can do with it.",
  "start": 19.5,
  "end": 22.78,
  "duration": 3.28,
  "speaker_id": 1
}

这个结构可以直接导入 Datasette Lite 等工具进行浏览,或作为自动化流水线的输入。

VibeVoice 终端运行截图

工具词条(触发工具悬浮卡)

正文中涉及的工具和模型:MicrosoftOpenAI(Whisper 对比)、MLXllama.cpp(可通过 GGUF 格式跑)

内链引导

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。