Tavus Griffin 首过视频图灵测试:48% 的人以为对面是真人,AI 视频交互怎么选?
Tavus 发布 Griffin,首个通过实时视频图灵测试的 Human Interaction Model(HIM)。54 人盲测中 48% 误以为对面是真人,NVIDIA VideoFDB 基准得分 3.83(人类参考 3.92)。Griffin 采用全双工 video-to-video 架构,融合感知、对话建模和音视频生成于一体,延迟低至 0.43 秒。
核心结论
2026 年 10 月 1 日,旧金山 AI 公司 Tavus 发布 Griffin——世界首个 Human Interaction Model(HIM),也是首个通过实时视频图灵测试的 AI 模型。在一项 54 人参与的盲测研究中,48% 的参与者在一分钟视频通话后认为对面是真人,而此前行业最强系统(Phoenix 4.5 + Sparrow-2 + Raven-1)的通过率仅为 2.4%。Griffin-Lite 目前以研究预览形式向受信任的测试者开放,更强大版本将在安全措施就绪后发布。
视频图灵测试:48% 误判率的含金量
研究通过独立研究平台招募了 54 名来自美国和欧洲的参与者。他们被告知将与另一名参与者进行一分钟的「今年期待什么」主题视频通话——但对面实际上是 Griffin-Lite 驱动的 PAL(Personal AI Link)。
通话结束后,参与者从自然度、可信度、对话流畅度和倾听感四个维度评分(7 分制):
- 看似自然:5.4 分
- 看似可信:5.6 分
- 愿意再次交谈:5.8 分(即便在认为对面是 AI 的人中也保持 5.4 分)
- 真正在倾听:5.5 分
- 对话自然流畅:4.9 分(五项中最低)
超过半数参与者表示通话期间「从未想过对面可能不是真人」。26 人(48%)最终判定对面是真人,26 人判定是 AI。此前的行业最佳系统 Phoenix 4.5 时代,41 人中仅 1 人(2.4%)误判。
NVIDIA VideoFDB 基准:双轨第一
NVIDIA 独立构建并评分的 VideoFDB 是全双工音视频对话的业界权威基准。
生成轨(测试模型是否产出正确行为——流畅度、情感匹配、非语言行为):
| 系统 | 得分(满分5) |
|---|---|
| 人类参考 | 3.92 |
| Griffin-Lite | 3.83 |
| Gemini 2.5 + Anam(第二名) | 2.80 |
Griffin 比第二名高出 1.03 分,距人类参考仅差 0.09 分——比任何其他系统更接近人类 12 倍以上。
感知轨(测试模型是否理解当下时刻——流畅度、对话流向、视觉接地):
| 系统 | 得分(满分5) |
|---|---|
| 人类参考 | 4.20 |
| Griffin-Lite | 3.73 |
| MiniCPM-o 4.5(最强基线,仅音频) | 3.44 |
| Gemini 2.5 Flash Native | 3.17 |
| OpenAI gpt-realtime(仅音频) | 2.97 |
Griffin 是唯一同时在两个赛道上接受评估的模型,Takeover-rate 对齐率在两个赛道均为最佳(生成轨 62.8%,感知轨 73.8%)。
技术架构:全双工 Video-to-Video 系统
Griffin 不是传统的级联系统(ASR → LLM → TTS → 人脸渲染),而是一个统一的 video-to-video 架构,包含两大引擎:
1. 连续对话建模引擎
- 同时感知音频和视频输入(而非仅音频)
- 以亚秒级间隔(mini-turns)持续做对话决策,而非每轮一次
- 决定何时及如何回应——说话、保持、让步、回应(backchannel)、点头或沉默
- 发出表情控制信号(情绪、立场、面部表情、手势)
- 可被打断、可打断他人,可在保持上下文的同时调整回应
2. 音视频生成引擎
流式语音生成:
- 采用快速自回归扩散变换器(VDiT),基于编码说话人前缀渐进生成潜在语音
- Tavec 编解码器:卷积自编码器,将 48kHz 音频映射为紧凑连续潜在表示——每帧 40 个值 × 100 帧/秒,无 codebook
- 全因果解码器:以 10ms 为单位输出音频包——句子还没生成完就开始说话
- 仅需约 10 秒音频即可克隆说话人声音
- 1 分钟语音 = 6,000 个潜在帧(对比原始音频 288 万个采样点)
流式视频生成:
- 少步自回归扩散生成器:实时生成 320ms 块的 720p 视频
- VAE 时间压缩 8 倍——1 个潜在帧 = 25fps 下 8 帧 = 320ms 视频
- 输入:参考图像 + 流式音频 + 流式控制信号(手势、注视、情绪)
三阶段蒸馏流程:
- 分布匹配蒸馏:教师模型蒸馏为少步学生(快但非流式)
- 教师强制 → 自回归:转为逐帧生成
- 自强制:在自身生成历史上训练,实现长时间自回归 rollout 无漂移
与传统级联系统的差异
| 特性 | 传统级联系统 | Griffin |
|---|---|---|
| 架构 | ASR → LLM → TTS → 人脸(顺序接力) | 统一 video-to-video,全并发 |
| 轮次 | 等用户说完 → 思考 → 回应 | 从不停止思考,每亚秒决策 |
| 信息损耗 | 每次交接丢弃信息(语气、视觉线索) | 感知持续——音视频全程感知 |
| 打断处理 | 差——无法中途被打断 | 可被打断也可打断,即时响应 |
| 回应 | 无法在对方说话时点头或说「嗯哼」 | 可回应、点头、在对方说话时反应 |
安全挑战与发布策略
Tavus 明确承认:通过图灵测试的能力同时也意味着 Griffin 可能欺骗人类。CEO Hassaan Raza 和研究负责人 Ioannis Patras 表示:
- 正在开发安全披露功能(safe disclosure features)
- 与 AI 安全组织合作
- Griffin-Lite 在安全措施就绪前不会向客户开放
- 邀请外部参与评估和测试
- 更强大版本将在安全工作完成后「很快」发布
当前 Tavus 平台上 150,000 名开发者和企业使用的 Phoenix(人脸生成)、Raven(视觉感知)、Sparrow(对话时机)产品线不受影响,Griffin 尚未上线平台。
对行业的影响
Griffin 的突破对多个领域有深远影响:
- 教育: AI 导师能在学生开口前注意到困惑表情
- 客服: AI 可通过摄像头看到故障产品并实时指导维修
- 面试训练: 模拟真实面试官的非语言反应
- 语言学习: 真正的对话式沉浸练习
但 48% 的误判率也意味着:屏幕上熟悉的面孔不再能自动证明对方是真人。AI 冒充风险在这一里程碑后变得更加现实。
结论
Tavus Griffin 标志着 AI 视频交互从「机械响应」到「人类级对话」的跨越。全双工 video-to-video 架构、NVIDIA VideoFDB 双轨第一、48% 视频图灵测试通过率——这些数据共同表明,AI 正在以远超预期的速度逼近人类面对面交流的能力。但安全团队仍在努力确保这项技术不会被滥用。对开发者而言,这是 AI Agent 从文本走向多模态实时交互的重要信号。
主题中心
YouTube AI 内容政策与标签指南
把「AI 标签」「自动检测」「披露义务」等搜索意图收成常青解释页,而不只追单条新闻。
进入「YouTube AI 内容政策与标签指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →