WayToClawEarn
高影响Tavus

Tavus Griffin 首过视频图灵测试:48% 的人以为对面是真人,AI 视频交互怎么选?

Tavus 发布 Griffin,首个通过实时视频图灵测试的 Human Interaction Model(HIM)。54 人盲测中 48% 误以为对面是真人,NVIDIA VideoFDB 基准得分 3.83(人类参考 3.92)。Griffin 采用全双工 video-to-video 架构,融合感知、对话建模和音视频生成于一体,延迟低至 0.43 秒。

Edisen Lu · WayToClawEarn来源 Tavus发布 2026年10月2日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · Tavus

核心结论

2026 年 10 月 1 日,旧金山 AI 公司 Tavus 发布 Griffin——世界首个 Human Interaction Model(HIM),也是首个通过实时视频图灵测试的 AI 模型。在一项 54 人参与的盲测研究中,48% 的参与者在一分钟视频通话后认为对面是真人,而此前行业最强系统(Phoenix 4.5 + Sparrow-2 + Raven-1)的通过率仅为 2.4%。Griffin-Lite 目前以研究预览形式向受信任的测试者开放,更强大版本将在安全措施就绪后发布。

视频图灵测试:48% 误判率的含金量

研究通过独立研究平台招募了 54 名来自美国和欧洲的参与者。他们被告知将与另一名参与者进行一分钟的「今年期待什么」主题视频通话——但对面实际上是 Griffin-Lite 驱动的 PAL(Personal AI Link)。

通话结束后,参与者从自然度、可信度、对话流畅度和倾听感四个维度评分(7 分制):

  • 看似自然:5.4 分
  • 看似可信:5.6 分
  • 愿意再次交谈:5.8 分(即便在认为对面是 AI 的人中也保持 5.4 分)
  • 真正在倾听:5.5 分
  • 对话自然流畅:4.9 分(五项中最低)

超过半数参与者表示通话期间「从未想过对面可能不是真人」。26 人(48%)最终判定对面是真人,26 人判定是 AI。此前的行业最佳系统 Phoenix 4.5 时代,41 人中仅 1 人(2.4%)误判。

NVIDIA VideoFDB 基准:双轨第一

NVIDIA 独立构建并评分的 VideoFDB 是全双工音视频对话的业界权威基准。

生成轨(测试模型是否产出正确行为——流畅度、情感匹配、非语言行为):

系统得分(满分5)
人类参考3.92
Griffin-Lite3.83
Gemini 2.5 + Anam(第二名)2.80

Griffin 比第二名高出 1.03 分,距人类参考仅差 0.09 分——比任何其他系统更接近人类 12 倍以上。

感知轨(测试模型是否理解当下时刻——流畅度、对话流向、视觉接地):

系统得分(满分5)
人类参考4.20
Griffin-Lite3.73
MiniCPM-o 4.5(最强基线,仅音频)3.44
Gemini 2.5 Flash Native3.17
OpenAI gpt-realtime(仅音频)2.97

Griffin 是唯一同时在两个赛道上接受评估的模型,Takeover-rate 对齐率在两个赛道均为最佳(生成轨 62.8%,感知轨 73.8%)。

技术架构:全双工 Video-to-Video 系统

Griffin 不是传统的级联系统(ASR → LLM → TTS → 人脸渲染),而是一个统一的 video-to-video 架构,包含两大引擎:

1. 连续对话建模引擎

  • 同时感知音频和视频输入(而非仅音频)
  • 以亚秒级间隔(mini-turns)持续做对话决策,而非每轮一次
  • 决定何时及如何回应——说话、保持、让步、回应(backchannel)、点头或沉默
  • 发出表情控制信号(情绪、立场、面部表情、手势)
  • 可被打断、可打断他人,可在保持上下文的同时调整回应

2. 音视频生成引擎

流式语音生成:

  • 采用快速自回归扩散变换器(VDiT),基于编码说话人前缀渐进生成潜在语音
  • Tavec 编解码器:卷积自编码器,将 48kHz 音频映射为紧凑连续潜在表示——每帧 40 个值 × 100 帧/秒,无 codebook
  • 全因果解码器:以 10ms 为单位输出音频包——句子还没生成完就开始说话
  • 仅需约 10 秒音频即可克隆说话人声音
  • 1 分钟语音 = 6,000 个潜在帧(对比原始音频 288 万个采样点)

流式视频生成:

  • 少步自回归扩散生成器:实时生成 320ms 块的 720p 视频
  • VAE 时间压缩 8 倍——1 个潜在帧 = 25fps 下 8 帧 = 320ms 视频
  • 输入:参考图像 + 流式音频 + 流式控制信号(手势、注视、情绪)

三阶段蒸馏流程:

  1. 分布匹配蒸馏:教师模型蒸馏为少步学生(快但非流式)
  2. 教师强制 → 自回归:转为逐帧生成
  3. 自强制:在自身生成历史上训练,实现长时间自回归 rollout 无漂移

与传统级联系统的差异

特性传统级联系统Griffin
架构ASR → LLM → TTS → 人脸(顺序接力)统一 video-to-video,全并发
轮次等用户说完 → 思考 → 回应从不停止思考,每亚秒决策
信息损耗每次交接丢弃信息(语气、视觉线索)感知持续——音视频全程感知
打断处理差——无法中途被打断可被打断也可打断,即时响应
回应无法在对方说话时点头或说「嗯哼」可回应、点头、在对方说话时反应

安全挑战与发布策略

Tavus 明确承认:通过图灵测试的能力同时也意味着 Griffin 可能欺骗人类。CEO Hassaan Raza 和研究负责人 Ioannis Patras 表示:

  • 正在开发安全披露功能(safe disclosure features)
  • 与 AI 安全组织合作
  • Griffin-Lite 在安全措施就绪前不会向客户开放
  • 邀请外部参与评估和测试
  • 更强大版本将在安全工作完成后「很快」发布

当前 Tavus 平台上 150,000 名开发者和企业使用的 Phoenix(人脸生成)、Raven(视觉感知)、Sparrow(对话时机)产品线不受影响,Griffin 尚未上线平台。

对行业的影响

Griffin 的突破对多个领域有深远影响:

  • 教育: AI 导师能在学生开口前注意到困惑表情
  • 客服: AI 可通过摄像头看到故障产品并实时指导维修
  • 面试训练: 模拟真实面试官的非语言反应
  • 语言学习: 真正的对话式沉浸练习

但 48% 的误判率也意味着:屏幕上熟悉的面孔不再能自动证明对方是真人。AI 冒充风险在这一里程碑后变得更加现实。

结论

Tavus Griffin 标志着 AI 视频交互从「机械响应」到「人类级对话」的跨越。全双工 video-to-video 架构、NVIDIA VideoFDB 双轨第一、48% 视频图灵测试通过率——这些数据共同表明,AI 正在以远超预期的速度逼近人类面对面交流的能力。但安全团队仍在努力确保这项技术不会被滥用。对开发者而言,这是 AI Agent 从文本走向多模态实时交互的重要信号。

TavusGriffinHuman Interaction Modelvideo Turing testfull-duplex AINVIDIA VideoFDBreal-time video AIAI safety

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。
Tavus Griffin 视频图灵测试通过:48% 误判为真人,Human Interaction Model 怎么选 · WayToClawEarn