行业研究 · 2026-08-01
数字人技术成熟多年,为什么还没有出现“全民级”颠覆产品?
结论不是“技术没用”,而是价值已在异步视频生产中兑现;实时交互数字人仍受单位经济、延迟、可信度、内容闭环和组织集成共同约束。
Executive Summary
核心判断:数字人的规模化成功首先发生在“批量生成培训、营销、本地化视频”,并非实时陪伴或实时授课。HeyGen 披露超过 2 亿美元 ARR,Synthesia 的官方材料披露超过 1 亿美元、后续工程文章提到约 1.4 亿美元 ARR;这证明付费市场真实存在,但证明的是视频生产工作流。
实时交互为何慢:实时系统同时承担 ASR、LLM、TTS、渲染和网络五段延迟,还要为 GPU 并发付费。外形逼真并不自动提高任务完成率;研究中已出现“满意度无显著改善”和 uncanny reaction。企业客户还必须处理肖像/声音授权、AI 标识、审计与错误责任。
建议:产品不要卖“会说话的人脸”,而要卖可衡量的教学结果。先切入一对一辅导、课后答疑和标准知识讲解;数字人只是表达层,课程知识、状态机、评价与复盘才是护城河。
1. 已证实的商业规模
公司 2026 年 6 月自报;同时披露 3,000 万用户、85% Fortune 100。
2025 年官方里程碑;后续计费系统文章提及从 $40M 扩到约 $140M ARR。
1,250 分钟、10 路并发;定价直接暴露实时视频的分钟数与并发约束。
这些数字不可直接相加:披露时间、产品结构和统计口径不同。它们用于证明“已有付费规模”,不用于推算统一市场份额。
2. 玩家与产品地图
| 类别 | 代表 | 主要售卖物 | 证据与判断 |
|---|---|---|---|
| 异步 AI 视频 | HeyGen、Synthesia、D-ID | 培训、营销、本地化、视频 API | 营收与客户披露最强,是当前商业主战场。 |
| 实时交互 API | Tavus、腾讯云智能数智人 | 视频会话、并发流、WebRTC/客户端渲染 | 产品已可用,但按分钟、并发和 GPU 约束计价。 |
| 中国云厂商 | 腾讯云、阿里云 | 合成、直播、实时交互、WebGL/Unity/UE | 能力全面;阿里云曾下线通义星尘数字人服务,说明产品线仍在调整。 |
| 开源基础 | MuseTalk、LivePortrait、SadTalker、OpenAvatarChat | 口型、肖像驱动、端到端参考架构 | 大幅降低 Demo 门槛,但生产并发、授权和运维仍由集成方承担。 |
| 垂直方案 | 电商直播、教育培训、客服、医疗导诊 | 行业工作流与知识服务 | 价值取决于后端流程,不取决于脸本身。 |
3. 为什么没有形成全民级爆发
3.1 “能生成”不等于“值得实时生成”
异步视频替代摄影、剪辑、重录和多语种制作,ROI 容易计算;实时数字人常常只替代一个二维聊天窗口。如果任务不需要非语言线索,新增人脸会增加成本,却未必增加转化或学习效果。
3.2 五段延迟叠加,打断体验尤其难
语音识别、推理、语音合成、口型渲染、网络传输任一环节波动都会破坏轮流对话。Tavus 将低于 500ms 作为架构卖点,也允许客户替换 LLM/TTS,反向说明延迟与组件耦合正是核心工程问题。
3.3 单位经济受 GPU 并发支配
文本聊天可以高密度批处理;持续视频流需要为每个并发会话保留更多计算和带宽。Tavus 套餐把“分钟”和“并发流”同时商品化,正是成本结构的直接信号。
3.4 逼真度存在边际收益,甚至负收益
系统综述指出 uncanny valley 的定义和测量并不统一,但跨形态的不适反应持续存在;Talking Surveys 的研究中,加入数字人没有显著改善满意度,反而暴露回合延迟和 uncanny reactions。由此不能断言数字人无效,只能说明“加一张会动的脸”不是稳定的价值来源。
3.5 法规与信任成本成为产品功能
中国《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日施行,深度合成规则也要求标识与安全义务;欧盟 AI Act 的相关透明度义务自 2026 年 8 月 2 日适用。标识、授权、可追溯、撤回和审计不能后补。
3.6 教育真正难的是“教什么、何时怎么教”
数字人解决表达层;教学产品还需要教案编排、知识约束、误解诊断、掌握度状态、追问、评价和复盘。只做形象与 TTS,会得到一个展示技术,而不是可持续教学系统。
4. 商业机会评分(本项目判断)
| 场景 | 付费意愿 | 实时必要性 | 落地建议 |
|---|---|---|---|
| 企业培训与课程本地化 | 低 | 成熟现金流,可先做录制导出。 | |
| 一对一课后答疑 | 高 | 本项目优先;用学习结果证明价值。 | |
| 标准化招生/产品讲解 | 中 | 结合线索收集和人工接管。 | |
| 无人值守公开直播 | 高 | 合规、内容失控和平台规则风险高。 | |
| 泛陪伴数字人 | 高 | 留存与伦理难,不作为首发。 |
评分是基于证据的策略判断,并非第三方市场统计。
5. 下一步
- 用 3 门真实课程做闭环试点,指标锁定首答延迟、打断成功率、知识引用正确率、课后掌握度提升和单会话 GPU 成本。
- 形象层采用授权虚构角色;导师真人肖像和克隆声音必须在书面授权后单独启用。
- 实时版继续演进为音频分块与 WebRTC/帧流;异步高质量视频放入另一条产品线。
- 销售叙事从“数字人很逼真”切换为“同一教师可持续服务多少学生,以及学习结果提高多少”。
6. 进一步问题
- 目标学校愿意按教师席位、并发课堂、课程数量还是有效学习分钟付费?
- 真人相似度提升后,转化率是否足以覆盖授权和更高 GPU 成本?
- 哪些课堂动作必须由数字人表达,哪些用字幕、板书和语音更有效?
7. 局限
私营公司没有统一强制披露口径;ARR、客户数和估值来自不同日期,且多为公司自报。中国厂商通常不单独披露数字人业务利润,因此不能严谨回答每家“盈利多少”。本报告明确保留这些空白,没有用咨询机构预测填补事实缺口。