企业提出“定制一个3D数字人”时,往往先从人物长什么样开始讨论。但如果不了解使用场景、镜头距离、终端性能和驱动方式,一个静态效果很好的角色,进入直播或实时交互后可能出现表情僵硬、动作穿模、帧率不足和后续资产无法扩展等问题。
3D数字人不是一张三维人物图,而是一套可以持续驱动、渲染和维护的角色资产。本文以实时应用为目标,拆解从角色设定到 Unreal Engine(UE)集成的完整流程。
先判断是否真的需要3D数字人
更适合2D真人克隆的情况
- 需要快速生成大量口播视频;
- 主要使用固定机位和半身画面;
- 强调真人辨识度和短周期上线;
- 对自由运镜、全身动作和虚拟场景要求不高。
这类需求可优先评估数字人形象克隆。
更适合3D数字人的情况
- 需要全身动作、自由镜头和实时灯光;
- 角色要进入不同虚拟场景;
- 计划长期扩展服装、发型和动作;
- 需要品牌IP而不是复刻具体真人;
- 用于展厅、大屏、虚拟直播、游戏或沉浸空间;
- 需要与动捕、实时交互或UE系统连接。
3D方案前期投入更高,但角色资产可塑性和可扩展性更强。
第一步:把“好看”翻译成可执行的角色设定
角色设定应回答五组问题。
品牌与受众
- 角色代表企业、产品还是独立IP;
- 目标受众的年龄、行业和使用环境;
- 希望传递专业、亲切、科技还是文化感;
- 哪些品牌色、服装元素和符号必须保留;
- 哪些表达和造型需要避免。
美术风格
常见方向包括写实、轻写实、卡通、国风和潮流IP。不要只给“高级”“未来感”这类抽象词,应提供参考图并标注具体喜欢的部分:面部比例、材质、服装、色彩还是灯光。
使用镜头
角色是近景面部、半身讲解还是全身主持?近景对皮肤、眼睛、牙齿和头发要求更高;全身则需要重点处理服装、手部、脚步和动作。
驱动方式
- 文本或语音驱动口型;
- 摄像头面捕;
- 专业面部捕捉;
- 全身动作捕捉;
- 预制动作库;
- AI根据语义选择表情和动作。
目标终端
高性能工作站、普通PC、网页、移动端和一体机的资源完全不同。必须在建模前确定性能预算。
第二步:概念设计与多视图确认
概念阶段通常包括正面、侧面、背面、表情、服装和关键道具。确认时重点看:
- 轮廓是否有辨识度;
- 五官比例是否能支持目标表情;
- 服装是否符合动作需求;
- 颜色在深色和浅色背景中是否清晰;
- 发型是否容易出现穿插;
- 品牌元素是否克制且可复用。
如果根据真人制作,需要确认是高度还原、轻度美化还是风格化。这个边界越早明确,后期反复修改越少。
第三步:模型、拓扑与UV
高模雕刻
高模用于建立面部、身体、服装和细节形态。写实角色需要处理皮肤起伏、眼睑厚度、嘴唇结构和面部不对称,过度光滑反而会失去真实感。
低模与拓扑
实时角色需要把高模细节转移到更适合运行的网格上。面部拓扑应围绕眼睛、嘴、鼻翼和眉部形成合理环线,否则做表情时容易拉扯和塌陷。
需要提前约定:
- 面部和身体面数;
- 头发采用发片、曲线还是其他方式;
- 服装是否独立;
- 是否需要LOD层级;
- 是否支持后续换装。
UV与材质分区
UV影响纹理清晰度和后续换装。面部、身体、眼睛、牙齿、头发和服装通常需要分区管理,同时控制材质数量,避免实时渲染调用过多。
第四步:材质决定“像不像”
写实3D人物常见的不自然,并不一定来自模型,而可能来自材质和灯光。
皮肤
需要综合颜色、法线、粗糙度、次表面散射和微细节。过度磨皮会像塑料,粗糙度完全一致则缺少真实皮肤变化。
眼睛
眼球高光、角膜、虹膜深度和泪线会显著影响生命感。眼神方向和眨眼节奏同样重要。
头发
头发既影响真实度,也消耗大量性能。要根据终端平衡发丝细节、透明材质和阴影质量。
服装
材质应表现布料、金属或皮革的真实差异,同时测试大幅动作下的拉伸和穿插。
第五步:骨骼、表情与口型绑定
身体骨骼
需要覆盖脊柱、肩臂、手指、腿和脚,并建立适合动作库或动捕数据的骨骼规范。
面部绑定
面部可以采用骨骼、变形目标或混合方式。实时交互通常需要:
- 基础音素口型;
- 眨眼与眼球;
- 眉眼情绪;
- 嘴角和面颊;
- 下颌与舌齿;
- 呼吸和头部微动。
如果要接入标准面捕或特定驱动系统,应提前对齐表情参数命名和数量。
手部与细节
讲解和主持场景中,手势出现频率很高。手指权重、手腕旋转和手臂抬起需要单独测试。
第六步:动作与行为设计
角色不能只有待机和说话两个状态。常用动作包括:
- 自然站立与重心变化;
- 欢迎、指引和告别;
- 左右介绍、指向屏幕;
- 思考、确认和未理解;
- 不同情绪下的说话动作;
- 行走、转身和场景交互。
动作幅度应符合角色性格和屏幕范围。公共服务数字人动作应克制、清晰;娱乐IP可以更夸张。
实时系统还要定义动作优先级:用户打断时如何停止、切换场景时如何过渡、业务等待时播放什么状态。
第七步:进入UE后的实时渲染
灯光与场景
角色材质必须在实际场景中验证。摄影棚效果好,不代表放进展厅、直播间或不同色温环境仍然自然。
性能预算
验收应明确目标设备、分辨率和帧率,并记录:
- GPU和CPU占用;
- 显存与内存;
- 面数和骨骼数量;
- 材质与Draw Call;
- 阴影和后处理成本;
- 多角色同时出现的性能;
- 长时间运行稳定性。
不要只在开发人员的高配电脑上验收。最终设备才是性能标准。
LOD与降级策略
当角色距离变远或设备性能较低时,可以降低模型、头发、阴影和后处理质量。合理降级比偶发卡顿更可控。
第八步:连接语音与AI交互
3D角色进入实时交互智能体后,还要联调:
- TTS与口型同步;
- 流式语音开始时的动作过渡;
- 句子语义与手势匹配;
- 用户打断后的声音、口型和动作停止;
- 等待模型时的自然反馈;
- 图文页面和场景镜头切换;
- 业务结果对应的表情与动作。
这些环节往往比单独展示角色模型更能决定最终体验。
3D数字人项目如何验收
视觉验收
- 正侧面和不同焦段是否保持人物特征;
- 面部、眼睛、牙齿和头发是否自然;
- 不同灯光下材质是否稳定;
- 服装和身体是否穿插;
- 近景是否出现明显模型或纹理问题。
表情与口型验收
- 常用音素是否准确;
- 快慢语速是否都能同步;
- 眨眼、眼神和头部微动是否自然;
- 笑、严肃、疑问等情绪是否符合角色;
- 极限表情是否出现拉伸和破面。
动作验收
- 常用动作是否完整;
- 过渡是否平滑;
- 手指、肩膀、肘部和膝盖是否变形;
- 动作与镜头范围是否匹配;
- 打断和状态切换是否及时。
工程验收
- 在目标设备达到约定帧率;
- 资源命名、目录和版本清晰;
- 模型、纹理、材质和动作可独立更新;
- 提供必要的源文件、引擎工程或交付说明;
- 授权范围和第三方素材清单明确。
常见返工原因
没有在建模前确定终端性能
后期才发现网页或一体机跑不动,只能大幅减面和降材质,效果与预期偏离。
只确认静态正面图
角色一说话或做表情就不像,是因为没有提前确认侧面、表情和动态参考。
服装设计忽略动作
复杂裙摆、配饰和宽袖可能在动作中频繁穿插,需要额外布料模拟和碰撞成本。
没有约定源资产与扩展规范
项目结束后无法换装、加动作或迁移引擎,长期价值大幅下降。
供应商沟通清单
在启动项目前,建议确认:
- 最终使用终端、分辨率和帧率;
- 写实程度和角色参考;
- 是否基于真人及其授权范围;
- 近景、半身和全身镜头比例;
- 面捕、动捕、语音或AI驱动方式;
- 表情参数与动作数量;
- 是否需要换装和后续扩展;
- 目标引擎和版本;
- 性能预算与测试设备;
- 源文件、版权和后续维护方式。
结语
3D数字人定制的质量,来自美术、动画、实时引擎和交互系统的共同约束。角色静态好看只是起点,真正的交付标准是它能否在目标设备上自然表达、稳定运行并持续扩展。
查看AirX 3D数字人定制能力,或通过商务合作页面提供角色风格、终端、镜头和驱动需求,获取更准确的制作范围与验收建议。
