HeyGem 怎么用?本地数字人部署与驱动教程

🤖 本文由 AI 辅助生成,编辑团队审核发布 · 内容仅供参考,纠错反馈
AI教程 2026-09-30
0

HeyGem 能解决什么问题?

如果你需要制作口播视频但不想露脸,或者想批量生成虚拟主播内容,HeyGem 就是为你准备的。它是一款开源的本地数字人驱动工具,核心功能是:导入一段音频和一张人物图片(或视频),自动生成口型同步的数字人视频。所有计算都在你自己的电脑上完成,不需要上传数据到云端,隐私安全,而且免费。

相比国内常见的云端数字人服务(如硅基智能、腾讯智影等),HeyGem 的优势是完全离线、无时长限制、可自定义模型。缺点是需要一定的动手能力,要自己配置 Python 环境和下载模型。下面我会一步步带你完成部署和驱动。

准备工作:注册与入口

HeyGem 是开源项目,不需要注册账号。你只需要:

  • 一台带 NVIDIA 显卡的电脑:显存建议 8GB 以上,最低 6GB 可尝试。Windows 10/11 或 Linux 均可。
  • 安装 Python 3.10:去 Python 官网下载安装包,安装时勾选“Add Python to PATH”。
  • 安装 Git:用于下载项目代码,国内可用 Gitee 镜像加速。
  • 下载 HeyGem 项目:打开命令提示符,输入 git clone https://gitee.com/mirrors/HeyGem.git(如果 Gitee 没有,用 GitHub 原地址,但可能需要科学上网)。
  • 下载预训练模型:项目 README 里会提供模型下载链接,通常放在百度网盘或 Hugging Face。国内用户建议用百度网盘,下载后解压到项目目录的 models 文件夹。

注意:不要从不明来源下载模型,避免病毒。所有操作都在本地,不需要注册任何账号。

分步骤实操:从安装到生成第一个视频

步骤 1:安装依赖

打开命令提示符,进入项目文件夹:cd HeyGem。然后输入:pip install -r requirements.txt。如果下载慢,可以加上国内镜像:pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple。等待所有包安装完成,通常需要 5-10 分钟。

步骤 2:检查显卡驱动

输入 nvidia-smi,如果显示显卡信息,说明驱动正常。如果报错,去 NVIDIA 官网下载最新驱动。HeyGem 依赖 CUDA,建议安装 CUDA 11.8 或 12.1,具体看项目要求。

步骤 3:启动 Web 界面

在项目目录下输入:python app.py。等待片刻,命令行会显示一个本地地址,通常是 http://127.0.0.1:7860。复制这个地址,用浏览器打开。你会看到一个简洁的网页界面,这就是 HeyGem 的操作台。

步骤 4:上传素材

界面左侧有两个上传区域:“上传人物图片或视频”和“上传音频文件”。点击第一个按钮,选择一张正面清晰的人脸照片(建议 512x512 以上,光线均匀)。点击第二个按钮,选择一段 WAV 或 MP3 格式的音频(建议 16kHz 采样率,时长不超过 5 分钟)。

步骤 5:调整参数

上传后,下方会出现几个滑块:“口型强度”控制嘴部动作幅度,默认 1.0 即可;“头部姿态”可选“静态”或“自然”,静态适合证件照,自然适合半身像;“生成分辨率”建议选 512x512,显存不够就选 256x256。其他保持默认。

步骤 6:开始生成

点击界面中间的“开始生成”按钮。进度条会显示处理进度,通常 1 分钟音频需要 2-5 分钟生成(取决于显卡)。生成完成后,右侧会出现预览窗口,点击“下载”按钮保存 MP4 文件。

步骤 7:检查与微调

如果口型对不上,回到步骤 5,把“口型强度”调到 1.2 或 1.5。如果画面模糊,提高分辨率。如果生成失败,查看命令行报错,常见问题是显存不足,降低分辨率或缩短音频即可。

进阶技巧

技巧说明效果
批量生成把多张图片和多个音频分别放在两个文件夹,用项目自带的 batch.py 脚本批量处理节省重复操作时间
使用视频作为源上传一段人物视频代替图片,HeyGem 会保留原始动作,只改口型更自然,适合已有素材
调整音频预处理用 Audacity 把音频降噪、标准化到 -3dB,再输入口型更精准
更换模型在 models 文件夹替换不同训练的面部模型改变数字人风格
降低显存占用启动时加参数 --lowvram,或把分辨率降到 2566GB 显卡也能跑

常见问题

Q1:生成时提示“CUDA out of memory”怎么办?

这是显存不足。先关闭其他占用显卡的程序(如游戏、浏览器)。然后在启动命令后加 --lowvram,或者把生成分辨率调到 256x256。如果还不行,把音频剪短到 30 秒以内测试。

Q2:口型完全对不上,或者嘴不动?

首先检查音频是否有人声,纯音乐不会驱动口型。其次,图片必须包含清晰正脸,侧脸或遮挡会导致失败。可以尝试把“口型强度”调到 1.5,或者换一张图片。如果还是不行,用项目自带的示例图片和音频测试,排除素材问题。

Q3:生成速度太慢,能加速吗?

速度取决于显卡。建议使用 NVIDIA RTX 3060 以上显卡。另外,把音频切成 1 分钟以内的片段分别生成,再拼接,比一次性生成长音频更快。如果使用 CPU 模式(不推荐),会慢 10 倍以上。

最后提醒:HeyGem 是本地工具,所有数据都在你电脑上,不会上传。但请遵守法律法规,不要用他人肖像制作虚假视频。现在,打开你的命令行,开始部署吧。

用AI上智库 · 每日精选 AI 工具与实战教程
收藏 AI智库,每天 3 分钟掌握最新 AI 动态;5000+ 人在用的工具库持续更新。
逛逛工具库 →
©️版权声明:若无特殊声明,本站所有文章版权均归AI智库原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章

发表评论