HeyGem 能解决什么问题?
如果你需要制作口播视频但不想露脸,或者想批量生成虚拟主播内容,HeyGem 就是为你准备的。它是一款开源的本地数字人驱动工具,核心功能是:导入一段音频和一张人物图片(或视频),自动生成口型同步的数字人视频。所有计算都在你自己的电脑上完成,不需要上传数据到云端,隐私安全,而且免费。
相比国内常见的云端数字人服务(如硅基智能、腾讯智影等),HeyGem 的优势是完全离线、无时长限制、可自定义模型。缺点是需要一定的动手能力,要自己配置 Python 环境和下载模型。下面我会一步步带你完成部署和驱动。
准备工作:注册与入口
HeyGem 是开源项目,不需要注册账号。你只需要:
- 一台带 NVIDIA 显卡的电脑:显存建议 8GB 以上,最低 6GB 可尝试。Windows 10/11 或 Linux 均可。
- 安装 Python 3.10:去 Python 官网下载安装包,安装时勾选“Add Python to PATH”。
- 安装 Git:用于下载项目代码,国内可用 Gitee 镜像加速。
- 下载 HeyGem 项目:打开命令提示符,输入
git clone https://gitee.com/mirrors/HeyGem.git(如果 Gitee 没有,用 GitHub 原地址,但可能需要科学上网)。 - 下载预训练模型:项目 README 里会提供模型下载链接,通常放在百度网盘或 Hugging Face。国内用户建议用百度网盘,下载后解压到项目目录的
models文件夹。
注意:不要从不明来源下载模型,避免病毒。所有操作都在本地,不需要注册任何账号。
分步骤实操:从安装到生成第一个视频
步骤 1:安装依赖
打开命令提示符,进入项目文件夹:cd HeyGem。然后输入:pip install -r requirements.txt。如果下载慢,可以加上国内镜像:pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple。等待所有包安装完成,通常需要 5-10 分钟。
步骤 2:检查显卡驱动
输入 nvidia-smi,如果显示显卡信息,说明驱动正常。如果报错,去 NVIDIA 官网下载最新驱动。HeyGem 依赖 CUDA,建议安装 CUDA 11.8 或 12.1,具体看项目要求。
步骤 3:启动 Web 界面
在项目目录下输入:python app.py。等待片刻,命令行会显示一个本地地址,通常是 http://127.0.0.1:7860。复制这个地址,用浏览器打开。你会看到一个简洁的网页界面,这就是 HeyGem 的操作台。
步骤 4:上传素材
界面左侧有两个上传区域:“上传人物图片或视频”和“上传音频文件”。点击第一个按钮,选择一张正面清晰的人脸照片(建议 512x512 以上,光线均匀)。点击第二个按钮,选择一段 WAV 或 MP3 格式的音频(建议 16kHz 采样率,时长不超过 5 分钟)。
步骤 5:调整参数
上传后,下方会出现几个滑块:“口型强度”控制嘴部动作幅度,默认 1.0 即可;“头部姿态”可选“静态”或“自然”,静态适合证件照,自然适合半身像;“生成分辨率”建议选 512x512,显存不够就选 256x256。其他保持默认。
步骤 6:开始生成
点击界面中间的“开始生成”按钮。进度条会显示处理进度,通常 1 分钟音频需要 2-5 分钟生成(取决于显卡)。生成完成后,右侧会出现预览窗口,点击“下载”按钮保存 MP4 文件。
步骤 7:检查与微调
如果口型对不上,回到步骤 5,把“口型强度”调到 1.2 或 1.5。如果画面模糊,提高分辨率。如果生成失败,查看命令行报错,常见问题是显存不足,降低分辨率或缩短音频即可。
进阶技巧
| 技巧 | 说明 | 效果 |
|---|---|---|
| 批量生成 | 把多张图片和多个音频分别放在两个文件夹,用项目自带的 batch.py 脚本批量处理 | 节省重复操作时间 |
| 使用视频作为源 | 上传一段人物视频代替图片,HeyGem 会保留原始动作,只改口型 | 更自然,适合已有素材 |
| 调整音频预处理 | 用 Audacity 把音频降噪、标准化到 -3dB,再输入 | 口型更精准 |
| 更换模型 | 在 models 文件夹替换不同训练的面部模型 | 改变数字人风格 |
| 降低显存占用 | 启动时加参数 --lowvram,或把分辨率降到 256 | 6GB 显卡也能跑 |
常见问题
Q1:生成时提示“CUDA out of memory”怎么办?
这是显存不足。先关闭其他占用显卡的程序(如游戏、浏览器)。然后在启动命令后加 --lowvram,或者把生成分辨率调到 256x256。如果还不行,把音频剪短到 30 秒以内测试。
Q2:口型完全对不上,或者嘴不动?
首先检查音频是否有人声,纯音乐不会驱动口型。其次,图片必须包含清晰正脸,侧脸或遮挡会导致失败。可以尝试把“口型强度”调到 1.5,或者换一张图片。如果还是不行,用项目自带的示例图片和音频测试,排除素材问题。
Q3:生成速度太慢,能加速吗?
速度取决于显卡。建议使用 NVIDIA RTX 3060 以上显卡。另外,把音频切成 1 分钟以内的片段分别生成,再拼接,比一次性生成长音频更快。如果使用 CPU 模式(不推荐),会慢 10 倍以上。
最后提醒:HeyGem 是本地工具,所有数据都在你电脑上,不会上传。但请遵守法律法规,不要用他人肖像制作虚假视频。现在,打开你的命令行,开始部署吧。
智库妙影 AI数字人
智库创课 AI课件
智库GEO AI搜索优化
智库妙鉴 AI命理文化
Agent社区 智能体交流
智影新媒体OS 新媒体创作
辽公网安备21021102001760号