EchoMimicV2 Accelerated

上传半身参考图和音频,使用官方加速权重与预置姿态模板生成说话视频。

动作/姿态模板
24 120

首次运行需下载约17GB模型。官方加速配置为768×768、6步;姿态模板决定身体动作,音频主要控制口型和节奏。