D

DaVinci MagiHuman

已认证
付费

开源AI从单张照片和音频/文本生成同步口型的对话视频。

速览信息

定价
付费
20
浏览
0
收藏
收录时间
2026年3月
官方网址
github.com

工具概览

概览

daVinci-MagiHuman 是来自 SII-GAIR 和 Sand.ai 的开源音视频生成基础模型。它采用单流 Transformer,输入文本 token、可选的参考图像 latent 以及带噪视频和音频 token,并在统一的 token 序列中联合去噪视频和音频。该架构被描述为一个统一的 15B 参数、40 层 Transformer,仅通过自注意力联合处理文本、视频和音频,没有交叉注意力或多流复杂性。 关键设计选择包括三明治架构,其中前 4 层和后 4 层使用模态特定投影,而中间 32 层跨模态共享参数;无时间步去噪、逐头门控和统一条件。该模型支持中文(普通话和粤语)、英语、日语、韩语、德语和法语,据报道可在单块 H100 GPU 上 2 秒生成 5 秒 256p 视频,38 秒生成 5 秒 1080p 视频。 高效推理技术包括潜空间超分辨率、turbo VAE 解码器、通过 MagiCompiler 进行全图编译,以及 DMD-2 蒸馏,仅需 8 个去噪步骤即可生成。该项目在 Apache License 2.0 下发布完整的模型栈:基础模型、蒸馏模型、超分辨率模型和推理代码。

产品截图

DaVinci MagiHuman screenshot 1

相关标签

AI Avatar Video Generator
AI Video Generator
AI Lip Sync Generator
Open Source AI Models
Image to Video

应用场景

  • 团队使用 daVinci-MagiHuman 仅凭文本提示生成视频(T2V)。

  • 团队使用 daVinci-MagiHuman 以参考图像为条件生成视频(TI2V)。

  • 团队使用 daVinci-MagiHuman 制作以人为中心的视频,具备富有表现力的面部表演和语音与表情协调。

  • 团队使用 daVinci-MagiHuman 生成多种语言的对话视频。

  • 团队使用 daVinci-MagiHuman 通过潜空间超分辨率将生成的视频精修至 540p 或 1080p。

  • 团队使用 daVinci-MagiHuman 在单块 H100 GPU 上快速运行视频生成。

  • 团队使用 daVinci-MagiHuman 通过 Enhanced Prompt 系统将用户输入改写为详细的表演指导。

用户评论

还没有评论,来分享你的使用体验吧

相关榜单与专题