MLX 版 MiniMax-H3 本地生成视频

两天前,MiniMax 发布了 MiniMax-H3,官方称其为“通用、全模态生成系统”,可接受文本、图像、音频和视频输入,并生成最长 15 秒的带音频视频。随后,PipeNetwork 在 GitHub 发布了该模型的 MLX 移植包,使得模型可在 Apple Silicon 设备上运行。Simon Willison 在博客中记录了他的完整实验过程。
他在 M5 Max MacBook Pro 上克隆仓库,用命令行下载了约 115 GB 的模型权重,以“a rainbow colored skunk leaps over a mossy log in a supermarket”为提示运行生成脚本。视频生成耗时约 45 分钟,他认为视频“令人印象深刻”,但音频因没有给出额外提示,变成了类似语音的杂乱声音。他提到官方提示指南包含大量关于音频生成的信息,而他实验前没有阅读。
这一移植的快速出现,反映了开源社区对在本地设备运行多模态模型的兴趣。MLX 是 Apple 的机器学习框架,MLX 移植使得 Mac 用户无需依赖云端 API 即可尝试前沿视频生成模型。Simon 的实测提供了可复现的命令和性能数据,对关注本地推理的用户有直接参考价值。
对于实际应用,用户需要注意约 115 GB 的磁盘占用和近 45 分钟的生成耗时;音频质量高度依赖提示词设计。
关键信息
- MiniMax 发布 MiniMax-H3,支持文本、图像、音频和视频输入,可生成最长 15 秒含音频视频。
- PipeNetwork 发布 MiniMax-H3 的 MLX 移植包,用于 Apple Silicon。
- Simon Willison 在 M5 Max MacBook Pro 上成功本地运行该模型。
- 模型文件约 115 GB,单条视频生成耗时不到 45 分钟。
- 未提供音频提示时,生成的音频为类语音噪声。
- 官方提示指南提供了音频生成相关指导。
为什么上榜
如果你有 Apple 芯片,这个 MLX 移植让你能本地运行 MiniMax-H3。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
