MiniMax预告生图模型

MiniMax H3团队在Reddit AMA中透露,正在开发一款专门的图像模型,并计划开放权重。

核心要点

  • 功能整合:将文生图和通用图片编辑放进同一个模型,单个模型包办两类任务

  • 架构沿用:基于H3同一套架构思路,沿用H3的VAE Encoder,为图片生成单独设计VAE Decoder

  • 开发进度:目前已经进入后训练优化阶段


工作流设计

MiniMax设想的工作流是:先用图像模型生成首帧,再交给H3继续生成视频,形成「图生视频」的完整链路。

技术依据

团队透露,H3本身已表现出一定的生图和修图潜力。此前仅训练模型根据「首帧+文字描述」预测尾帧,未专门做图片编辑训练,但模型在多项图片编辑评测中仍展现出较强的零样本能力,成为将该架构扩展到图像模型的重要依据。