MiniMax预告生图模型:生图修图一模型包办
MiniMax预告生图模型
MiniMax H3团队在Reddit AMA中透露,正在开发一款专门的图像模型,并计划开放权重。
核心要点
- 功能整合:将文生图和通用图片编辑放进同一个模型,单个模型包办两类任务
- 架构沿用:基于H3同一套架构思路,沿用H3的VAE Encoder,为图片生成单独设计VAE Decoder
- 开发进度:目前已经进入后训练优化阶段
工作流设计
MiniMax设想的工作流是:先用图像模型生成首帧,再交给H3继续生成视频,形成「图生视频」的完整链路。
技术依据
团队透露,H3本身已表现出一定的生图和修图潜力。此前仅训练模型根据「首帧+文字描述」预测尾帧,未专门做图片编辑训练,但模型在多项图片编辑评测中仍展现出较强的零样本能力,成为将该架构扩展到图像模型的重要依据。