---
格式版本: 2
标题: "MiniMax H3开源技术解析：架构、推理与开放边界_腾讯新闻"
原文链接: "https://news.qq.com/rain/a/20260811A0ACLX00?adChannelId=tech?#to-comment"
发布日期: "2026-08-11"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:scrape:strict_html_metadata"
发布时间证据: "article:published_time: 2026-08-11 18:00:11"
发布时间校准原因: "规则确认唯一严格发布时间，来源 scrape:strict_html_metadata"
发布时间校准置信度: "high"
发布时间候选数量: 9
发布时间严格候选数量: 4
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-08-12T01:49:20+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-08-12T01:31:23+08:00"
入库时间: "2026-08-11T17:49:21.007Z"
来源平台: "固定入口"
搜索渠道: "fixed_url"
搜索词: "https://news.qq.com/ch/tech"
匹配关键词:
  - "GPU"
  - "内存"
  - "AI"
相关厂家:
  - "腾讯"
相关专家:
  []
内容类型: "网页"
抓取工具: "Free Fetch + Defuddle"
清洗工具: "Defuddle Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 5
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "正文为MiniMax H3视频生成模型的技术解析，与超节点、AI Rack、机柜级AI基础设施等核心主题完全无关，属于AI模型科普，无任何超节点或AI基础设施相关信号。"
AI质检模型: "ali-deepseek-v4-flash"
AI质检时间: "2026-08-12T01:50:37+08:00"
AI主题相关性: 0
AI来源权威性: 5
AI新颖性: 0
AI技术细节: 0
AI商业部署信号: 0
AI完整性: 0
AI摘要: "MiniMax 开源了视频生成模型 H3，文章解析其由 Context-IR、H3-Base、Regenerate-2K 三模块构成的架构与推理流程；"
AI摘要模型: "ali-deepseek-v4-flash"
AI摘要时间: "2026-09-07T03:41:10.328Z"
采集批次: "2026年8月11日21点09分57秒"
采集批次ID: "20260811-210957-092"
去重键: "https://news.qq.com/rain/a/20260811A0ACLX00?adChannelId=tech%3F"
---

问AI · 远景人脸模糊的根源在整套流程的哪个环节？

前阵子 MiniMax 放了个大招，

把新出的视频生成模型H3给开源了。

![图片](https://inews.gtimg.com/news_bt/OMtYZdex52KpSsLyN-TMWwOe9anuIFAWMehOzCfyHODOIAA/641)

在此之前，

天下苦 Seedance 久矣

Minimax H3属于打破垄断了，

它还有个很亮眼的功能就是全能参考，

老规矩，我来解析下H3模型的架构及推理

## H3这个模型，

## 是由三个模块接力完成的

![图片](https://inews.gtimg.com/news_bt/OqkMiNII0qLvrIE2BmxVvaiMUa8194R7DWUEsguIybZdEAA/641)

第一个叫 H3-Context-IR

你扔给它一堆多模态指令，

文字图片视频音频混着来，

它先帮你理清，

转成模型好消化的结构化表示。

这一步是隐形的，可惜这次没开源，依赖的东西太多，只能走 API。

![图片](https://inews.gtimg.com/news_bt/O0wTIQW13UwOvQhf743doZGwwgZcyH0uVTV0DZS2IBZlUAA/641)

我试过把只包含DeepSeek 的图片，

发给 MiniMax-H3 让它生成视频，

唱一首 rap，结果它能快速正确生成内容。

就是H3-Context-IR在发力。

那就说明它其实不仅仅是参考图片风格，

而且还会分析图片中的信息，

并结合词来进行新一轮的Prompt 优化改写

第二个是 H3-Base，真正干活的生成模型，吐出视频和音频。

第三个叫 H3-Regenerate-2K。让模型重新生成2K视频。

第三步是整套设计里最值得琢磨的地方，和传统路径差别很大

后面会展开聊。

## 第二个模块：H3-Base

![图片](https://inews.gtimg.com/news_bt/O5sgYC08mzdhG5GORijWCGcvMnseQC2qWUQa642H8VBAoAA/641)

H3-Base 的数据流，可以理解为

各种模态各自经过编码器或 VAE 压一遍，打包成一条统一的多模态序列，用 RoPE 标好时空关系，

送进 H3-Omni-Transformer，

让它一口气预测出视频和音频的 latent，

最后再分别解码出来。

## 为什么这么听话

H3 有个让人用一次就忘不掉的特点，它特别听话。

团队在 Reddit 的 AMA 里讲得很坦白，这种能力靠的是任务喂得多、喂得杂，模型自己悟出来的，跟哪个单一架构技巧关系不大。

![图片](https://inews.gtimg.com/news_bt/OKHBq94aqDj218QfLfV-FiJC0Vi4_Af3-ezIgtgAMls9IAA/641)

## 稀疏注意力：省显存的关键一手

视频模型最吃显存的就是长序列注意力。

H3 这套稀疏化方案是训练感知的，但这次开源的版本只放了 Full Attention 推理。

大家最关心的是，H3 用的稀疏注意力，是不是 M3 上那套 MSA。

答案是没用 MSA。

H3 的方案更接近 MoBA 那种 block selection：

利用相邻视觉 token 高度相关的特点，

先对一组 token 做 mean pooling 得到一个 block 表示，

再用它判断哪些 block 重要、哪些可以跳过，

而且不用额外训一个 learned indexer。

## 第三个模块：H3-Regenerate-2K

H3 的 2K 能力背后那套东西叫 in-context regeneration。

传统做法是接个独立超分模块，从低分辨率像素里猜细节。

🏆

H3 走了另一条路：让模型带着原始的多模态上下文，把低分辨率结果重新生成一遍。Regenerate-2K 本质上是个第二阶段的条件生成，用的是专门面向高分辨率的 latent-space DiT checkpoint，把基础模型的输出当成额外上下文，再加上一部分高分辨率参考输入。

这么做的好处很实在。

那些传统超分只能猜的东西，小字、细纹理，模型可以重新画出来。

代价是这套东西还没开源，复杂度高，现在只能走 API，

不过官方说会开源，不会太久。

## 它现在还做不好的几件事

夸归夸，坑也得说。

H3 现在有几个社区吐槽集中的问题、比如人物一拉远，脸就糊。

官方也认了的问题，

不管文生、图生还是参考生，

只要主体离镜头远一点、小一点，脸就开始像素化、五官乱飞。

官方回复说这事儿不能单怪 VAE 压缩比，

是整套 pipeline 串在一起的系统性问题，正在一个个拆。

## 600 亿参数，怎么塞进 24GB 的卡

开源部分大约 600 亿参数，官方主推两条优化路子。

一是量化，用更低精度存权重，省内存省搬运；二是 offloading，把当前要算的部分挪到 GPU，剩下的留在系统内存里。

开源这一周，社区已经冒出一堆量化版本、ComfyUI 适配、MLX 支持。推理框架官方推荐 SGLang、vLLM、diffusers、ComfyUI。

## 开了什么，没开什么

H3 是个开放权重模型，但开放权重不等于全开源。

已经或即将开的有这些：

H3-Base 核心权重；

H3-Regenerate-2K 即将开源；

稀疏注意力参考实现近期出保守版；

两份官方 prompt guide 和H3 Prompt Writing Skill

暂时没开的有这些：

H3-Context-IR

## AMA 上还有句挺放飞的话：

## Keep open until AGI arrived

H3 这次开源真正值得记一笔的地方，或许就在这里。

它做得还不完美，远景的人脸会糊，2K 还没完全放出，

Context-IR 还锁在 API 里。

但门，已经推开了。

十九世纪的人担心照相术会让画家失业，

后来的故事我们都知道，画家没有失业，

只是多了一种新的看见世界的方式。

这一次，大概也一样。

晓风乾丨 大四 Base北京 AI产品在职

想缩小科技带来的信息差 分享很酷的AI玩法。

希望得到您的点赞转发爱心三连支持，

如果有更多想法或者问题欢迎交流~
