MiniMax M3
100 万上下文·原生多模态·编码与智能体工作流旗舰 MoE 模型
MiniMax M3 是 MiniMax 于 2026 年 6 月发布的开源权重 AI 对话大模型,采用 428B 参数 MoE 架构(约 23B 激活参数),支持最高 100 万 token 上下文与文本、图像、视频原生多模态输入。MiniMax M3 搭载 MiniMax Sparse Attention(MSA)稀疏注意力,在长上下文编码与 Agent 任务中兼顾速度与质量,在编码、工具调用与长程协作等场景达到前沿水平。无论你是开发者、AI 工程师还是企业团队,都可在线了解并接入 MiniMax M3 完成智能对话与自动化工作流。
上下文窗口
100 万 token
总参数量
428B MoE
激活参数
约 23B
输入模态
文本/图/视频
💡 Why Choose
为什么选择 MiniMax M3?
MiniMax M3 是 MiniMax 在 2026 年 6 月正式发布的 AI 对话大模型,以「长上下文 + 原生多模态 + 编码 Agent」为核心定位。模型采用 428B 参数 MoE 架构,每次推理约激活 23B 参数,在保持高效推理的同时,提供最高 100 万 token 的 API 上下文窗口——可将中型至大型代码库、长篇文档或完整 Agent 会话历史一次性纳入模型视野。
MiniMax M3 的核心架构创新是 MiniMax Sparse Attention(MSA)。相较传统全注意力,MSA 在百万 token 规模下将单 token 算力降至前代 M2 的约 1/20,Prefill 与 Decode 分别实现约 9× 与 15× 加速,使「超长上下文」从理论参数变为可实际调用的生产力。与此同时,MiniMax M3 从训练第一步即混合文本、图像与视频,是少数具备原生多模态理解能力的开源权重对话模型之一。
在哔咔哔咔 AI,你可以一站式了解 MiniMax M3 的核心能力、思考模式差异、典型适用场景与接入方式,快速判断该模型是否适合你的编码、Agent 或多模态对话需求,并前往在线体验。
⚡ Features
MiniMax M3 核心功能
以下六大能力构成了 MiniMax M3 在 AI 对话、编码与 Agent 领域的核心竞争力。
100 万 Token 超长上下文
MiniMax M3 支持最高 100 万 token 上下文窗口(官方保证最低 512K),可一次性载入大型代码库、长篇文档或多轮 Agent 历史,实现仓库级全局推理。
原生多模态输入
MiniMax M3 从训练第一步即混合文本、图像与视频模态,支持 deeper 语义融合,可用于视频理解、视觉问答与跨模态 Agent 任务。
前沿编码与 Cowork 能力
MiniMax M3 在长程 Agent 基准与编码任务中表现突出,适合代码生成、审查、重构及多文件协作开发,可与 MiniMax Code 等 Agent 产品配合使用。
MSA 稀疏注意力加速
MiniMax M3 采用 MiniMax Sparse Attention(MSA),在 100 万上下文下 Prefill 提速约 9×、Decode 提速约 15×,单 token 算力约为前代 M2 的 1/20。
可切换思考模式
MiniMax M3 支持思考模式开启或关闭:开启时适合复杂推理与 Agent 任务;关闭时延迟更低,适合对话补全与高频调用场景。
工具调用与 Agent 工作流
MiniMax M3 面向工具使用与交错思考(Interleaved Thinking)优化,可在工具执行后重新评估状态,适合构建多步骤自动化与 Computer Use 类应用。
🔄 Compare
MiniMax M3 思考模式对比
MiniMax M3 支持按请求切换思考模式,以下对比帮助你在复杂 Agent 与低延迟场景之间做出选择。
| 对比维度 | 思考模式开启 | 思考模式关闭 |
|---|---|---|
| 适用场景 | 复杂推理、Agent、长程协作 | 对话、代码补全、高频调用 |
| 响应延迟 | 较高(质量优先) | 低延迟、高吞吐 |
| 推理深度 | 更深,适合多步任务 | 直接输出,速度优先 |
| Agent 表现 | 工具调用与交错思考更稳 | 轻量交互更合适 |
| 编码任务 | 复杂重构、跨文件分析 | 单行/局部补全 |
| API 定价 | 与关闭模式相同 | 与开启模式相同 |
| 切换方式 | thinking 参数开启 | thinking 参数关闭 |
| 推荐搭配 | MiniMax Code Agent | 实时聊天 Bot |
💎 Highlights
MiniMax M3 技术亮点
- MiniMax M3 支持最高 100 万 token 上下文,适合仓库级代码与长文档分析
- MiniMax M3 采用 428B MoE 架构、约 23B 激活参数,兼顾能力密度与推理效率
- MiniMax M3 的 MSA 稀疏注意力在百万上下文下显著降低算力与 KV Cache 压力
- MiniMax M3 原生多模态:文本、图像、视频输入统一建模
- MiniMax M3 思考模式可按请求切换,复杂 Agent 与低延迟场景灵活适配
- MiniMax M3 提供 OpenAI / Anthropic 兼容 API,并开放 Hugging Face 权重可自部署
🎯 Use Cases
MiniMax M3 适用场景
从仓库级编码到多模态 Agent,MiniMax M3 在以下六大场景中提供稳定、高效的长上下文 AI 对话与推理能力。
开发者 · 架构师
大型代码库理解与重构
MiniMax M3 100 万 token 上下文可一次性载入中型至大型 monorepo 的关键模块,无需分块 RAG 即可完成跨文件依赖分析、重构方案设计与代码审查。
- 100 万 token
- 代码库
- MiniMax M3
内容团队 · 产品经理
长视频与多模态分析
MiniMax M3 原生支持图像与视频输入,可结合文本指令完成视频内容摘要、镜头理解、视觉问答与跨模态信息提取,适合媒体与创意工作流。
- 多模态
- 视频理解
- MiniMax M3
AI 工程师 · 技术团队
编码 Agent 与自动化开发
MiniMax M3 在长程 Agent 基准与编码任务中达到前沿水平,可与 MiniMax Code 等 Agent 产品配合,驱动多步骤开发、测试与部署自动化。
- 编码 Agent
- MiniMax Code
- 工具调用
开发者 · 自动化工程师
长程智能体工作流
MiniMax M3 面向交错思考优化,可在工具执行后重新评估状态,适合构建需要多轮工具调用、状态跟踪与结果汇总的 Agent 管线。
- Agent 工作流
- 工具调用
- MSA
产品团队 · RPA 工程师
Computer Use 与桌面自动化
MiniMax M3 支持 Computer Use 类能力方向,可结合视觉输入理解界面状态并规划操作步骤,拓展 AI 对话到桌面级自动化场景。
- Computer Use
- 桌面自动化
- MiniMax M3
企业 IT · 运维团队
企业 API 集成与自托管
MiniMax M3 提供 OpenAI / Anthropic 兼容 API,同时开放 Hugging Face 权重,企业可按合规需求选择云端调用或私有化部署。
- API 集成
- 开源权重
- 自托管
📖 Guide
MiniMax M3 使用教程
按照以下步骤,即可快速上手 MiniMax M3 并完成第一次 AI 对话或 Agent 任务。
-
选择思考模式
根据任务选择思考模式:复杂推理、Agent 与多步协作建议开启思考;对话补全与低延迟场景可关闭思考。
-
编写提示词
编写结构化系统提示与用户指令,明确角色、工具权限与输出格式,MiniMax M3 对清晰任务描述响应更稳定。
-
配置 API 参数
长上下文任务尽量一次性传入完整材料(代码库摘要、文档全文或对话历史),充分利用 MiniMax M3 的 100 万 token 窗口。
-
迭代优化
通过 MiniMax API(OpenAI / Anthropic 兼容)或自托管权重发起请求,Agent 场景需完整保留 assistant 工具调用与推理链到对话历史。
❓ FAQ
MiniMax M3 常见问题
关于 MiniMax M3 的功能、上下文、多模态与接入方式,以下是用户最常问的问题。
MiniMax M3 是什么?适合谁使用?
MiniMax M3 是 MiniMax 发布的开源权重 AI 对话大模型,面向编码、Agent 工作流与长上下文多模态任务。适合开发者、AI 工程师、需要处理大型代码库或长文档的技术团队,以及希望 API 接入或自托管部署的企业用户。
MiniMax M3 的上下文窗口有多大?
MiniMax M3 API 支持最高 100 万 token 上下文(输入与输出合计),官方页面说明保证最低 512K。该能力适合整库代码分析、长篇报告处理与需要完整历史的 Agent 会话。
MiniMax M3 支持哪些输入模态?
MiniMax M3 是原生多模态模型,支持文本、图像与视频输入,输出为文本。可用于视觉问答、视频内容理解,以及结合文本指令的跨模态 Agent 任务。
MiniMax M3 的思考模式如何切换?
MiniMax M3 可通过 API 的 thinking 参数控制:开启时模型会进行额外推理,适合复杂 Agent 与编码任务;关闭时响应更快,适合对话与代码补全。两种模式可按每次请求独立切换。
MiniMax M3 与 MiniMax M2 相比有哪些提升?
MiniMax M3 引入 MSA 稀疏注意力,在 100 万上下文下算力约为 M2 的 1/20,Prefill / Decode 显著加速;同时扩展至原生多模态与更强的编码、Agent 能力,上下文从 M2 级别跃升至百万 token 规模。
如何接入 MiniMax M3?
可通过 MiniMax 官方 API(支持 OpenAI 与 Anthropic 兼容格式)在线调用 MiniMax M3;也可从 Hugging Face 下载开源权重自托管部署。推荐参数参考官方建议:temperature=1.0、top_p=0.95。
💡 Tips
MiniMax M3 提示词与接入建议
复杂 Agent、跨文件编码与长文档分析建议开启思考模式;实时对话与补全场景关闭思考以降低延迟。
Agent 会话需将完整 assistant 回复(含工具调用与推理内容)追加到历史,MiniMax M3 才能保持上下文连贯。
长上下文任务优先一次性传入完整材料,充分利用 MiniMax M3 的 100 万 token 窗口,避免过度切分导致信息丢失。
推荐 API 参数参考官方建议:temperature=1.0、top_p=0.95;输出 token 建议控制在 131072 以内以获得更稳定体验。
多模态任务在提示词中明确说明需关注的视觉元素与时间范围,MiniMax M3 对结构化多模态指令响应更准确。