HUMAIN发布基于MiniMax M3的阿拉伯语模型 humain-m3,现开放研究预览
沙特主权财富基金旗下公司 HUMAIN 在 LEAP 活动上推出 humain-m3:一款由 MiniMax 交付、基于 MiniMax-M3 系列并针对阿拉伯语进一步训练的前沿大模型,目前以研究与评测预览形式在 HUMAIN Node 提供访问。模型权重尚未公开,HUMAIN 的七项基准领先说法需独立复测,权重开放与许可细节将影响后续商用和部署。
沙特主权财富基金旗下公司 HUMAIN 在 LEAP 活动上推出 humain-m3:一款由 MiniMax 交付、基于 MiniMax-M3 系列并针对阿拉伯语进一步训练的前沿大模型,目前以研究与评测预览形式在 HUMAIN Node 提供访问。模型权重尚未公开,HUMAIN 的七项基准领先说法需独立复测,权重开放与许可细节将影响后续商用和部署。
沙特阿拉伯主权财富基金公共投资基金(PIF)旗下人工智能公司 HUMAIN 于 2026 年 9 月 3 日在利雅得举行的 LEAP 活动期间宣布推出 humain-m3。这是一款由 HUMAIN 委托、MiniMax 交付的阿拉伯语大模型,目前通过 HUMAIN Node 以“研究与评测预览”形式提供访问。
HUMAIN 将 humain-m3 描述为一款面向阿拉伯语的前沿模型。公司称,模型基于 MiniMax-M3 系列,采用混合专家(MoE)架构,总参数量约为 4280 亿,并在超过 1 万亿个阿拉伯语原生内容 token 上进行了进一步预训练。
不过,这次发布需要区分三个不同层次:模型已经可以通过 HUMAIN Node 试用;HUMAIN 宣称的七项阿拉伯语基准平均成绩仍主要属于公司发布信息;而模型权重则尚未正式公开,后续开放计划也取决于安全训练和对齐工作的完成。
从 MiniMax M3 到面向阿拉伯语的定制模型
HUMAIN 的新闻稿将 humain-m3 称为基于 MiniMax-M3 系列进一步训练的模型,并明确写明模型由 HUMAIN 委托、MiniMax 交付。这意味着它并非一个完全脱离现有基础模型、从零开始训练的独立系统,而是在 MiniMax M3 技术路线之上,加入大规模阿拉伯语内容训练和面向当地语言场景的适配。
MiniMax 官方对 M3 的定位包括编码、智能体任务、超长上下文和原生多模态能力。公司介绍称,M3 使用自研的 MiniMax Sparse Attention 架构,支持最高 100 万 token 的上下文窗口,并面向长程编码、工具调用和复杂任务执行。
MiniMax 官方模型页显示,M3 约有 4280 亿参数,每个 token 约激活 230 亿参数;其官方博客还列出了 SWE-Bench Pro、Terminal-Bench 2.1 等编码与代理评测结果。这些是 MiniMax M3 本身的产品和评测信息,不能直接等同于 humain-m3 在阿拉伯语任务上的表现。
HUMAIN 此次没有在新闻稿中列出七项基准的具体名称、各项分数、测试提示词或完整评测配置。因此,外界目前可以确认的是公司发布了“七项公开阿拉伯语基准平均成绩最高”的说法,但还不能仅凭新闻稿复现这一结论。
七项基准的领先说法仍待独立复测
HUMAIN 表示,humain-m3 在七项公开阿拉伯语基准中的平均表现高于参与比较的其他前沿模型。公司将这一结果作为模型针对阿拉伯语理解与推理能力的主要依据。
但模型评测分数并不只取决于参数规模。测试所选择的任务、提示词语言、是否允许思考过程、推理时计算量、评分模型、版本和数据污染控制,都可能改变最终结果。阿拉伯语场景还涉及现代标准阿拉伯语与多种方言之间的差异,以及形态变化、词法歧义和文化语境等问题。
近期关于大模型基准的研究也在提醒业界,不应把单一平均分直接视为一种纯粹能力。AIFlux 对 BenchMIRT 大模型基准审计方法的报道指出,同一个基准中的不同题目可能混合测量推理、阅读理解、安全行为和任务执行等信号。对 humain-m3 而言,公开七项基准的名称、题目构成和完整测试条件,将是判断其“阿拉伯语领先”说法的重要前提。
这并不意味着 HUMAIN 的声明没有价值。专门面向阿拉伯语的测试,可以补足英语主导的全球模型评测中长期存在的覆盖不足。但在独立研究者能够获得模型、复现设置并比较结果之前,“最高平均成绩”更准确的表述仍应是公司自报结果,而不是已经得到广泛验证的行业结论。
研究预览不等于正式商用或已经开源
目前 humain-m3 的公开形态是 HUMAIN Node 上的 research and evaluation preview。按照 HUMAIN 的说法,研究人员和开发者可以通过该平台测试模型能力并提供反馈。新闻稿没有把它描述为面向所有用户的成熟商业 API,也没有说明完整的价格、速率限制、服务地区或企业级服务条款。
HUMAIN 还表示,模型权重计划在完成安全训练和对齐后,以 MiniMax Community License 发布,目标时间是 2026 年 10 月。这个时间表属于公司当前计划,并不代表权重已经公开,也不代表最终许可证条款、可商用范围或下载方式已经确定。
这一区分在开放模型竞争中尤其重要。AIFlux 此前报道的 Moonshot Kimi K3 开放权重发布显示,只有在权重、模型卡、许可证和下载渠道实际到位后,研究者才能进一步讨论本地部署和二次修改。相同标准也适用于 humain-m3。
MiniMax 近期发布 H3 时同样把开放权重和后续部署作为重要卖点,但权重发布时间、许可证和完整评测仍需要逐项确认。AIFlux 对 MiniMax H3 发布的报道也强调,开放权重并不自动等于完整开源:训练数据、训练代码和整个系统的可复现性可能仍未开放。
沙特的主权人工智能路线与中国模型生态
humain-m3 的发布也反映出沙特正在推进的全栈人工智能战略。PIF 于 2025 年 5 月宣布成立 HUMAIN,目标是覆盖数据中心、基础设施和云平台、人工智能模型以及面向行业的解决方案。PIF 的官方资料显示,HUMAIN 正与 NVIDIA、Microsoft、AMD、Qualcomm、AWS、Google Cloud 和 Groq 等公司建立合作关系。
HUMAIN 试图在这套基础设施和平台布局之上,建立针对阿拉伯语和本地行业需求的模型能力。阿拉伯语拥有覆盖多个国家和地区的庞大使用者群体,但在全球前沿模型训练数据、公开评测和开发者工具中仍相对不足。阿拉伯语大模型研究综述指出,语言形态复杂、方言多样、文化语境差异和高质量数据不足,都增加了模型训练与评测的难度。
与此同时,Bloomberg 在 9 月 3 日的报道中指出,HUMAIN 的新模型建立在中国 AI 公司 MiniMax 的 M3 模型之上。报道把这次合作放在各国寻求更强人工智能控制力的背景下,认为沙特正在同时推进本国 AI 能力建设和国际技术合作。
这使 humain-m3 的意义不只在于一个阿拉伯语模型的发布。它还展示了一种更现实的主权 AI 路线:由国家资本建设算力、云和数据基础设施,再通过委托外部模型公司交付基础模型,最后针对本地语言和行业内容进行继续训练与产品化。这样的路线可能比完全从零打造每一层技术更快,但也会带来基础架构依赖、许可边界、模型治理和长期技术自主性等问题。
接下来需要观察什么
首先是权重是否能按计划在 10 月发布,以及最终采用的 MiniMax Community License 是否允许研究、商业部署、再训练和再分发。其次是 HUMAIN 是否会公开七项阿拉伯语基准的名称、样本、提示词、评分方法和与其他模型的统一测试结果。
还需要观察 HUMAIN Node 的预览是否会扩大为稳定的开发者服务,包括 API 文档、价格、速率限制、区域可用性和数据处理条款。对企业客户而言,这些实际条件通常比参数量或单次排行榜成绩更能决定模型是否适合部署。
目前可以确认的结论是:HUMAIN 已宣布推出基于 MiniMax M3 技术路线、针对阿拉伯语进一步训练的 humain-m3,并通过 HUMAIN Node 提供研究与评测预览。至于它是否能在独立复测中保持七项基准的平均领先,以及计划中的开放权重能否按期、按承诺发布,仍有待后续材料和实际测试确认。
来源
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

