MBZUAI旗下研究机构发布K2 Horizon六款全开放模型
MBZUAI旗下IFM发布K2 Horizon系列六款开源模型,覆盖0.9B到375B参数,面向从可穿戴到企业服务器的多场景部署。IFM宣称“全开放”并公开权重、代码、训练配置与部分日志,但部分中间检查点与训练数据仍在分阶段发布,需后续验证可复现性。
MBZUAI旗下IFM发布K2 Horizon系列六款开源模型,覆盖0.9B到375B参数,面向从可穿戴到企业服务器的多场景部署。IFM宣称“全开放”并公开权重、代码、训练配置与部分日志,但部分中间检查点与训练数据仍在分阶段发布,需后续验证可复现性。
阿布扎比穆罕默德·本·扎耶德人工智能大学(MBZUAI)旗下 Institute of Foundation Models(IFM)9月3日发布 K2 Horizon 模型系列,覆盖从0.9B到375B参数的六个版本,面向可穿戴设备、手机、本地工作站和企业部署等不同场景。
IFM将这次发布描述为一次“全开放”模型发布:除模型权重外,还公开代码、训练数据或数据构建方法、训练配置、检查点、评测结果和部分训练日志。模型与代码采用 Apache 2.0 许可证。相关信息见 IFM官方新闻稿、IFM技术介绍 以及 MBZUAI公告。
不过,官方所说的“全开放”与模型仓库当前显示的交付状态之间存在需要继续观察的差异。部分 Hugging Face 模型卡显示,最终权重已经发布,但中间检查点、训练数据和训练代码仍标注为后续公开;32B模型页面则明确写着当前是 Stage 1 检查点,最终检查点尚未发布。因此,“全开放”目前更准确地说是这套发布的目标和总体承诺,具体材料仍需按模型和文件逐项核对。
六个模型覆盖从手表到企业服务器
K2 Horizon包括 0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B 六个版本。它们共享核心架构、词表、训练方法、接口、评测基础设施和部署工具,但0.9B版本使用了更小的词表。
0.9B是紧凑型稠密模型,IFM将其定位于手表、眼镜等内存和功耗受限的设备。其模型卡显示,该版本支持128K上下文,并在 AIME 2026 数学测试中获得48.5%的成绩;在 HumanEval+、MBPP+ 和 LiveCodeBench v6 等编码测试中也公布了相应结果。
3.7B和7B面向手机及其他本地设备。两者的模型卡显示,它们支持最高524,288个 token 的上下文窗口,并公开了中间检查点。7B模型在 IFM公布的比较表中,SWE-bench Verified 得分为70.6%,Terminal-Bench 2.1 得分为39.1%,但这些结果依赖特定的推理设置和评测协议,不能直接等同于所有环境下的独立表现。
32B是系列中的稠密模型,面向本地工作站和企业内部服务器。36B-A4B则采用稀疏架构,总参数量为36B,每个 token 约激活4B参数。最大的375B-A23B是稀疏混合专家模型,总参数量为375B,每个 token 约激活23B参数,主要面向复杂推理、软件工程、研究和长时程智能体任务。
这种从小模型到大模型的组合,是 IFM强调的“模型舰队”概念的一部分。开发者可以先使用小模型进行原型开发,再根据任务复杂度切换到更大的版本,同时保留相近的接口和部署流程。IFM还介绍了动态模型路由技术,试图根据任务选择成本更低的模型。
技术重点:稀疏注意力与并行生成
K2 Horizon的一个核心技术是 Mixture-of-Value Attention(MoVA),中文可译为“混合价值注意力”。传统混合专家模型通常主要在前馈网络部分采用稀疏路由,而 MoVA试图把专家路由引入注意力机制,在保持每个 token 计算量相对受控的同时扩大模型容量。
IFM称,36B-A4B在只激活约4B参数的情况下,性能接近同训练条件下的32B稠密模型。模型卡显示,在 Terminal-Bench 2.1 和 tau3-Banking 等测试中,该模型在部分比较对象中取得较高结果,但在科学推理、长上下文和事实准确性等指标上并非全面领先。由此看,MoVA的主要价值更接近于在计算成本和模型能力之间寻找新的平衡,而不是在所有基准上取代更大模型。
另一个技术方向是“扩散蒸馏”。IFM表示,该方法可以并行生成 token 块,在不降低响应质量的前提下将模型速度提高约3倍。官方材料把它描述为一种从自回归模型出发的加速方法,但具体吞吐表现仍会受到硬件、上下文长度、批处理方式和服务框架的影响。
模型目前可通过 Hugging Face获取,并提供 vLLM 和 SGLang 的部署支持。IFM还表示,K2 Horizon API已经通过 Compass、Cerebras、AWS 和 Nebius等推理合作伙伴提供。对于本地部署者而言,兼容性并不完全等于开箱即用:部分量化模型页面仍提示,需要包含 K2 Horizon架构支持的 llama.cpp版本,相关支持仍在推进中。
“开放”不仅是权重公开
IFM创始人、MBZUAI校长 Eric Xing在官方材料中说,开放源代码不应只意味着公开模型权重,还应让外部研究者能够看到数据、方法并复现实验结果。IFM将 K2 Horizon定位为其自2023年提出“fully open”原则以来的一次扩展,将开放范围从最终模型推进到预训练、推理训练和智能体后训练的完整过程。
这一点使 K2 Horizon与通常所说的“开放权重”模型有所区别。后者通常允许用户下载和运行最终权重,但不一定公开训练数据、数据处理方法、训练代码或中间状态。K2 Horizon试图把这些材料同时纳入发布范围,理论上可以帮助研究人员分析推理、工具调用和规划能力如何在训练过程中形成。
但对模型开放程度的判断,不能只看新闻稿中的定义,也要看仓库中具体文件是否已经可以下载、许可证是否允许再分发,以及训练数据是否完整公开。IFM的表述包括“训练数据或详细的数据构建配方”,这意味着当原始数据受许可证或隐私限制时,外部研究者可能拿到的是生成或筛选方法,而不是全部原始数据。
这类差异也与近期模型评测领域对可复现性的讨论相呼应。AIFlux此前在 BenchMIRT对大型语言模型基准的分析 中提到,单一平均分可能混合多种能力,评测环境和题目构成会影响结果。对于 K2 Horizon而言,公开训练过程固然有助于审查和复现,但模型的性能结论仍需要结合评测协议、推理参数、比较模型版本和是否允许联网等条件理解。
UAE试图建立开放式前沿模型研究能力
K2 Horizon也是 IFM扩张为全球研究机构的一部分。IFM由 MBZUAI于2025年5月设立,目前在阿布扎比、硅谷和巴黎设有办公室。MBZUAI则把这次发布放在阿联酋发展人工智能研究能力的更大背景下,强调由本国科研机构开发前沿模型并向全球开放。
从产业竞争角度看,K2 Horizon并不只是一次单模型发布。它把边缘设备、本地部署和企业服务放在同一套模型体系中,同时公开部分训练过程,回应了当前开源模型竞争中的两个问题:小模型能否保留更强的推理和工具使用能力,以及开发者能否真正理解和改造模型能力的来源。
接下来需要关注的是,IFM承诺的中间检查点、训练代码和数据材料何时完整交付,以及这些材料是否足以让第三方复现主要结果。对于375B-A23B等大模型,还需要考虑硬件成本、服务框架支持和实际企业工作负载表现。就目前可见证据而言,K2 Horizon的开放范围具有明确的创新方向,但其“全开放”与“全量可复现”之间,仍有一段需要通过后续仓库更新和独立评测来验证的距离。
来源:IFM官方新闻稿、IFM K2 Horizon技术介绍、MBZUAI官方公告、K2 Horizon Hugging Face模型集合。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

