模型与研究

CohereLabs 发布 2.4B 参数 North Micro Vision 开放权重模型

CohereLabs 发布了开源的 North-Micro-Vision-Instruct —— 一款约 24 亿参数、Apache 2.0 许可的紧凑型视觉语言模型,强调原生分辨率输入以提升文档理解、OCR、图表分析和视觉定位等任务的细节保留与可微调能力。权重已在 Hugging Face 发布,模型适合专项微调和原型开发,但在通用复杂推理与多模态超大上下文方面仍有限制,生态和部署支持仍在完善中。

CohereLabs 发布 2.4B 参数 North Micro Vision 开放权重模型

CohereLabs 发布了开源的 North-Micro-Vision-Instruct —— 一款约 24 亿参数、Apache 2.0 许可的紧凑型视觉语言模型,强调原生分辨率输入以提升文档理解、OCR、图表分析和视觉定位等任务的细节保留与可微调能力。权重已在 Hugging Face 发布,模型适合专项微调和原型开发,但在通用复杂推理与多模态超大上下文方面仍有限制,生态和部署支持仍在完善中。

CohereLabs 发布了一款面向多模态应用的紧凑型视觉语言模型 North-Micro-Vision-Instruct。模型拥有约 24 亿参数,采用 Apache 2.0 许可证,并已在 Hugging Face 公开权重。它的主要特点不是追求更大的通用对话能力,而是在较小规模下保留原生分辨率图像输入,服务于文档理解、OCR、图表分析、视觉问答和视觉定位等任务。

这一发布显示,视觉语言模型的竞争仍在向更细分的方向发展:模型规模不一定继续扩大,而是通过更适合特定工作流的视觉编码、训练数据和部署方式,降低微调与本地化应用的门槛。

面向文档和细节保留的视觉语言模型

CohereLabs 在 Hugging Face 技术博客中表示,North Micro Vision 是其目前规模最小的视觉语言模型。它支持原生分辨率图像处理,尽量保留输入图像的宽高比和细节,而不是先把所有图片缩放到固定的小尺寸。

这一区别对于文档、表格、图表、表单和屏幕截图尤其重要。此类内容中的关键信息往往来自小字号文字、表格结构或局部位置关系;如果图像在输入阶段被过度压缩,模型即使能够识别整体内容,也可能丢失决定答案的细节。

根据官方定位,North Micro Vision 主要覆盖以下任务:

  • 通用视觉问答和图像描述;
  • 文档、表格、图表和 OCR 理解;
  • 视觉定位、计数和空间理解;
  • 多语言和多图像理解;
  • 面向特定领域的微调和原型开发。

官方模型卡称,该模型的输入可以交错包含文字和图像,输出为文本,支持包括英语、德语、法语、西班牙语、意大利语、葡萄牙语、印地语、日语、韩语和中文在内的多种语言。

2.4B 参数由视觉编码器和语言模型组成

North Micro Vision 由约 4 亿参数的视觉编码器、投影层以及约 20 亿参数的 North Micro LLM 组成。CohereLabs 表示,视觉编码器是在 SigLIP 2 SO400M 基础上继续训练得到的,并加入了用于保留空间结构的二维旋转位置编码和学习式一维位置嵌入。

语言模型则沿用了 Cohere 的 Command A+ 架构思路,交替使用滑动窗口注意力和全局注意力。官方技术说明还提到,来自视觉编码器不同层的图像 patch embedding 会通过 DeepStack 方法注入语言模型较早的层级,使语言模型能够接触不同抽象层次的视觉表示。

模型卡给出的参数信息显示,语言骨干支持 128K token 的上下文窗口。不过,这一数字不能直接理解为多模态提示已经能够稳定处理 128K token。CohereLabs 明确指出,经过验证的多模态提示范围为最多 8K token,更长的多模态上下文尚未经过基准测试。

这一区分对于实际部署很重要。语言模型的理论上下文长度与图像输入、视觉 token 数量、显存消耗和端到端延迟并不是同一个指标。尤其是在原生分辨率模式下,图片尺寸越大,视觉 token 数量和推理成本也可能随之增加。

训练过程突出 OCR、图表和视觉定位

CohereLabs 将训练过程分为多个阶段。早期阶段主要调整视觉编码器和投影层,之后逐步提高图像分辨率,并联合训练视觉编码器、投影层和语言模型。

在视觉编码器训练中,模型从 384×384 像素的固定分辨率开始,随后提高到 1024×1024,并进一步将原生分辨率上限提高到约 1654×2339 像素。这一尺寸对应约 200 dpi 的 A4 页面,使模型能够在保留页面比例的情况下处理单页文档。

官方披露,早期训练数据混合了密集图像描述和 OCR 数据;指令微调阶段则加入了原生 OCR、图表和表格、视觉定位与计数、OCR 问答、通用视觉问答、数学和科学等数据。指令微调阶段使用约 5000 万个样本,最后再用约 50 万个样本进行偏好优化,以改善安全性、格式和回答质量。

从训练配比可以看出,North Micro Vision 并非单纯将一个小型语言模型与通用图像编码器拼接起来,而是将文档、文字识别和空间定位作为核心应用场景之一。这也解释了为什么 CohereLabs 将它定位为专业多模态应用的基础模型,而不是更大型通用助手的替代品。

公开评测显示优势集中在文档和定位任务

CohereLabs 使用 VLMEvalKit 对模型进行评估,覆盖通用视觉问答、多语言、多图像、图表和文档、OCR、STEM、视觉定位、鲁棒性以及文本能力等类别。

模型卡列出的结果显示,North Micro Vision 在部分文档和视觉定位任务上表现突出。例如,在 DocVQA 验证集上的分数为 0.921,在 ChartQA 测试集上的分数为 0.808,在 RefCOCO 多项测试集平均后的视觉定位指标为 0.732。与此同时,它在通用语言和复杂 STEM 推理任务上的表现并不等同于更大规模的通用模型:模型卡列出的 MMLU 测试集分数为 0.504,MMMU 验证集分数为 0.329。

这些结果支持了官方对产品定位的描述,但也提醒使用者不要只依据单项指标判断模型的通用能力。North Micro Vision 更适合被视为一个可微调的视觉基础模型,尤其适用于文档处理、结构化信息抽取和空间理解等场景,而不是一个覆盖所有复杂推理任务的聊天助手。

权重已经开放,但生态支持仍在完善

North Micro Vision 的权重已经通过 Hugging Face 模型仓库公开,许可证为 Apache 2.0。开发者可以按照模型卡提供的示例,通过 Transformers 加载模型,并使用图像与文字交错的提示进行推理。

不过,模型的部署生态仍处于逐步补齐阶段。CohereLabs 在技术博客和模型卡中都将公共 vLLM 支持标注为“即将提供”,因此不能把模型卡中展示的 vLLM 调用形式理解为公共 vLLM 支持已经完成。现阶段,官方更明确支持的是基于 Transformers 的使用方式。

与此同时,CohereLabs 与 NVIDIA 合作提供了 NeMo AutoModel 配方,用于在 NVIDIA GPU 上进行微调和部署。相关的 NVIDIA NeMo AutoModel 文档显示,North Micro Vision 可以通过 NeMoAutoModelForImageTextToText 加载;NVIDIA 还在 Automodel GitHub 仓库提供了 LoRA 和全量微调等示例配置。

NVIDIA 的文档同时指出,这一模型架构仍需要 trust_remote_code,因为它尚未在上游 Transformers 中完成注册;文档还列出了与 Transformers 版本相关的安装限制。这意味着,对于希望快速部署的团队来说,运行环境和依赖版本仍需要单独验证。

小模型开放权重的价值与限制

North Micro Vision 的意义,首先在于它把一个具有原生分辨率能力的视觉语言模型放到了相对紧凑的规模上。2.4B 参数并不意味着模型可以在任何设备上无条件运行,但它为领域微调、边缘部署实验和本地原型开发提供了比大型模型更低的起点。

对于企业文档、票据、表格、质检图片和专业图表等任务,开发者往往更关心模型能否适应自己的数据、许可证是否允许进一步开发,以及推理成本是否可控。Apache 2.0 许可证和公开权重在这些方面降低了部分使用门槛;原生分辨率输入则有望减少复杂版面在预处理阶段的信息损失。

但开放权重并不等于所有生产条件都已经成熟。模型卡明确列出了一些限制:North Micro Vision 不是推理模型,数学和代码生成能力有限;不支持工具调用和智能体工作流;多模态上下文超过 8K token 的范围尚未得到验证;原生分辨率图像还可能带来更高的显存占用和延迟。

因此,North Micro Vision 更准确的定位,是一个用于原型开发、专项微调和专业多模态应用的紧凑基础模型。它能否在生产环境中取代更大的视觉语言模型,还取决于具体数据集、图像分辨率、硬件条件和部署框架,而不能仅由参数量或单项 benchmark 结果决定。

接下来需要观察什么

North Micro Vision 已经完成了权重公开,但其后续生态仍有几个值得观察的环节:公共 vLLM 支持何时正式可用,Transformers 上游何时完成架构注册,以及社区是否会提供更成熟的量化、边缘设备和移动端部署方案。

此外,官方评测主要由发布方完成。虽然模型卡公布了较完整的 benchmark 表格和评测方法,但不同任务的预处理、提示模板和答案抽取方式都可能影响结果。随着模型被更多开发者用于真实文档、表格和行业数据,外部复现实验将有助于判断其在公开基准之外的稳定性。

对于正在搭建多模态应用的团队来说,North Micro Vision 提供了一个值得测试的开放权重选项;对于希望寻找通用智能助手替代品的用户来说,则应注意它的设计目标并非如此。模型的价值更可能体现在“足够小、能够修改、擅长处理视觉细节”这条路径上,而不是在所有任务上追求最大规模的能力覆盖。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读