AI 新闻

新模型,不一定更强:DharmaOCR 说明了什么

DharmaOCR 的研究显示,在巴西葡萄牙语的结构化 OCR 任务中,专门化的小模型(3B)通过任务对齐和 DPO 优化,能在准确率和成本上超越更大的模型和商业基线。论文与模型卡强调了退化率、推理成本与稳定性作为关键评估指标,表明专精策略在明确场景下能带来显著收益。

新模型,不一定更强:DharmaOCR 说明了什么

DharmaOCR 的研究显示,在巴西葡萄牙语的结构化 OCR 任务中,专门化的小模型(3B)通过任务对齐和 DPO 优化,能在准确率和成本上超越更大的模型和商业基线。论文与模型卡强调了退化率、推理成本与稳定性作为关键评估指标,表明专精策略在明确场景下能带来显著收益。

Hugging Face 社区最近围绕 DharmaOCR 展开的一篇文章,把一个越来越常见、也越来越现实的问题摆到台前:在某些明确边界的任务里,模型变大、架构更新,并不自动意味着结果更好。文章指出,面向巴西葡萄牙语结构化 OCR 的 DharmaOCR Lite 只有 3B 参数,却在相关基准上压过了多家商业前沿 API。论文 DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines 以及模型卡 DharmaOCR Lite 给出的数据也支持这一点:Lite 版在 DharmaOCR-Benchmark 上得分 0.911,文本退化率 0.20%,每页耗时 1.464 秒;Full 版 7B 模型得分 0.925,退化率 0.40%,每页耗时 2.132 秒。

专精,不只是“把模型调小”

这组结果的关键,不在于“更小”本身,而在于它是“更贴近任务”的小模型。DharmaOCR 的论文摘要写得很直接:该项目同时追求转录质量、生成稳定性和推理成本,并把打印件、手写件以及法律和行政文档都纳入评测。它还提出了一个统一评估协议,把文本退化率作为一等公民指标之一,和单位成本一起看待。

更重要的是,论文摘要明确写到,DPO(Direct Preference Optimization)是 DharmaOCR 在 OCR 任务上的一个方法学贡献,而且这是它所知范围内 DPO 首次被直接用于 OCR。训练流程分两步:先用监督微调(SFT)把模型推向巴西葡萄牙语的文档语料,再用 DPO 把“会转录”和“会卡住反复输出”区分开来。摘要称,这一组合把退化率最多压低了 87.6%,同时保持甚至提升了抽取质量。

这也呼应了 AI Flux 早前写过的 AI 专精不可避免的逻辑。在那篇文章里,专精被描述为一种结构性变量,而不是简单的产品偏好:当训练历史足够接近部署任务时,参数规模就不再是决定性因素。

为什么 DPO 这一刀有效

Hugging Face 6 月 3 日发布的另一篇团队文章 Direct Preference Optimization Beyond Chatbots 进一步解释了这一点。文章称,在测试过的所有开源家族里,SFT 之后的退化率都有下降,但通常还不够低;而在同一模型、同一批文档上再加一轮 DPO 后,所有家族的退化率都继续下降,平均降幅 59.4%,最好时达到 87.6%

它的逻辑并不复杂:SFT 更擅长教模型“什么是正确答案”,但未必擅长惩罚“循环式失败”。DPO 则把整段输出当作一个偏好对象,把重复、发散、失控的输出直接标记为差答案。对 OCR 这种目标明确、输出结构清晰的任务来说,这种训练信号比聊天对齐更直接,也更有效。

从工程角度看,这一点并不只关乎准确率。论文摘要还提到,AWQ 量化最多可把每页成本降低 22%,而质量损失很小。换句话说,专精并不只是“换一种更小的模型”,而是把模型、数据、偏好优化和推理成本一起重新组织一遍。

这类思路也能和 超越 LoRA:PEFT 技术的实践比较 放在一起看:真正值得比较的,往往不是某一种方法是否“流行”,而是它在具体任务上的稳定性、遗忘代价和部署成本。

OCR 赛道正在变成“细分赛道”

DharmaOCR 的意义,还在于它出现的时间点。过去几个月,OCR 已经从“把图片转成文字”的单一能力,变成了一条更明显的分化赛道:有人强调更强的结构化抽取,有人强调更低的成本和更快的推理,也有人强调多语种覆盖和自托管能力。

比如,Mistral 在 6 月 23 日发布的 OCR 4 就把重心放在结构化文档解析上,主打边界框、块分类、内联置信度以及 170 种语言支持;它的 文档页 进一步强调,这是一款面向 enterprise search、RAG 和领域检索流水线的“小而专”的模型。

而 AI Flux 早前对 PP-OCRv6:轻量多语OCR家族 的梳理,也给出类似信号:OCR 竞争正在从“谁最通用”转向“谁最适合某个语言、某类文档、某种部署环境”。

不过,DharmaOCR 的论文和团队文章都没有把结果夸大成普遍规律。它们强调的始终是一个更窄的命题:在巴西葡萄牙语结构化 OCR 这个明确场景里,任务对齐比单纯堆参数更重要。对别的语言、别的文档、别的工作流,这个结论未必成立。

但至少在这一次,答案已经很清楚:当任务足够具体、数据足够贴近、训练方法足够有针对性时,更新的模型不一定自动占优。更小的模型,也可能保住同样的优势,甚至把优势放大。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读