[](https://huggingface.co/ErickvL)-
尽管采用了更新的架构,DharmaOCR 通过领域专精和有针对性的训练,在巴西葡萄牙语上优于 Mistral OCR4 和 Unlimited-OCR。本文展示了这种优势背后的证据与机制。 来源
-
[
](#despite-newer-architectures-dharmaocr-outperformed-mistral-ocr4-and-unlimited-ocr-on-brazilian-portuguese-through-domain-specialization-and-targeted-training-this-article-presents-the-evidence-and-the-mechanism-behind-that-advantage)
尽管采用了更新的架构,DharmaOCR 通过领域专精和有针对性的训练,在巴西葡萄牙语上优于 Mistral OCR4 和 Unlimited-OCR。本文展示了这种优势背后的证据与机制。
三个月前,我们发布了一篇关于 DharmaOCR 的论文,并将其中一个模型开源。目标很明确:为巴西葡萄牙语专门打造的光学字符识别(OCR)。
训练流程分为两个阶段。第一阶段是监督式微调,使用了来自不同来源、格式和复杂度层级的大量葡萄牙语文件。这个阶段将模型权重对齐到巴西葡萄牙语的特定词汇、句法和文档结构上——把表征能力集中到目标语言,而不是分散到更广泛的多语言空间中。第二阶段应用直接偏好优化(Direct Preference Optimization,DPO):模型不再只从正确转写中学习,而是从候选输出之间的比较偏好数据中学习,从而在推理时持续选择更好的提取结果。这个阶段解决的是另一个问题:不是准确率,而是稳定性。通过抑制会导致生成模型输出重复或不连贯内容的失败模式,DPO 降低了推理时间和成本,并显著提升了模型在生产环境中交付结果的可靠性。
最终的组合效果是:在一个以葡萄牙语为重点的基准测试中,该模型取得了最高的提取质量分数和最低的退化率。两个阶段缺一不可。微调阶段建立了领域能力;DPO 阶段则确保这种能力在模型最容易失效的条件下依然成立。
OCR 模型发展得很快。但最初促使 DharmaOCR 诞生的那些差距——在复杂文档上的提取质量差距,以及在生产条件下的模型稳定性差距——并没有消失。相反,随着领域发展,它们变得更具启发性。
多模态生成模型的普及,让基于语言模型的 OCR 广泛可用;随后出现的一波微调 OCR 变体,也反映了这种采用速度有多快。然而,这种普及并没有改变这项技术的基本属性。任何建立在生成模型之上的 OCR 系统都是概率性的。转写错误是这种概率技术中固有的变量。模型之间的差异,在于它们会犯多少错误,以及会犯什么类型的错误。这由两件事决定:模型结构(架构和参数量)以及这些参数如何为任务进行训练。
架构和参数量决定了模型能学到什么的上限。训练方式决定这些能力如何分配。
这种区分,使得专精成为一个结构性问题,而不是设计偏好。当模型只在有限领域上训练——例如单一语言、有限的文档类型、特定任务——时,所有参数都会专门用于该任务。相反,当模型被训练来覆盖更广泛的领域——例如处理 N 种语言的多语言模型——同样的参数就必须在所有这些领域之间分配。这个分配并不是线性的:神经元叠加原理意味着单个参数可以同时编码多个特征。但分配的确存在,其后果也同样真实。覆盖范围越广的模型,对其中任何一个部分的投入就越少。
DharmaOCR 的训练目标正是反向接受这一约束。这个模型并不是为了成为其他语言的最佳选择,它从来也不是。作为交换,网络中的每个可用参数都可以朝着巴西葡萄牙语的特定词汇、形态和正字法模式去优化——这是对该领域模型资源最有针对性的使用方式。
这种集中化构成了它相对于多语言模型和更广泛领域模型的内在优势基础。这种优势并不依赖于比竞争对手更大的架构或更复杂的训练流程——新架构和新训练技术会提升任何模型的能力。它依赖于资源投向何处:集中于一个领域,而不是分散到多个领域。
三个月后,更新的模型已经出现。当这些模型更现代、能力更强时,专精是否仍然成立,这是另一个问题。
在 DharmaOCR 论文发布三个月后,两款新的 OCR 模型引起了研究界的广泛关注:Mistral OCR4 和 Unlimited-OCR。两者都代表了真正的技术进步——新的训练技术、新的数据集,以及在多语言和多项基准评测上的强劲表现。它们属于那种会抬高 OCR 系统交付标准的模型。
当我们将这两者都放到专为葡萄牙语设计的 DharmaOCR 基准上测试时,结果非常明确。
DharmaOCR 的得分为 0.925。Mistral OCR4 的得分为 0.798。Unlimited-OCR 的得分为 0.7587。
差距很明显。Mistral OCR4 比 DharmaOCR 低约 13 个百分点;Unlimited-OCR 低了 16 个百分点以上。两者都在我们的模型之后发布,也都得到了大量研究资源支持。在 DharmaOCR 从根本上将注意力完全集中于葡萄牙语的任务上,专精优势是可测量且显著的。
基准测试是核心发现。接下来要说明的是,这一差距为何会呈现出这种特定形态。
处理非平凡的葡萄牙语文档,可以精确揭示多语言模型最容易在哪些地方出问题。ENEM 作文(巴西全国高中考试)把手写文本与巴西葡萄牙语特有的词汇、专有名词和文化指涉结合在一起。它们正是语言专项训练能够带来回报的那类文档。
图 1:用于基准评估的 ENEM 作文手稿,以及各模型的输出。误读部分以红色标出。
Mistral OCR4 在这类文档上的转写,将 Chico Buarque(巴西最广为人知的音乐家之一)的名字转写成了……

