
这项由百度飞桨团队(PaddlePaddle Team,Baidu Inc.)完成的研究,以arXiv预印本形式于2026年6月2日发布,编号为arXiv:2606.03264v1,感兴趣的读者可通过该编号查询完整论文。论文的项目负责人为Cheng Cui,研究成果已在官方网站www.paddleocr.com及代码平台GitHub PaddlePaddle/PaddleOCR上公开发布,相关模型也已上传至HuggingFace平台供公众使用。
每当你把一份扫描版合同发给同事,或者把拍下来的餐厅菜单转成文字,背后都有一套文档解析系统在默默工作。它不只是"认字"那么简单,还要识别表格结构、读懂数学公式、区分不同栏目的阅读顺序。这件事听起来容易,做起来却极其复杂——尤其当文档里夹着印章、图表、残缺扫描或者手机随手拍的照片时,稍有差错就可能让后续的自动化处理全部跑偏。
百度飞桨团队此前已经推出了PaddleOCR-VL-1.5,这个只有0.9亿参数(0.9B)的"小个子"模型在当时的文档解析竞赛中表现相当出色,在OmniDocBench榜单上拿到了94.93%的综合得分。但团队并不满足于此,他们发现这个模型还有一些"顽固的短板"——不是随机犯错,而是在某些特定类型的文档上反复出错,像一个学生在某几道题型上总是丢分。于是,他们没有选择简单粗暴地把模型扩大、把数据加多,而是认认真真地做了一件事:把这些薄弱环节找出来,然后有针对性地"补课"。这便是PaddleOCR-VL-1.6的核心故事——一个关于精准诊断、靶向治疗的模型升级方案。
升级后的PaddleOCR-VL-1.6在OmniDocBench v1.6榜单上拿到了96.33%的综合得分,超越了所有参与评测的模型,包括参数量是它260倍以上的大模型。它同时在现实场景鲁棒性测试(Real5-OmniDocBench)上以93.19%的总分夺冠,依然保持着0.9B的轻量身形。
一、文档解析这件事,到底难在哪里
要理解这项研究的价值,先得明白文档解析为何如此棘手。假设你有一份PDF格式的财务报告,里面有横跨两页的表格、嵌套在正文里的数学公式、带有公司印章的附页,以及几张折线图。如果你把这份PDF喂给一个大型语言模型,它能回答你问题的前提,是这些内容被准确地转换成了结构化的文字——表格要以正确的行列关系还原,公式要用LaTeX语法精准表示,图表要提炼成数据表格,印章上的文字也要完整识别。
这个转换过程涉及多个层次的理解:视觉定位(这一块是表格还是正文)、结构重建(表格的哪些格子是合并的)、语义保存(这个符号是积分号还是字母S)。随着检索增强生成(RAG)系统的普及——这类系统会先把文档"消化"成结构化文本,再让大语言模型基于这些文本回答问题——文档解析的精度直接决定了下游AI应用的质量上限。解析一旦出错,大语言模型的回答也就失去了可靠的根基。
PaddleOCR-VL系列的设计思路是用一个轻量的视觉语言模型(VLM)来完成这项工作。系统由两个模型协作完成:PP-DocLayoutV3负责"版面分析",相当于先看清楚文档的整体布局,把文本区、表格区、公式区、图表区各自标记出来,并支持多点定位,即使文档存在透视变形、弯曲或不规则排布也能准确划定区域;随后PaddleOCR-VL-1.6-0.9B负责对每个识别出的区域进行内容理解和转换,最终由一个轻量后处理引擎把所有输出整合成Markdown或JSON格式,还额外支持跨页表格合并和标题层级修正。
此外,这套系统还支持"文字检测与识别"任务,也就是直接在图片上找到所有文字并读出来,覆盖身份证、古籍、广告海报、路牌、多语种文本图像等丰富场景,不需要经过版面分析的两阶段流程,直接端到端完成。
在这次升级中,PP-DocLayoutV3保持不变,全部改进集中在PaddleOCR-VL-1.6-0.9B模型本身——不扩大规模、不改动架构,而是通过更精准的数据和更有序的训练来提升能力。
二、精准诊断:找出模型的"薄弱地带"
百度团队在分析PaddleOCR-VL-1.5的失误时,发现了三种截然不同的犯错规律,这就好比给一个学生的错题本做分类,发现他的错误不是随机分布的,而是集中在三种特定题型上。
第一种错误规律是"决策边界脆弱"。具体表现是:对同一张文档图片,稍微做一点看起来无关紧要的处理——比如压缩一下图片质量、稍微平移几个像素、加点轻微模糊——模型的输出就会发生很大变化,有时甚至完全崩溃。这说明模型在这类样本上没有形成稳定的"认知",它就像一个对某道题型一知半解的学生,题目原封不动地问他还能答对,稍微换个问法就不知所措了。团队把这类样本称为"边界脆弱区域"(Boundary-Fragile Regions)。
第二种错误规律是"覆盖稀疏"。有些文档类型在训练数据中出现得很少,比如古籍、罕见字体、工业用表格。模型在这些类型上的表现就像是临时抱佛脚——见过的多了就答得好,见得少的就表现不稳定。更麻烦的是,常规的数据扩充方式往往是"哪里多加哪里",反而让主流类型的数据越来越多,稀疏类型依然被淹没。团队把这类样本称为"覆盖稀疏区域"(Coverage-Sparse Regions)。
第三种错误规律是"监督信号不可靠"。这是最隐蔽也最棘手的一种:模型在某些样本上给出的答案稳定且自信,但就是错的。这通常意味着训练时给它看的"标准答案"本身就有问题——模型学会了错误的答案。团队把这类样本称为"不可靠监督区域"(Unreliable-Supervision Regions)。
这三种诊断结果构成了整个"欠优化区域"(Under-Optimized Regions,UORs)框架。接下来,针对每种问题,团队分别开出了对应的"处方"。
三、为脆弱边界"加固":让模型在摇晃中也能认清文字
针对边界脆弱区域,团队设计了一套专门的挖掘方法。核心思路是:如果模型在某个样本上真正学扎实了,那么无论是训练快结束时的哪个时刻看它(也就是不同的训练检查点),还是把输入图片稍微动一动,它的输出都应该一致。反之,如果一点点扰动就能让输出大变样,这个样本就是"边界脆弱"的。
具体操作上,团队从训练最后阶段保留了8个检查点(相当于记录了学习过程最后8个时间节点的模型状态),同时设计了16种"语义不变扰动"——像素平移、JPEG压缩、噪声、模糊、非均匀缩放等,这些变换不会改变文档的实际内容,只是让图片的外观略有不同。对每个训练样本,用8个检查点与16种扰动做交叉组合,得到128种不同版本的预测结果,两两比较编辑距离,取差异最大的128对取平均,得到一个"边界脆弱分数"。最终选取分数最高的前1%样本,以及任何一个版本出现严重退化的样本,作为边界脆弱区域的代表。
找到这些样本后,团队并不是直接拿它们继续训练(因为标注本身可能也不太可靠),而是把它们当作"检索种子",在内部庞大的未标注文档库中,找到视觉语义上与这些脆弱样本相似的新样本,从而扩充这些局部区域的数据密度。这就像是发现某道题型做不好,不是反复做同一道题,而是去找同类型的更多练习题。
四、填补稀疏覆盖:让罕见文档不再"隐身"
针对覆盖稀疏区域,团队设计了一个渐进式的图相似度聚类算法(详见论文中的Algorithm 1)。基本思路是:先用一个专门针对文档训练的特征编码器,把所有训练样本映射到一个特征空间里,然后通过计算样本之间的余弦相似度来搭建一张"关系网"——相似度高的样本之间有边相连。
接下来,算法会逐渐提高相似度门槛,让这张网中原本相连的边断裂,原来的大群体分裂成越来越小的子群体。这个过程持续进行,直到群体数量达到预设目标。最终那些规模很小、与其他群体联系稀疏的"孤岛群体",就是覆盖稀疏区域——它们在整个训练数据中几乎没有"邻居",属于数据沙漠中的孤立绿洲。
这种做法的聪明之处在于,它不需要预先指定有多少类文档,而是让数据自己说话,自然地暴露那些被主流数据淹没的边缘区域。相比之下,K-Means等传统聚类方法要求事先指定类别数,且会把所有样本都强行分配到某个类别,反而容易让稀少类型被附近的大类吸收,根本看不出哪里是稀疏的。
通过这套方法,团队系统性地补充了古籍、罕见汉字、工业报表等长尾数据,让这些"边缘学生"也得到了应有的练习资源。
五、修复错误标注:当"标准答案"本身就写错了
覆盖稀疏和边界脆弱解决的是"数据量不够"或"模型不稳定"的问题,不可靠监督区域则要解决一个更根本的问题:训练数据的标注本身就不准确。
为了找出哪些标注存在问题,团队引入了三位"外部专家评审":千帆OCR(Qianfan-OCR)、GLM-OCR和MinerU2.5-Pro,它们是三个来自不同团队、不同数据源的高性能文档解析模型。对每个训练样本,让这三位专家各自独立给出预测,再与原始标注对比。
如果至少有一位专家的预测与原始标注一致,说明这个标注是可信的,保留不动。如果三位专家都与原始标注不同,但其中至少两位专家互相一致,说明原始标注很可能有误,用这两位专家达成的共识替换原始标注。如果三位专家彼此也无法达成一致,这个样本就被标记为"待解决",进入下一阶段的精细化处理。
这个策略本质上是用"外部专家表决"来检验训练数据的质量,打破了"只有自己家的标注才对"的单一视角。经过这一轮清洗,一部分原本被模型记住了错误答案的样本得到了纠正,让后续训练站在了更可靠的起点上。
六、高难度样本的精细标注:用AI审稿员反复打磨答案
无论是从数据库里新检索出的未标注样本,还是三位专家都无法达成共识的疑难案例,都需要产生可靠的新标注。为此,团队设计了一套结合"多专家共识"与"渲染引导的迭代精炼"的自动标注流水线(详见论文中的Algorithm 2)。
流水线首先让三个专家模型(这次是PaddleOCR-VL-1.5、GLM-OCR和MinerU2.5-Pro)各自给出预测,如果至少两位达成一致,直接采用这个共识作为标注。如果三位意见不一,就进入更精细的"裁判-修改"循环:由ERNIE 5.0(百度的一个具备强大多模态视觉推理能力的大模型)综合三位专家的意见,给出一个初始预测;然后把这个预测"渲染"成图片(比如把LaTeX公式渲染成真实的数学公式图像,把HTML表格渲染成真实的表格图片),再让裁判模型把渲染结果与原始文档图片进行视觉对比,找出差异——哪行哪列对不上、哪个公式符号写错了。发现差异后,修改模型根据这些反馈更新预测,再次渲染,再次对比,如此循环,直到裁判模型认为已经足够准确或达到最大迭代次数。
渲染这一步的设计颇有巧思。直接比较"一段LaTeX代码"和"一张数学公式图片"对AI来说很困难,因为这是两种完全不同的形式;但如果把LaTeX渲染成图片,就变成了图片与图片的比较,裁判模型能更直观地发现合并单元格错位、数字排列混乱等问题。经过这套流水线,绝大多数疑难样本都能自动获得高质量标注,少数实在无法自动解决的才需要人工介入,且系统会提供最后一轮的预标注结果,减轻人工审核的工作量。
七、分三步走的"进阶训练"方案
有了这批经过精心诊断和修复的高质量数据,如何用好它们同样是一门学问。团队设计了三个递进的训练阶段,像是一套"由泛到精、由精到优"的学习计划。
第一阶段是"继续预训练"(CPT),目标是让模型把新引入的各类数据都消化吸收,建立更广的"知识面"。这一阶段使用的语料规模最大,把PaddleOCR-VL-1.5的原有训练数据与新引入的数据合并,共16.8M个训练样本,所有标注均已更新为最新版本。训练时打开所有模型参数,跑一轮,最大学习率设置为3×10??。这一步相当于先让模型把新课本通读一遍,建立对新分布的基础认知。
第二阶段是"监督微调"(SFT),目标是在高难度、高质量样本上进一步磨砺模型。这一阶段的数据来自三个来源:用一种叫"不确定性感知聚类采样"(UACS)的方法从CPT语料中筛选出的高难度样本;三位专家无法达成共识、经过渲染迭代精炼才获得标注的疑难案例;以及PaddleOCR-VL-1.5原始训练数据中经过不可靠监督区域挖掘后被纠正了标注的样本。这三类数据汇聚成7.3M个样本,用更小的学习率(1×10??)再训练一轮,让模型在更可靠的困难样本上精细打磨。
第三阶段是"强化学习"(RL),使用的是GRPO算法。这个阶段的逻辑是让模型对同一道题生成多个答案,根据每个答案的质量评分分配"奖励",引导模型向更优的答案靠近。这一步能进一步统一模型的输出风格(因为来自不同来源的数据可能有不同的标注习惯),同时在模型已经比较强的基础上再向上推一把。
由于模型的语言部分只有0.3B参数,属于非常精简的配置,强化学习对数据质量极为敏感——如果随便挑样本,可能在某些题型上进步了,但在其他地方却退步了。为此,团队专门设计了一套"高潜力样本挖掘"策略,精心筛选最值得用于强化学习的样本。
八、哪些样本值得用于强化学习:三维评分筛选法
挑选强化学习样本的核心挑战在于:太难的样本模型根本答不对,提供不了有效学习信号;太简单的样本模型已经全部掌握,也没有提升空间;而且如果所有生成的答案质量都差不多,模型也无法从比较中学到东西。
团队的解决方案是用已经训练好的SFT模型,对每个候选样本各生成16个回答(使用特定的采样温度和参数),然后用专门设计的奖励函数给每个回答打分,得到一个"奖励分布",再从三个维度来衡量每个样本的训练价值。
第一个维度是"改进潜力":用最高得分减去平均得分来衡量。这个差值越大,说明模型偶尔能给出比平均水平好很多的答案——意味着确实还有提升空间,而且当前能力已经足以触及更好的答案。第二个维度是"生成不确定性":通过计算模型生成16个回答时的平均置信度(用序列概率的几何平均值作为单个回答的置信度指标,再取16个回答的平均),不确定性越高,说明模型在这个样本上的生成行为还不够稳定,仍有优化空间。第三个维度是"奖励方差":16个回答的得分差异越大,说明这批答案之间的优劣区分越明显,强化学习算法就越能从中找到清晰的学习方向。
最终的"高潜力分数"把这三个维度综合起来,用改进潜力作为主项,用不确定性和奖励方差的加权指数作为放大因子(参数α=1,β=2)。优先选择那些不仅改进空间大、生成行为还不稳定、而且答案质量差异显著的样本。这类样本才是真正的"练习题甜区"——不会太难让模型束手无策,也不会太简单让模型毫无收获。
此外,为了保证每种任务类型都得到充分训练,团队对OCR、图表解析、表格识别、公式识别、印章识别、文字检测这六大任务分别独立进行打分和筛选,从每个任务各取8000个高分样本,最终汇聚成49K个样本用于强化学习训练,使用更低的学习率(2×10??),训练两轮。
九、奖励函数的设计:不只是对不对,还看结构对不对
强化学习的灵魂在于奖励函数的设计——评分标准定得好,模型才能朝着正确方向走。团队为每个任务设计了三层嵌套的奖励结构,统一的公式是:奖励 = 合法性检验 × 结构调整因子 × 任务相似度。
合法性检验是最基础的一关:如果输出存在格式错误、LaTeX语法不合法、输出被截断、出现重复循环等问题,直接给零分,不进入后续评分。通过合法性检验后,结构调整因子会根据输出的结构完整性做软性惩罚——比如对于表格任务,输出的OTSL格式(一种用于描述表格结构的语言)如果不满足矩形约束(即表格每行每列的格数不一致,说明有结构性错误),就按照修正成合法矩形所需的最小编辑成本来扣分。最后,任务相似度才是真正衡量内容准确度的指标:文字任务用归一化编辑距离(NED)衡量,表格用TEDS(综合考虑结构和内容的相似度),公式用CDM(基于字符检测匹配的公式评分),图表用RMS-F1(对图表中的数值读取准确率综合评分),文字检测任务则用"编辑相似度加权F1"——不仅看框是否找对,还要看框内识别的文字是否准确,两者联合打分。
对于文字检测这个特殊任务,评分逻辑尤为细致:先把预测框和真实框做几何匹配(看空间位置是否对应),然后对每一对匹配成功的框,用预测文字与真实文字之间的编辑相似度(1减去NED)作为权重,计算加权F1分数。这样就避免了一种投机行为——框的位置找对了但内容认错了也能得高分。
十、实测效果:各项任务全面领先
评测结果从多个维度验证了这套方案的有效性。
在OmniDocBench v1.6综合评测中,PaddleOCR-VL-1.6以96.33%的总分排名第一,比自身前代PaddleOCR-VL-1.5提升了1.4个百分点,比排名第二的MinerU2.5-Pro(1.2B参数)高出0.58个百分点。在各子任务上,文字识别的归一化编辑距离从0.038降至0.033(数字越小越好),公式CDM得分从96.89%升至97.49%,表格TEDS从91.67%升至94.76%,表格结构TEDS从94.37%升至97.11%,阅读顺序评分为0.127(与最优水平相当)。OmniDocBench v1.6相比上一版本做了两项重要升级:引入了多粒度自适应匹配(MGAM)机制,减少因为预测和真实标注在文字分段粒度上不同而带来的评分偏差;同时增加了296页"困难子集",专门收录了嵌套复杂表格、密集公式版面、非常规文档结构等高难度场景。
在Real5-OmniDocBench真实场景鲁棒性测试中,PaddleOCR-VL-1.6以93.19%的总分位居第一,超越了包括Gemini 3 Pro和Qwen3-VL-235B在内的所有参与评测的大模型,后两者的参数量分别远超PaddleOCR-VL-1.6的0.9B。这个评测集的图像全部来自手机拍摄,覆盖扫描、翘曲变形、屏幕翻拍、光照不均、歪斜五种真实采集场景,是检验模型在非理想条件下表现的高要求测试。在五个子场景上,PaddleOCR-VL-1.6均拿到了最高分:扫描94.74、翘曲变形92.48、屏幕翻拍92.78、光照不均93.28、歪斜92.66。
在内部困难表格测试集(含1258个样本,覆盖20类表格)上,PaddleOCR-VL-1.6的综合TEDS达到91.71,结构TEDS达到94.67,均优于所有对比方法,包括参数量更大的MinerU2.5-Pro(89.77和93.78)。
在内部图表解析测试集(含1801个样本,覆盖11类图表)上,PaddleOCR-VL-1.6的RMS-F1综合得分为91.74,英文图表90.11,中文图表93.37,不仅大幅超越前代模型,还超过了Gemini 3 Flash的89.45。
在内部文字检测测试集(覆盖常见场景、日文、低质量图像、中英文手写、表格、古籍、繁体中文等9个维度)上,PaddleOCR-VL-1.6的综合准确率为87.47,在9个维度中均为最高分。
在内部印章识别测试集(含300张图,覆盖圆形、椭圆、矩形印章)上,PaddleOCR-VL-1.6的归一化编辑距离为0.119,远低于PaddleOCR-VL-1.5的0.138,也远低于参数量为235B的Qwen3-VL的0.382。
十一、拆解训练各阶段的贡献:谁功劳最大
团队还专门做了消融实验,逐步验证CPT、SFT、RL三个阶段各自的贡献。从PaddleOCR-VL-1.5出发,加上CPT之后,综合得分从94.93%升至95.62%,提升0.69个百分点,表格TEDS从91.67%大幅提升至93.03%,说明广泛的数据扩充和标注修正为模型打下了更好的基础。再加上SFT,综合得分进一步升至96.25%,提升0.63个百分点,表格TEDS继续提升至94.74%,结构TEDS达到97.09%,说明针对高难度样本的精细监督学习对表格等结构复杂任务的提升最为显著。最后加上RL,综合得分来到96.33%,提升0.08个百分点,公式CDM从97.37%升至97.49%,这是一个更小但仍然正向的增益。
实验结果表明,在文档解析这类任务上,数据质量和分阶段监督学习贡献了绝大部分的性能提升,强化学习在模型已经进入高性能区间后,起到的是"最后一公里"的精细调优作用,而非根本性的能力跃升。这个结论对于从事类似工作的研究者来说是一个有意义的参考:在数据没有充分清洗和优化之前,直接上强化学习的收益可能远不如做好数据工程。
说到底,PaddleOCR-VL-1.6讲述的是一个"精准补课而非盲目扩张"的故事。它没有靠堆砌参数量或简单扩大数据规模来刷分,而是认认真真地给前代模型做了一份"错题分析报告",找出三类薄弱地带,为每类问题设计了对应的诊断和修复方案,再用一套有条不紊的分阶段训练把这些改进落实到模型里。结果是一个0.9B的小模型在综合文档解析能力上超过了所有参与评测的系统,包括规模大出几百倍的通用大模型。
这件事对普通人生活的影响也许比你以为的更贴近——每次你用手机拍一份合同自动识别内容、把PDF报表自动提取成可编辑表格、让AI助手帮你读一份复杂的研究报告,背后的技术路径都与这套系统有关。更高精度、更强鲁棒性的文档解析,意味着AI应用在处理现实世界那些不完美、不规则、带着咖啡渍或者拍歪了的文档时,能给出更可靠的结果。
如果你对完整的技术细节感兴趣,欢迎通过arXiv编号arXiv:2606.03264v1查阅原论文,代码和模型也已在GitHub及HuggingFace平台公开,可供直接使用和复现。
---
Q&A
Q1:PaddleOCR-VL-1.6和PaddleOCR-VL-1.5有什么区别,架构变了吗?
A:PaddleOCR-VL-1.6的模型架构与PaddleOCR-VL-1.5完全相同,都是0.9B参数量,同样由原生分辨率视觉编码器、自适应MLP连接器和ERNIE-4.5-0.3B语言模型组成。区别完全在于训练数据和训练流程:1.6版本引入了针对边界脆弱区域、覆盖稀疏区域和不可靠监督区域的靶向数据优化,以及CPT-SFT-RL三阶段递进训练方案,通过更精准的数据和更有序的训练显著提升了性能。
Q2:强化学习(GRPO)在PaddleOCR-VL-1.6的训练中具体起了多大作用?
A:根据消融实验,强化学习(RL)阶段将综合得分从96.25%提升至96.33%,提升幅度约0.08个百分点,其中公式CDM得分从97.37%升至97.49%,贡献相对有限。最大的性能提升来自继续预训练(CPT)阶段(+0.69分)和监督微调(SFT)阶段(+0.63分)。研究团队指出,RL在文档解析任务中更多起到"最后一公里"精细调优的作用,核心收益依然来自高质量数据构建和分阶段监督学习。
Q3:PaddleOCR-VL-1.6的"边界脆弱区域挖掘"是如何判断一个样本不稳定的?
A:判断逻辑分两个维度。第一,检验同一样本在训练最后阶段8个不同检查点下的预测是否一致;第二,对同一检查点,给输入图片施加16种轻微扰动(如像素平移、压缩、模糊等),看输出是否有大变化。两个维度交叉组合得到128个预测,两两比较编辑距离,取最大的128对取平均得到"边界脆弱分数",分数最高的前1%样本及任意预测严重退化的样本,均被认定为边界脆弱区域。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。