阿里開源0.8B文件解析模型,端到端模型首度超越流水線方法

今日,阿里雲開源發布文件解析模型OvisOCR2。

該模型以96.58的綜合得分刷新OmniDocBench v1.6榜單紀錄,成為首個超越流水線方法並登頂該榜單的端到端模型,這是文件解析領域迎來技術路線的重要突破。

圖片

圖:OvisOCR2 在 OmniDocBench v1.6 上的綜合及分項表現。

端到端模型首度超越流水線方法

文件解析是大模型落地的關鍵基礎設施,企業知識庫、RAG檢索、智慧問答等場景均需將PDF、掃描件等非結構化文件轉化為結構化文字。

此前該領域由「流水線方法」主導,通常由版面分析模型和內容識別模型兩部分組成,前者負責識別文件佈局,後者負責文字、公式、表格等內容的識別,最後拼接輸出。這種方式雖成熟,但存在維護成本高、誤差累積、部署複雜等固有瓶頸。

OvisOCR2採用端到端技術路線:輸入一張文件圖像,模型在一次生成中輸出符合自然閱讀順序的Markdown表示,涵蓋文字、公式、表格和視覺區域。過去需要多個模型協作完成的工作,現在由一個模型一步到位。

在OmniDocBench v1.6上以96.58分登頂,首度證明端到端模型可超越流水線方法。

小參數大能力,0.8B實現SOTA

OvisOCR2由Qwen3.5-0.8B後訓練得到。團隊建構了真實文件與合成文件互補的資料引擎體系,合成文件專門補充表格與公式交織、多欄版式、長輸出等複雜場景。訓練方案融合監督微調(SFT)、強化學習(RL)、線上策略蒸餾(OPD)和模型融合四階段流程,形成多階段遞進式的訓練流程,充分釋放緊湊模型的潛力。

圖片

圖:OvisOCR2 資料引擎體系

專案已開源發布,無縫融入通問生態

OvisOCR2以Apache 2.0授權條款開源,相容於vLLM等主流推論框架,與Qwen3.5推論生態銜接,開發者無需額外適配即可整合。

模型取得方式:

/ END /

相關文章推薦

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.