今日,阿里雲開源發布文件解析模型OvisOCR2。
該模型以96.58的綜合得分刷新OmniDocBench v1.6榜單紀錄,成為首個超越流水線方法並登頂該榜單的端到端模型,這是文件解析領域迎來技術路線的重要突破。
圖:OvisOCR2 在 OmniDocBench v1.6 上的綜合及分項表現。
端到端模型首度超越流水線方法
文件解析是大模型落地的關鍵基礎設施,企業知識庫、RAG檢索、智慧問答等場景均需將PDF、掃描件等非結構化文件轉化為結構化文字。
此前該領域由「流水線方法」主導,通常由版面分析模型和內容識別模型兩部分組成,前者負責識別文件佈局,後者負責文字、公式、表格等內容的識別,最後拼接輸出。這種方式雖成熟,但存在維護成本高、誤差累積、部署複雜等固有瓶頸。
OvisOCR2採用端到端技術路線:輸入一張文件圖像,模型在一次生成中輸出符合自然閱讀順序的Markdown表示,涵蓋文字、公式、表格和視覺區域。過去需要多個模型協作完成的工作,現在由一個模型一步到位。
在OmniDocBench v1.6上以96.58分登頂,首度證明端到端模型可超越流水線方法。
小參數大能力,0.8B實現SOTA
OvisOCR2由Qwen3.5-0.8B後訓練得到。團隊建構了真實文件與合成文件互補的資料引擎體系,合成文件專門補充表格與公式交織、多欄版式、長輸出等複雜場景。訓練方案融合監督微調(SFT)、強化學習(RL)、線上策略蒸餾(OPD)和模型融合四階段流程,形成多階段遞進式的訓練流程,充分釋放緊湊模型的潛力。
圖:OvisOCR2 資料引擎體系
專案已開源發布,無縫融入通問生態
OvisOCR2以Apache 2.0授權條款開源,相容於vLLM等主流推論框架,與Qwen3.5推論生態銜接,開發者無需額外適配即可整合。
模型取得方式:
/ END /