來源較早收集於 15h

百度開源端到端 OCR 模型:Unlimited OCR

閱讀原文: 36氪
#ocr#document-parsing#open-source-model

一款全新的開源 OCR 模型,在保持長文檔處理高效率的同時,超越了現有基準測試。

30 秒速覽

有什麼變化

Unlimited OCR 是一款總參數為 3B 的端到端模型。

為什麼重要

此發布為處理長文檔的開發者提供了強大且高效的工具,有望減少對大型、昂貴的專有 OCR API 的依賴。

下一步行動

透過 HuggingFace 儲存庫在您的文檔解析流程中測試 Unlimited OCR,並與現有的商業 API 進行效能比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Unlimited OCR 是一款總參數為 3B 的端到端模型。
  • •推理時僅需激活 570M 參數,效率極高。
  • •在 OmniDocBench v1.6 基准測試中取得 93.92% 的成績。
  • •在 GitHub Trending 與 HuggingFace 全球模型趨勢榜中排名第一。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •Unlimited OCR 採用了基於視覺語言模型(VLM)的架構,專門針對長文檔中的複雜版面與多頁面解析進行了優化。
  • •該模型支持多種語言的混合識別,並在處理手寫體與印刷體混排的文檔時表現出顯著的魯棒性。
  • •百度通過引入輕量級的動態稀疏激活機制(Dynamic Sparse Activation),實現了在保持 3B 總參數規模的同時,僅需 570M 參數參與推理。
  • •該模型已集成至百度的 PaddleOCR 生態系統中,開發者可通過簡單的 API 調用或本地部署進行二次開發。
  • •Unlimited OCR 的訓練數據集涵蓋了數百萬級的真實場景文檔圖像,並使用了合成數據進行長尾場景的增強。

競品分析

架構
Unlimited OCR (百度)
稀疏激活 VLM
Donut (Naver)
Encoder-Decoder Transformer
Nougat (Meta)
Encoder-Decoder Transformer
參數規模
Unlimited OCR (百度)
3B (570M 激活)
Donut (Naver)
較小
Nougat (Meta)
較大
長文檔處理
Unlimited OCR (百度)
優化 (長上下文)
Donut (Naver)
一般
Nougat (Meta)
較好
開源許可
Unlimited OCR (百度)
Apache 2.0
Donut (Naver)
MIT
Nougat (Meta)
CC-BY-NC 4.0

技術深入

  • 架構設計:採用了基於 Transformer 的端到端架構,去除了傳統 OCR 的檢測、識別、後處理分離流程。
  • 稀疏激活:利用 MoE (Mixture of Experts) 或類似的動態路由機制,在推理時僅激活部分神經元,大幅降低計算延遲。
  • 輸入處理:支持高分辨率圖像輸入,並通過 Patch Embedding 技術處理長文檔的細節信息。
  • 訓練策略:採用了兩階段訓練法,先進行大規模預訓練,再針對文檔解析任務進行微調。

前景展望基於引用來源的 AI 分析

端到端 OCR 模型將加速取代傳統的流水線式 OCR 解決方案。
端到端模型簡化了部署流程並減少了錯誤傳遞,在工業級應用中具有更高的維護效率。
輕量化推理技術將推動 OCR 模型在邊緣設備上的普及。
僅需 570M 參數激活的特性使得該模型能夠在移動端或嵌入式設備上運行,無需依賴雲端算力。

時間線

2026-05
百度發布 Unlimited OCR 預告並開啟內部測試
2026-06
Unlimited OCR 正式開源並登頂 GitHub Trending

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。