🔥較早收集於 15h

百度開源端到端 OCR 模型:Unlimited OCR

百度開源端到端 OCR 模型:Unlimited OCR
PostLinkedIn
🔥閱讀原文: 36氪
#ocr#document-parsing#open-source-modelunlimited-ocrbaiduhuggingfacegithub

💡一款全新的開源 OCR 模型,在保持長文檔處理高效率的同時,超越了現有基準測試。

⚡ 30-Second TL;DR

有什麼變化

Unlimited OCR 是一款總參數為 3B 的端到端模型。

為什麼重要

此發布為處理長文檔的開發者提供了強大且高效的工具,有望減少對大型、昂貴的專有 OCR API 的依賴。

下一步行動

透過 HuggingFace 儲存庫在您的文檔解析流程中測試 Unlimited OCR,並與現有的商業 API 進行效能比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • Unlimited OCR 是一款總參數為 3B 的端到端模型。
  • 推理時僅需激活 570M 參數,效率極高。
  • 在 OmniDocBench v1.6 基准測試中取得 93.92% 的成績。
  • 在 GitHub Trending 與 HuggingFace 全球模型趨勢榜中排名第一。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Unlimited OCR 採用了基於視覺語言模型(VLM)的架構,專門針對長文檔中的複雜版面與多頁面解析進行了優化。
  • 該模型支持多種語言的混合識別,並在處理手寫體與印刷體混排的文檔時表現出顯著的魯棒性。
  • 百度通過引入輕量級的動態稀疏激活機制(Dynamic Sparse Activation),實現了在保持 3B 總參數規模的同時,僅需 570M 參數參與推理。
  • 該模型已集成至百度的 PaddleOCR 生態系統中,開發者可通過簡單的 API 調用或本地部署進行二次開發。
  • Unlimited OCR 的訓練數據集涵蓋了數百萬級的真實場景文檔圖像,並使用了合成數據進行長尾場景的增強。
📊 競品分析▸ Show
特性/模型Unlimited OCR (百度)Donut (Naver)Nougat (Meta)
架構稀疏激活 VLMEncoder-Decoder TransformerEncoder-Decoder Transformer
參數規模3B (570M 激活)較小較大
長文檔處理優化 (長上下文)一般較好
開源許可Apache 2.0MITCC-BY-NC 4.0

🛠️ 技術深入

  • 架構設計:採用了基於 Transformer 的端到端架構,去除了傳統 OCR 的檢測、識別、後處理分離流程。
  • 稀疏激活:利用 MoE (Mixture of Experts) 或類似的動態路由機制,在推理時僅激活部分神經元,大幅降低計算延遲。
  • 輸入處理:支持高分辨率圖像輸入,並通過 Patch Embedding 技術處理長文檔的細節信息。
  • 訓練策略:採用了兩階段訓練法,先進行大規模預訓練,再針對文檔解析任務進行微調。

🔮 前景展望AI analysis grounded in cited sources

端到端 OCR 模型將加速取代傳統的流水線式 OCR 解決方案。
端到端模型簡化了部署流程並減少了錯誤傳遞,在工業級應用中具有更高的維護效率。
輕量化推理技術將推動 OCR 模型在邊緣設備上的普及。
僅需 570M 參數激活的特性使得該模型能夠在移動端或嵌入式設備上運行,無需依賴雲端算力。

時間線

2026-05
百度發布 Unlimited OCR 預告並開啟內部測試
2026-06
Unlimited OCR 正式開源並登頂 GitHub Trending
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。