🐼較早收集於 7m

Baidu 發布 Unlimited-OCR,採用 Constant KV Cache 技術

Baidu 發布 Unlimited-OCR,採用 Constant KV Cache 技術
PostLinkedIn
🐼閱讀原文: Pandaily
#ocr#long-context#kv-cacheunlimited-ocrbaiduunlimited-ocr

💡了解 Baidu 新的 Constant KV Cache 架構如何解決長文件 AI 處理中的記憶體瓶頸。

⚡ 30-Second TL;DR

有什麼變化

推出用於長文件處理的 Unlimited-OCR

為什麼重要

這項進展顯著降低了處理海量文件的運算負擔,使長文本 AI 應用更具可行性與成本效益。

下一步行動

評估您目前的 RAG 管線記憶體消耗,並研究 Constant KV Cache 架構是否能改善您的長文件檢索延遲。

誰應關注:Researchers & Academics

關鍵要點

  • 推出用於長文件處理的 Unlimited-OCR
  • 實作 Constant KV Cache 以優化記憶體使用
  • 在效能基準測試中達到業界領先水準

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Unlimited-OCR 透過將文件視覺特徵轉化為 KV Cache,解決了傳統 OCR 在處理超長文件時的記憶體瓶頸問題。
  • 該技術整合了百度自研的文心大模型(Ernie)架構,實現了視覺與語言模型的深度融合,提升了對複雜版面與手寫文字的識別率。
  • Constant KV Cache 技術允許模型在處理數千頁文件時,記憶體佔用量保持恆定,不再隨文件長度線性增長。
  • 此項技術已在百度的企業級雲端服務平台(Baidu AI Cloud)中進行初步部署,旨在服務金融、法律及科研等需要大量文檔處理的行業。
  • Unlimited-OCR 支援多種語言混合識別,並針對中文古籍與專業領域術語進行了專門的數據集微調。
📊 競品分析▸ Show
特性Baidu Unlimited-OCRGoogle Cloud Document AIMicrosoft Azure AI Document Intelligence
核心技術Constant KV CacheTransformer-based OCRLayoutLM 系列
長文件處理記憶體恆定 (優勢)依賴分段處理依賴分段處理
適用場景超長文件/書籍掃描通用企業表單企業自動化流程

🛠️ 技術深入

  • 採用 Constant KV Cache 機制:將視覺編碼器的輸出固定為 KV Cache 的一部分,避免了隨著輸入長度增加而導致的計算與記憶體爆炸。
  • 視覺-語言對齊:利用跨模態注意力機制(Cross-modal Attention),將 OCR 提取的文字位置資訊與語義特徵進行對齊。
  • 記憶體優化:透過 KV Cache 壓縮與快取重用技術,將長文本處理的顯存佔用降低至傳統方法的 1/10 以下。
  • 推理加速:結合百度自研的 PaddlePaddle 框架進行算子融合,顯著提升了長文件處理的吞吐量。

🔮 前景展望AI analysis grounded in cited sources

長文件處理成本將大幅下降
Constant KV Cache 技術顯著降低了對高階 GPU 記憶體的依賴,使得企業能以更低的硬體成本處理大規模文檔。
OCR 技術將從單純識別轉向深度理解
Unlimited-OCR 的架構設計不僅限於文字提取,更強調對長篇文檔上下文的語義理解與邏輯分析。

時間線

2023-03
百度正式發布文心一言(Ernie Bot),奠定大模型技術基礎。
2024-06
百度升級文心大模型 4.0,強化視覺與多模態處理能力。
2025-11
百度在技術開發者大會上預告了針對長上下文(Long Context)的記憶體優化方案。
2026-06
百度正式發布 Unlimited-OCR,引入 Constant KV Cache 技術。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。