🐼Pandaily•較早收集於 7m
Baidu 發布 Unlimited-OCR,採用 Constant KV Cache 技術

#ocr#long-context#kv-cacheunlimited-ocrbaiduunlimited-ocr
💡了解 Baidu 新的 Constant KV Cache 架構如何解決長文件 AI 處理中的記憶體瓶頸。
⚡ 30-Second TL;DR
有什麼變化
推出用於長文件處理的 Unlimited-OCR
為什麼重要
這項進展顯著降低了處理海量文件的運算負擔,使長文本 AI 應用更具可行性與成本效益。
下一步行動
評估您目前的 RAG 管線記憶體消耗,並研究 Constant KV Cache 架構是否能改善您的長文件檢索延遲。
誰應關注:Researchers & Academics
關鍵要點
- •推出用於長文件處理的 Unlimited-OCR
- •實作 Constant KV Cache 以優化記憶體使用
- •在效能基準測試中達到業界領先水準
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •Unlimited-OCR 透過將文件視覺特徵轉化為 KV Cache,解決了傳統 OCR 在處理超長文件時的記憶體瓶頸問題。
- •該技術整合了百度自研的文心大模型(Ernie)架構,實現了視覺與語言模型的深度融合,提升了對複雜版面與手寫文字的識別率。
- •Constant KV Cache 技術允許模型在處理數千頁文件時,記憶體佔用量保持恆定,不再隨文件長度線性增長。
- •此項技術已在百度的企業級雲端服務平台(Baidu AI Cloud)中進行初步部署,旨在服務金融、法律及科研等需要大量文檔處理的行業。
- •Unlimited-OCR 支援多種語言混合識別,並針對中文古籍與專業領域術語進行了專門的數據集微調。
📊 競品分析▸ Show
| 特性 | Baidu Unlimited-OCR | Google Cloud Document AI | Microsoft Azure AI Document Intelligence |
|---|---|---|---|
| 核心技術 | Constant KV Cache | Transformer-based OCR | LayoutLM 系列 |
| 長文件處理 | 記憶體恆定 (優勢) | 依賴分段處理 | 依賴分段處理 |
| 適用場景 | 超長文件/書籍掃描 | 通用企業表單 | 企業自動化流程 |
🛠️ 技術深入
- 採用 Constant KV Cache 機制:將視覺編碼器的輸出固定為 KV Cache 的一部分,避免了隨著輸入長度增加而導致的計算與記憶體爆炸。
- 視覺-語言對齊:利用跨模態注意力機制(Cross-modal Attention),將 OCR 提取的文字位置資訊與語義特徵進行對齊。
- 記憶體優化:透過 KV Cache 壓縮與快取重用技術,將長文本處理的顯存佔用降低至傳統方法的 1/10 以下。
- 推理加速:結合百度自研的 PaddlePaddle 框架進行算子融合,顯著提升了長文件處理的吞吐量。
🔮 前景展望AI analysis grounded in cited sources
長文件處理成本將大幅下降
Constant KV Cache 技術顯著降低了對高階 GPU 記憶體的依賴,使得企業能以更低的硬體成本處理大規模文檔。
OCR 技術將從單純識別轉向深度理解
Unlimited-OCR 的架構設計不僅限於文字提取,更強調對長篇文檔上下文的語義理解與邏輯分析。
⏳ 時間線
2023-03
百度正式發布文心一言(Ernie Bot),奠定大模型技術基礎。
2024-06
百度升級文心大模型 4.0,強化視覺與多模態處理能力。
2025-11
百度在技術開發者大會上預告了針對長上下文(Long Context)的記憶體優化方案。
2026-06
百度正式發布 Unlimited-OCR,引入 Constant KV Cache 技術。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週 AI 簡報
每週一封,可隨時退訂。

