
Qwen3.5-9B 在文件基準測試勝過前沿模型
Qwen3.5 模型(0.8B 至 9B)在開放文件 AI 基準測試中評估,涵蓋 9,000 多份真實文件。9B 和 4B 變體在 OCR 文字提取、VQA 和 KIE 任務中勝過 Gemini 3.1 Pro 和 GPT-5.4 等前沿模型。但在表格提取和手寫 OCR 上明顯落後。
Tag: #document-ai14 results

Qwen3.5 模型(0.8B 至 9B)在開放文件 AI 基準測試中評估,涵蓋 9,000 多份真實文件。9B 和 4B 變體在 OCR 文字提取、VQA 和 KIE 任務中勝過 Gemini 3.1 Pro 和 GPT-5.4 等前沿模型。但在表格提取和手寫 OCR 上明顯落後。

本研究提出了一種強大的微服務架構,用於大規模部署文件理解管線。它為優化生產環境中高吞吐量的 OCR 與基於 LLM 的提取提供了寶貴見解。

微軟宣布,今年 5 月下旬將把 Anthropic 的大模型引入 Microsoft 365 Copilot,在 Word 中為用戶提供智能潤色和整理文件的新選項。此整合由微軟作為分處理方運營,Anthropic 模型將在微軟既有安全、合規框架下運行,OpenAI 模型仍可選擇。

Anthropic 推出適用於 Microsoft Word 的全新 Claude 擴充功能。此擴充套件讓 Claude 能夠讀取整個文件、編輯選取文字、處理註解,並追蹤變更以維持使用者控制。
Hugging Face 發布 Granite 4.0 3B Vision,這是一款專為企業文件設計的緊湊多模態模型。它提供高效的視覺語言智能,適用於商業應用。該模型現已在 Hugging Face 平台上線。
全新開放 IDP 排行榜評估 16 款 VLM,涵蓋 9,000+ 文件與三項基準:OlmOCR、OmniDoc 及 IDP Core。Gemini 3.1 Pro 略居首位;廉價變體在非推理任務與旗艦匹敵。提供預測 vs. 真值結果瀏覽器。

這項研究提出一套用於建築文件審查的證據導向管線,將文字、幾何、頁面與版本資訊正規化,並以決定性規則進行約束檢查。在重複測試中,增加重疊頁面區塊的解析度可提升準確率;但在更廣泛的資料集上未穩定勝過頁面涵蓋率,顯示仍需要具備規則感知能力的證據路由與人工覆核。

本指南展示如何建立一個伺服器,從儲存在 Amazon S3 的 PDF 檔案中進行即時文字擷取。文中並比較了自訂協定擷取與 Amazon Textract 的差異,協助開發者選擇合適的工具。

Google 在 Gemini AI 應用程式新增「Notebooks」區段,直接存取 NotebookLM。使用者可從側邊欄建立和管理筆記本,生成特定文件基礎的回答、使用 Canvas 長文撰寫,並在 Gemini 內產生音聲概說。付費方案使用者優先推出。
雲知聲發布U1-OCR,首個工業級文件智能基礎大模型。此發布標誌著OCR 3.0時代的開啟。它針對工業應用提供強健的文件處理。