
DeepSeek 推出多模態視覺 API
DeepSeek 已在 API 平台推出 V4-Flash-Vision-Exp 模型,支援在文字之外輸入圖片,執行視覺分析等任務。該公司表示,其多模態 Agent 能力大幅提升,在視覺 Agent 基準測試中的表現已接近 Opus-4.8。
Tag: #ocr36 results

DeepSeek 已在 API 平台推出 V4-Flash-Vision-Exp 模型,支援在文字之外輸入圖片,執行視覺分析等任務。該公司表示,其多模態 Agent 能力大幅提升,在視覺 Agent 基準測試中的表現已接近 Opus-4.8。

Infinity-Parser2 是一款全新的多模態模型,具備 500 萬樣本的合成語料庫與多任務強化學習框架。該模型在文件解析基準測試中達到頂尖水準,超越了 DeepSeek-OCR-2 等模型。

Qwen3.5 模型(0.8B 至 9B)在開放文件 AI 基準測試中評估,涵蓋 9,000 多份真實文件。9B 和 4B 變體在 OCR 文字提取、VQA 和 KIE 任務中勝過 Gemini 3.1 Pro 和 GPT-5.4 等前沿模型。但在表格提取和手寫 OCR 上明顯落後。
百度開源了專為長文檔解析設計的 Unlimited OCR 模型(3B 參數)。憑藉其高效率與準確性,該模型已登頂多個 GitHub 與 HuggingFace 熱門榜單。
Papers with Code 推出 OCR 集中化平台,收錄 Chandra OCR 2 與 Mistral OCR v4 等頂尖模型。該平台提供關鍵基準測試與程式碼連結,協助開發者在快速發展的文件數位化工具領域中進行選擇。

百度在 ModelScope 上發布了 Unlimited-OCR,這是一款 3.3B 參數的模型,專為圖像、多頁文件和 PDF 的單次解析而設計。它支援 32K 輸出長度,並針對全文件提取進行了優化。

Mistral 發布了 OCR 4,這是一款專為 170 種語言的高精度文件提取而設計的新工具。它提供包含邊界框、區塊類型和區域分數的結構化輸出。

Baidu 推出了 Unlimited-OCR,這是一項旨在高效處理長文件的技術。它利用 Constant KV Cache 機制,在文件處理任務中實現了業界領先的效能。

PP-OCRv6 已於 Hugging Face 發布,支援 50 種語言。該模型系列涵蓋從 1.5M 參數的輕量級版本到 34.5M 參數的高效能版本。

紐約新創公司 Coral 募資 1,250 萬美元,用以擴展其 AI 平臺,自動化醫療行政任務。其 AI 可閱讀手寫傳真表單、處理事先授權,並在五分鐘內完成患者登記,且無需醫療提供者改變工作流程。Coral 在一年內達成數百萬美元營收,並目標到 2026 年底成長 4 倍。