PyMuPDF 1.28 新增原生 Markdown 支援
PyMuPDF 1.28 引入 Markdown 作為一等文件格式,允許開發者將 Markdown 直接轉換為 PDF。此版本支援自訂 CSS 樣式,以控制生成文件的外觀。
Tag: #document-processing18 results
PyMuPDF 1.28 引入 Markdown 作為一等文件格式,允許開發者將 Markdown 直接轉換為 PDF。此版本支援自訂 CSS 樣式,以控制生成文件的外觀。

百度發布了一款新的開源 OCR 模型,能夠一次處理如整本書籍般的巨量文字。據傳該專案由前 DeepSeek 研究員主導開發。

本文展示如何利用 Amazon Bedrock 構建智慧文件處理管線。重點介紹了結合隨選(on-demand)與批次(batch)推論,以優化處理時間與成本。
AWS 推出多文件發現功能,自動化智能文件處理的結構描述生成。它使用視覺嵌入分析未知文件、依類型叢集,並以代理生成結構描述。包含在自訂文件集上執行的指南。

Rocket Close 與 AWS GenAIIC 合作開發智能文件處理解決方案,用於抵押貸款。利用 Amazon Textract 進行 OCR,以及 Amazon Bedrock 的基礎模型,處理速度提升 15 倍。系統在文件分割、分類和欄位提取方面達到 90% 準確率。

Ricoh 使用 AWS GenAI IDP Accelerator 打造標準化、多租戶解決方案,用於自動化文件分類與擷取。這將其文件處理從客製化工程瓶頸轉變為可擴展、重複使用的服務。AWS 機器學習部落格詳述實施細節。
Reddit r/MachineLearning 用戶尋求低成本方法 OCR 5000萬頁法律文件。只關注文字提取,忽略版面。必須在一週內完成。

英國規劃當局面臨公眾文件存取與資料保護衝突。新AI系統透過AI-in-the-Loop自動化個人資訊遮罩、元數據提取及圖紙分析。目前在四個當局試點,採用主動學習並有ROI模型。