
AI 公司為訓練模型大量購買數千本書
一家荷蘭古書店收到中國 AI 公司訂購 3,000 本書的訂單,推測用途是建立訓練資料。報導也揭露 Anthropic 曾掃描並銷毀數百萬本書,凸顯 AI 資料集建置流程的不透明,以及其中可能引發的爭議。
Tag: #ocr36 results

一家荷蘭古書店收到中國 AI 公司訂購 3,000 本書的訂單,推測用途是建立訓練資料。報導也揭露 Anthropic 曾掃描並銷毀數百萬本書,凸顯 AI 資料集建置流程的不透明,以及其中可能引發的爭議。
開發者在處理法律文件時,發現 DeepSeek-OCR 會將章節標題誤標為內文。目前正在評估是否應採用 CRF 或 GNN 模型來提升結構化提取的準確度。

這是一份關於如何使用 Claude 將手寫商業帳簿轉換為結構化 Excel 檔案的實用指南。此方法無需手動輸入數據或具備複雜的程式設計技能。

百度發布了一款新的開源 OCR 模型,能夠一次處理如整本書籍般的巨量文字。據傳該專案由前 DeepSeek 研究員主導開發。
開發者發布了基於 ncnn 推論框架的 PaddleOCR (v3 至 v6 版本) C++ 實作。此更新移除了官方 Paddle 執行環境中複雜的依賴項,大幅簡化了部署流程。

PaddleOCR 3.5 已更新並支援 Transformers 後端,實現更靈活的文件解析與 OCR 工作流程。此整合讓開發者能利用 Hugging Face 生態系統進行進階文字識別任務。

LlamaIndex 執行長 Jerry Liu 解釋,隨著模型推理能力提升,索引與 RAG 等 AI 支架層正在崩潰。脈絡與資料解析成為關鍵差異化因素。LlamaIndex 專注於代理式 OCR 處理鎖定檔案格式。
Hugging Face 部落格介紹使用合成資料建構快速多語言 OCR 模型。此方法利用生成資料訓練高效模型,支援多種語言。目標是提升光學字元辨識任務的速度與準確度。
HunyuanOCR 1B GGUF 模型在 GTX 1060 上達 ~90 權杖/秒,OCR 準確率近乎完美。輕量設計適合預算硬體,滿足可靠本地 OCR 需求,無需高端 GPU。Hugging Face 上有 GGUF 版本。

Rocket Close 與 AWS GenAIIC 合作開發智能文件處理解決方案,用於抵押貸款。利用 Amazon Textract 進行 OCR,以及 Amazon Bedrock 的基礎模型,處理速度提升 15 倍。系統在文件分割、分類和欄位提取方面達到 90% 準確率。