🤖Reddit r/MachineLearning•較早收集於 27m
發布專業 MQM 註解 MT 資料集
#machine-translation#mqm-annotation#evaluation-datasetalconost/mqm-translation-goldalconosthuggingfacewmtmqm
💡專業註解 MT 資料集,一致性為 WMT 的 2.6 倍—完美可靠評估工具(48字)
⚡ 30-Second TL;DR
有什麼變化
16 語言對共 362 個片段
為什麼重要
此資料集提供可靠、高一致性的 MT 評估基準,有助研究人員比喧鬧的眾包註解更準確評估模型效能。
下一步行動
從 Hugging Face 下載 alconost/mqm-translation-gold 資料集,用以基準測試您的 MT 模型。
誰應關注:Researchers & Academics
關鍵要點
- •16 語言對共 362 個片段
- •48 名專業語言學家,全 MQM 註解(類別、嚴重度、範圍)
- •註解者間一致性 Kendall's τ = 0.317,為 WMT 典型值的 2.6 倍
- •每個片段多位註解者確保可靠性
- •Hugging Face 上託管,便於存取
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
🛠️ 技術深入
- •MQM錯誤類別階層:Accuracy (Mistranslation, Addition, Omission, Untranslated)、Fluency (Grammar, Punctuation, Spelling, Register)、Terminology、Style、Locale conventions。[2]
- •嚴重度等級:至少Minor和Major,另有Neutral或Critical (如生物醫學翻譯中危及安全的錯誤)。[2]
- •註解一致性指標:如Emotion (C-E) 的Cohen's κ為0.669 (inter-AA)、0.899 (intra-AA)。[2]
- •計分模型:MQM Council於2024年發布Linear Calibrated Scoring Model及Non-Linear Scoring Model,將錯誤類型與嚴重度轉換為數值分數。[7]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2014-01
MQM框架由Lommel et al.提出,定義階層錯誤類型及嚴重度。
2024-05
arXiv發布MQM相關論文,MQM Council公布Linear Calibrated Scoring Model。
2024-08
MQM Council發布Non-Linear Scoring Model及更新計分細節。
2026-02
Emergent Mind更新MQM註解資料集概覽,涵蓋多領域應用。
2026-03
Hugging Face開源專業MQM註解MT資料集,16語言對362片段。
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。