🏠較早收集於 1m

微信付費收集方言語音資料

微信付費收集方言語音資料
PostLinkedIn
🏠閱讀原文: IT之家

💡騰訊眾包方言資料—訓練強健中文語音AI至關重要 (28字)

⚡ 30-Second TL;DR

有什麼變化

獎勵:3句約1元、20句5元,每日最高40元

為什麼重要

助騰訊眾包多元語音資料,提升中文方言ASR模型。凸顯AI資料收集的商業激勵,兼顧文化保存需求。

下一步行動

測試微信方言語音轉文字API,用於基準你的ASR模型。

誰應關注:Researchers & Academics

關鍵要點

  • 獎勵:3句約1元、20句5元,每日最高40元
  • 反作弊拒絕模糊或重複語音,30天內發放
  • 連結微信現有方言支援如潮汕話
  • 因應方言衰退:68種語言使用者不足萬人

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • 此計畫屬於騰訊「方言保護計畫」的一部分,該計畫旨在透過數位化手段保存瀕危語言,並將收集到的語音數據納入騰訊雲語音識別引擎的訓練集。
  • 微信利用其龐大的社交生態進行眾包數據採集,相比傳統聘請專業錄音員,此舉能更有效獲取真實生活場景中的口音、語速與環境雜訊,提升模型的魯棒性。
  • 數據隱私與合規性是該計畫的重點,參與者在錄製前需簽署授權協議,確保語音數據僅用於學術研究與產品優化,且數據會經過去識別化處理以保護用戶隱私。

🔮 前景展望AI analysis grounded in cited sources

微信將在未來兩年內顯著提升其語音轉文字(ASR)在非標準普通話及方言環境下的準確率。
透過大規模眾包採集真實語音數據,能有效解決現有模型在處理方言口音時的數據稀疏問題。
騰訊將開放部分方言識別API供第三方開發者使用。
隨著數據庫的完善,將這些數據轉化為雲端服務能力是騰訊雲擴大市場份額的必然路徑。

時間線

2019-06
騰訊啟動「方言保護計畫」,宣佈與聯合國教科文組織合作推動語言保護。
2021-09
微信語音輸入法開始整合更多方言識別功能,並在部分地區進行小規模測試。
2024-03
微信正式推出基於小程序的大規模方言數據眾包採集活動。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。