🏠IT之家•較早收集於 1m
微信付費收集方言語音資料

💡騰訊眾包方言資料—訓練強健中文語音AI至關重要 (28字)
⚡ 30-Second TL;DR
有什麼變化
獎勵:3句約1元、20句5元,每日最高40元
為什麼重要
助騰訊眾包多元語音資料,提升中文方言ASR模型。凸顯AI資料收集的商業激勵,兼顧文化保存需求。
下一步行動
測試微信方言語音轉文字API,用於基準你的ASR模型。
誰應關注:Researchers & Academics
關鍵要點
- •獎勵:3句約1元、20句5元,每日最高40元
- •反作弊拒絕模糊或重複語音,30天內發放
- •連結微信現有方言支援如潮汕話
- •因應方言衰退:68種語言使用者不足萬人
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •此計畫屬於騰訊「方言保護計畫」的一部分,該計畫旨在透過數位化手段保存瀕危語言,並將收集到的語音數據納入騰訊雲語音識別引擎的訓練集。
- •微信利用其龐大的社交生態進行眾包數據採集,相比傳統聘請專業錄音員,此舉能更有效獲取真實生活場景中的口音、語速與環境雜訊,提升模型的魯棒性。
- •數據隱私與合規性是該計畫的重點,參與者在錄製前需簽署授權協議,確保語音數據僅用於學術研究與產品優化,且數據會經過去識別化處理以保護用戶隱私。
🔮 前景展望AI analysis grounded in cited sources
微信將在未來兩年內顯著提升其語音轉文字(ASR)在非標準普通話及方言環境下的準確率。
透過大規模眾包採集真實語音數據,能有效解決現有模型在處理方言口音時的數據稀疏問題。
騰訊將開放部分方言識別API供第三方開發者使用。
隨著數據庫的完善,將這些數據轉化為雲端服務能力是騰訊雲擴大市場份額的必然路徑。
⏳ 時間線
2019-06
騰訊啟動「方言保護計畫」,宣佈與聯合國教科文組織合作推動語言保護。
2021-09
微信語音輸入法開始整合更多方言識別功能,並在部分地區進行小規模測試。
2024-03
微信正式推出基於小程序的大規模方言數據眾包採集活動。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
每週 AI 簡報
每週一封,可隨時退訂。
