
OpenAI 新語音 AI 支援 70+ 語言
OpenAI 推出三款全新音頻模型,能推理、跨 70+ 語言翻譯,並即時轉錄語音。這些進展讓語音成為開發者建構 AI 應用時的實用介面。
Tag: #multilingual49 results

OpenAI 推出三款全新音頻模型,能推理、跨 70+ 語言翻譯,並即時轉錄語音。這些進展讓語音成為開發者建構 AI 應用時的實用介面。

Granite-4.1-8B 是從基礎模型微調的 8B 指令模型,經改善後訓練包含 SFT 及 RL 對齊。強化工具呼叫、指令遵循及聊天,用於 AI 助理及代理。支援 13 語言、Apache 2.0 授權,2026 年 4 月 29 日發布。
開發者完成 Dante-2B 第一階段訓練,這是專為義大利文與英文優化的 2.1B 參數 LLM,從頭訓練。客製化 tokenizer 有效處理義大利文形態。第二階段將擴展至 4096 上下文長度。
Gemma 4 是首個在使用者英語、德語、日語多語言工具呼叫測試中達 100% 成功率的 LLM。用於 N8N 語音助理,搭配 68GB VRAM 及 MoE 模型如 Gemma4 26BA4B。

Google 已透過 Gemini API 和 Google AI Studio 推出 Gemini 3.1 Flash Live。它支援即時語音和視覺代理程式,並降低延遲。該模型可在 90 多種語言中隔離語音。

Cohere 推出專為轉錄設計的開源語音模型。僅 20 億參數,可在消費級 GPU 上自託管,目前支援 14 種語言。
Hugging Face 推出 Nemotron 3 Content Safety 4B,這是一個 40 億參數的先進內容審核模型。它支援如文字和圖像等多模態輸入,並處理多種語言以適用全球應用。該模型現已在 Hugging Face Hub 上提供。

Scale AI 推出 Voice Showdown,這是首個使用超過 60 種語言真實人類互動的語音 AI 真實世界基準測試。基於 ChatLab,提供頂級前沿模型免費存取,並透過盲測頭對頭對戰收集使用者偏好。初步結果顯示合成基準忽略的領先模型重大差距。
使用 A100 GPU 在泰國 LANTA 超級電腦上測試 14 種嵌入模型於 15 項泰語 MTEB 任務。Qwen3-Embedding-4B 以 74.41 分領先,KaLM-Gemma3-12B 以 73.92 分緊追。結果已合併至官方 MTEB 儲存庫,並提供互動排行榜。

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。