
FireRed 統一音訊理解、TTS 與語音編輯
FireRedTeam 推出 FireRedAudio,一款採用共享 9B 參數骨幹、並以獨立路徑處理理解與語音生成的通用音訊語言模型。本次發布也包含 FireRedTTS3,支援多語言零樣本聲音複製、自然語言聲音設計,以及語意與聲學語音編輯。
Tag: #multilingual49 results

FireRedTeam 推出 FireRedAudio,一款採用共享 9B 參數骨幹、並以獨立路徑處理理解與語音生成的通用音訊語言模型。本次發布也包含 FireRedTTS3,支援多語言零樣本聲音複製、自然語言聲音設計,以及語意與聲學語音編輯。
阿里巴巴推出 Marco-Mini-Instruct(17.3B 總數,0.86B 激活,5%)與 Marco-Nano(8B,0.6B 激活)。在英文/多語基準勝 Qwen3-4B、Gemma3-12B。Apache 2.0,HF 模型可用。
GigaChat 在 Hugging Face 以 MIT 授權發布 GigaChat-3.1-Ultra(702B MoE)與 GigaChat-3.1-Lightning(10B MoE)開放權重。從頭預訓練,在基準測試超越 DeepSeek-V3 與 Qwen3,優化英文/俄文及工具呼叫。Ultra 適合高資源環境;Lightning 擅長本地推理,支援 256k 上下文。

全球首個藏語大語言模型 DeepZang 在拉薩發布,標誌中國在民族語言 AI 領域領先。西藏覺羅數字開發,支持藏中英互動,包括對話、翻譯和語音轉寫。擁有近 7000 萬平行語料和超過 30500 小時語音數據,獲世界紀錄認證。
阿里正式推出 Qwen-Image-3.0,這是其圖像生成基礎模型的第三代產品。該模型具備更強的性能,包括支援 4.5k token 輸入、10px 小字精準渲染以及 12 種語言的原生渲染能力。

百度在 ModelScope 上發布了 Unlimited-OCR,這是一款 3.3B 參數的模型,專為圖像、多頁文件和 PDF 的單次解析而設計。它支援 32K 輸出長度,並針對全文件提取進行了優化。

Mistral 發布了 OCR 4,這是一款專為 170 種語言的高精度文件提取而設計的新工具。它提供包含邊界框、區塊類型和區域分數的結構化輸出。

PP-OCRv6 已於 Hugging Face 發布,支援 50 種語言。該模型系列涵蓋從 1.5M 參數的輕量級版本到 34.5M 參數的高效能版本。
GitHub 發布了一個基於 CC0-1.0 授權的全新儲存庫層級數據集。該數據集匯集了來自 README、Issue 與 Pull Request 的多語言開發者內容,以支援 AI 研究。
IBM 發布了以 Apache 2.0 授權開源的 Granite Embedding Multilingual R2 模型。該模型在 1 億參數以下的規模中提供頂尖的檢索品質,並支援 32K 的上下文視窗。