來源近期收集於 15h

Bilibili 開源支援 150 種語言的翻譯模型

閱讀原文: Pandaily
#machine-translation#multilingual#apache-2-0

寬鬆授權的模型系列,為開發者帶來支援150種語言及專用在地化版本的翻譯能力。

30 秒速覽

有什麼變化

Index-Translate 支援 150 種語言。

為什麼重要

Apache-2.0 授權可能讓商業與研究應用更容易使用多語言翻譯能力。專用版本可能適合需要時間控制、發音處理或長上下文能力的在地化管線。

下一步行動

下載 Apache-2.0 授權的 2B 與 9B 權重,並在目標語言組合與文件長度上進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Index-Translate 支援 150 種語言。
  • •預覽文字模型提供 2B、9B 與 35B-A3B 配置。
  • •其他版本針對配音、音節控制與長文件處理。
關鍵數字81.92%10%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

增強重點摘要

  • •Index-Translate 系列以阿里巴巴的 Qwen3.5 作為底層架構進行開發,並透過 Hugging Face 與 ModelScope 開源發布。
  • •專用配音與語音複製分支 Index-Echo 具備保留原說話者聲音特徵的能力,支援中文、英文、西班牙文與日文之間的雙向語音對語音翻譯。
  • •音節控制模型 Index-Homura 專為影片配音與字幕對齊設計,在 SandGlass 基準測試中達到 81.92% 的音節預算合規率(容差 10% 內)。
  • •長文件版本 Index-NativeLong(亦稱 Index-Nailong)針對跨段落上下文與專有名詞一致性優化,可處理達數萬 token 的長文翻譯。
  • •結合 Bilibili 的 ACG 與社群背景,該模型針對迷因、網路梗、遊戲俚語(如《最終幻想XIV》用語)及 JSON 等格式保留進行了深度特化。

技術深入

  • 底層架構:以阿里 Qwen3.5 為基礎模型建構,包含 Dense(2B、9B)與 MoE(35B-A3B,總參數 35B、每次啟動 3B 參數)配置。
  • 開源授權與平台:採用寬鬆的 Apache-2.0 授權條款,權重與程式碼託管於 Hugging Face 及 ModelScope。
  • Index-Echo(語音分支):整合語音到語音(Speech-to-Speech)與語音複製能力,在轉換語種時保留說話者音色,涵蓋中、英、西、日四種語言。
  • Index-Homura(音節預算控制):專門針對對嘴與字幕長度設計,限制目標語言音節生成數量,於 SandGlass 基準達成 81.92% 合規率。
  • Index-NativeLong(長文本一致性):強化跨段落注意力與長上下文追蹤,防止數萬 token 長文件中的實體名稱漂移。
  • 部署與評測工具鏈:支援 vLLM 與 SGLang 推理後端,提供適用於 Chrome、Edge、Firefox 的本地網頁翻譯外掛,並同步釋出 instTrans、SandGlass 與 MEME 等評測基準。

前景展望基於引用來源的 AI 分析

影音跨國本地化與對嘴配音流程將全面自動化
透過音節約束控制與保留原聲音色特徵,創作者能以極低成本直接產出符合口型與長度要求的跨語言配音內容。
垂直社群與次文化翻譯準確度顯著提升
模型專門針對 ACG、遊戲黑話與網路迷因進行微調,將打破通用大型翻譯模型在特定社群流行語轉換上的盲區。

時間線

2026-10
Bilibili Index LLM 團隊開源發布 Index-Translate 多語言翻譯模型家族

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。