
Google 悄悄發布模型,速度提升 4 倍
Google 發布了一款利用擴散模型技術進行文字生成的新模型,推論速度提升了 4 倍。此更新顯示了擴散模型在文字任務應用上的轉變。
Tag: #diffusion-model8 results

Google 發布了一款利用擴散模型技術進行文字生成的新模型,推論速度提升了 4 倍。此更新顯示了擴散模型在文字任務應用上的轉變。

DeepMind 發布了 DiffusionGemma,這是一款採用圖像風格擴散模型進行文字生成的開源權重模型。該模型能並行生成文字而非逐個 token 生成,並具備即時錯誤修正與極高的推論速度。

Google 發布了 DiffusionGemma,這是一款將擴散技術應用於文字生成的開源模型。它能平行生成 256 個 token,相較於傳統自回歸模型,顯著提升了生成速度。
Google 推出了實驗性 AI 模型 DiffusionGemma,利用擴散模型技術將文字生成速度提升至最高 4 倍。透過一次性並行生成 256 個 token,該模型解決了傳統自回歸模型的瓶頸,非常適合本地端的程式碼補全與編輯任務。
Omnivoice 是支援超過600種語言的零樣本多語言TTS模型,具備語音克隆與設計功能。它採用擴散語言模型架構,提供高品質語音與極快推論速度RTF 0.025。在HuggingFace上以Apache-2.0授權提供,但tokenizer有額外授權限制。

Inception Labs 推出 Mercury 2,這是一款基於擴散的巨型語言模型,專為高速多步驟推理任務設計。它具備 128K 上下文窗口,能夠處理複雜的推理能力。
Dynin-Omni 推出首個遮罩擴散基礎的全模態模型,統一文字、影像、影片、語音理解與生成。在單一架構實現強大跨模態效能。此方法引發單一權重多模態益處的懷疑。
15人華人小隊開發的黑馬圖像模型,獲 Nano Banana 技術負責人點讚。由 DDIM 之父與 CVPR 最佳論文作者帶隊,該模型多项能力看齊行業標杆。