
OpenAI 準備透過 GPT-Bidi-1 模型進行重大語音升級
OpenAI 正在開發 GPT-Bidi-1,這是一款用於 ChatGPT 的新型雙向音訊模型。此更新預計將顯著提升即時語音對話的品質與延遲表現。
Tag: #model-architecture24 results

OpenAI 正在開發 GPT-Bidi-1,這是一款用於 ChatGPT 的新型雙向音訊模型。此更新預計將顯著提升即時語音對話的品質與延遲表現。
Moonshot AI創辦人楊植麟將於GTC 2026演講,首次完整公開披露Kimi模型的技術路線圖。此揭露提供前所未見的領先中國LLM架構與開發策略洞見。該消息出現在36氪每日熱點導覽中。
商湯徹底摒棄多模態模型中的VE與VAE元件,移除所有中間編碼器,打造簡化架構。其全新2B參數模型大幅超越傳統範式。

Ming-Flash-Omni 被介紹為全模態統一基礎模型。文章聚焦於建構可端到端處理多種模態模型的關鍵技術與實務經驗。

一名自稱 Ant 員工的作者比較中國主要 AI 實驗室的策略:Qwen 強調分發、DeepSeek 著重架構、Moonshot 採取長期實驗,而 Ant 聚焦服務成本。貼文還將 Ling-3.0-flash 描述為總參數 124B、針對高效長上下文代理工作負載設計的模型,並表示權重將在公告後開放。

Tensey 是一款全新的視覺化編輯器,讓開發者能在模型設計階段驗證張量形狀、計算參數數量,並預估 FLOPs 與 VRAM 使用量。它能幫助開發者在早期發現架構不匹配問題,並匯出可執行的 PyTorch 程式碼。

這項研究探討了混合式模型在哪些特定類型的 Token 上,表現出優於標準架構的預測能力。研究提供了關於架構優勢的見解,有助於優化語言模型的效能。

位於聖地牙哥的初創公司 Aether AI 獲得了 2,000 萬美元的種子輪融資。該公司旨在超越大規模模型,轉而專注於因果 AI 的研究。
關於 LLM 發布趨勢轉變的討論,指出過去三個月內缺乏新的 120B MoE 模型。產業似乎正朝向較小的 25B-35B 模型或龐大的 200B+ 架構兩極化發展。
Hugging Face 部落格揭露 Granite 4.1 大語言模型的建構過程。詳細說明來自 IBM 的這些開源模型的架構、訓練與創新。是理解現代 LLM 開發的必讀內容。