
Google Gemini 聯席負責人 Noam Shazeer 跳槽 OpenAI
Transformer 架構核心貢獻者、前 Google Gemini 技術聯席負責人 Noam Shazeer 宣布離職並加入 OpenAI。Sam Altman 對此表示熱烈歡迎,並強調了 Shazeer 在 AI 領域的深遠影響。
Tag: #transformer9 results

Transformer 架構核心貢獻者、前 Google Gemini 技術聯席負責人 Noam Shazeer 宣布離職並加入 OpenAI。Sam Altman 對此表示熱烈歡迎,並強調了 Shazeer 在 AI 領域的深遠影響。
2025 年低谷後,Kimi 於 2025 年 7 月推出 K2 代理模型,2026 年推 K2.5 2.5T 多模態。「注意力殘差」論文挑戰 Transformer 基礎,獲 Karpathy 讚譽。被 Cursor(醜聞)、Perplexity、Cloudflare 採用。

Tencent 的 WeChat AI 團隊介紹了 WeLM 模型系列的 Hidden Decoding 擴展方法。團隊在不增加主要 Transformer 骨幹的情況下,訓練 WeLM-HD4-80B 與 WeLM-HD4-617B,實現大幅增加總參數量。

Transformer 架構論文《Attention Is All You Need》的關鍵研究員、Google Gemini 專案負責人 Noam Shazeer 已離開 Google 加入 OpenAI。此重磅人事異動發生在 OpenAI 準備 IPO 之際。

清華大學與阿里巴巴的研究人員發表了 ViT³ (Vision Test-Time Training),這是一種實現線性計算複雜度的 Transformer 架構。此突破使資源受限的邊緣裝置也能進行高解析度影像處理。
NVIDIA 為 RTX 50 系列 GPU 推出 DLSS 4.5 動態多幀生成與 6X 多幀生成,實現 4K 240Hz 高刷新遊戲。動態 MFG 自動調整倍數以優化品質與回應性,6X MFG 使用第二代 Transformer 模型每原生幀生成最多五個額外幀。

美團開源了 LongCat-Next,這是一個真正的原生多模態模型。它將文字、視覺和音頻統一為單一架構中的 token,無需獨立的模態編碼器。
H64LM 是一個研究項目,使用 PyTorch 從零開始實現了一個 249M 參數的 Mixture-of-Experts Transformer。它不依賴高階訓練框架,自行實現了 GQA、稀疏路由和 RoPE 等核心組件。
一位研究人員在非語言序列上訓練 Transformer-decoder 模型時遇到困難,指出模型無法學習自回歸行為,且常卡在生成單一 token 的問題上。