
USTC 開源高效長文本訓練範式
USTC 研究人員發布了一種新型代理驅動的訓練範式,使 30B 參數模型能達到 Alibaba 235B Qwen3 模型的性能。此突破顯著提升了長文本語言模型的訓練效率。
Tag: #efficiency28 results

USTC 研究人員發布了一種新型代理驅動的訓練範式,使 30B 參數模型能達到 Alibaba 235B Qwen3 模型的性能。此突破顯著提升了長文本語言模型的訓練效率。

智元機器人自研的 20 億參數世界模型 GE 2.0,在 WorldArena Track1 榜單中擊敗 NVIDIA 與 Microsoft 等大參數模型奪冠,展現出極高的物理世界模擬與具身智慧效能。
OpenAI 的 GPT-5.5 推出先進智能體功能與高昂 API 定價,DeepSeek-V4 則以高效演算法與極低成本反擊。這標誌 AI 產業在算力主導與演算法效率間的分水嶺。此事件重塑定價與可及性規則。
Meta Platforms計畫裁員10%,約8,000名員工。此舉旨在提升效率,抵銷大量人工智慧支出。由Ed Ludlow於Balance of Power報導。

Google Research 推出 TurboQuant,這是一種透過極端模型壓縮重新定義 AI 效率的新技術。在 Reddit r/LocalLLaMA 上分享,預示大型模型以更少資源運行的重大進展。

DST 引入輕量級即插即用預測器,作為監督式啟發式引導 LLM 中的思維樹(ToT)搜尋。它實現動態、情境感知的剪枝,在簡單步驟近似貪婪效率,在複雜情況自適應擴展。評估顯示在推理基準上準確率與基準相當或優越,計算量減少 26-75%。

OpenAI 推出 GPT-5.4 mini 和 nano 模型,降低成本與延遲。它們維持接近旗艦模型的效能。開發者獲得用於即時應用程式的更快AI選項。

Meta 據報計劃裁員 20%,超過 15,000 人,以抵銷 6,000 億美元 AI 數據中心投資及 AI 驅動的生产力提升。扎克伯格指出 AI 讓一人可取代整個團隊。儘管 Llama 4 遭遇挫折,Meta 仍持續大量 AI 收購與人才投資。

NVIDIA 的 Nemotron-3-Super 為 120B 參數模型,每 token 只啟用 12.7B,在 OpenClaw 代理的 PinchBench 平均排行榜上名列第一。其優勢在於機器人一致性,而非原始智能。

研究人員開發出參數少於 100 的 Transformer,能以 100% 準確率相加兩個 10 位數字,使用數字 token。該專案展示專用模型的極致效率。浮點運算仍具挑戰性。