
Parcae:770M 匹敵 1.3B 效能
Parcae 是一款穩定迴圈語言模型,能以一半大小匹敵 Transformer 品質。其 770M 版本達到 1.3B 等級效能。它首度提出迴圈模型的擴展法則,強調增加遞迴比更多資料更具運算效率。
Tag: #scaling-laws37 results

Parcae 是一款穩定迴圈語言模型,能以一半大小匹敵 Transformer 品質。其 770M 版本達到 1.3B 等級效能。它首度提出迴圈模型的擴展法則,強調增加遞迴比更多資料更具運算效率。

Import AI 452 探討擴展法則應用於網路戰、AI 驅動自動化的上升浪潮,以及 AI 影響下的 gDP 預測難題。它質疑 AI 對全球經濟的革命性潛力。

基於LLM的代理評審在15項任務的960個會話中,通過圖靈式驗證與人類評審無異。品質分數隨面板大小對數改善,獨特問題發現則遵循次線性冪律。Big Five人格條件化實現多樣探測,提升覆蓋率。

Apple 研究人員挑戰傳統 LLM 縮放定律,提出直接框架從訓練預算預測下游基準效能。他們發現簡單冪律能精準描述固定 token-參數比率下多個熱門任務的 log 準確度縮放。此直接方法比先前兩階段方法外推更佳。
Kimi 團隊提出注意力殘差 (AttnRes),以 softmax 注意力取代固定權重殘差加總,防止深度 LLM 隱藏狀態稀釋。Block AttnRes 分割層級以實現記憶體高效的大規模訓練。整合至 48B Kimi Linear 模型,在 1.4T 權杖預訓練下,產生均勻梯度並提升下游效能。

研究人員在 32 步企業網路與 7 步工業控制系統網路攻擊靶場上評估前沿 AI 模型,需鏈結多項能力。效能隨推論運算呈對數線性擴展,從 10M 到 100M 令牌提升高達 59%。如 Opus 4.6 等新型模型遠勝 GPT-4o,最佳執行達 22/32 步。

新研究顯示,透過增加同質LLM多智能體系統會因資訊冗餘導致效能快速飽和。引入persona或取樣的多樣性可顯著延緩此瓶頸,用更少agent獲得更好效能。在GSM8K與ARC等7個基準測試。
提出結構化能力模型,從基準測試中提取可解釋的LLM能力,解決建構效度問題。在OpenLLM Leaderboard資料上,優於潛在因素模型的擬合度及縮放法則的預測力。結合縮放法則與潛在因素,將模型規模與能力分離。

研究人員使用 Psych-101 訓練了 14 個模型,參數規模從 1.35 億至 140 億,資料集包含來自 160 項實驗的 1,070 萬筆選擇。模型在分布內任務中僅需 0.6B–1B 參數即可匹敵 70B 基準模型,但在新任務結構上的泛化能力則明顯受益於更大規模。

Meta 介紹一套用於廣告排名的多階段架構,透過使用者行動的順序與時間捕捉持續變化的偏好和意圖。此方法延伸自序列學習,並探討排名效能如何隨模型與系統設計擴展。