來源Reddit r/MachineLearning•較早收集於 37m
LOLAMEME 比較 GPT-2、Hyena 與混合架構
#hybrid-architectures#synthetic-taskslolameme
💡Hybrids beat GPT-2/Hyena on logic+memory; key insights for Mamba/StripedHyena design
⚡ 30 秒速覽
有什麼變化
THEX-12 在全域變數任務達 0.36 精確匹配,高於 Hyena 0.14、GPT-2 0.007
為什麼重要
透過注意力-捲積協同效應,啟發 Mamba/StripedHyena 等 SSM 混合架構設計。將機械解釋性推向超越玩具任務的真實複雜度。
下一步行動
Read the paper at https://arxiv.org/abs/2406.02592 and replicate THEX hybrid on your logic-memory benchmarks.
誰應關注:Researchers & Academics
關鍵要點
- •THEX-12 在全域變數任務達 0.36 精確匹配,高於 Hyena 0.14、GPT-2 0.007
- •THEX-13 在多語言任務達 0.738,高於 Hyena 0.492、GPT-2 0.249
- •Hyena 在中規模記憶優異,但 1000 變數時崩潰
- •最佳混合層放置依任務複雜度而異
- •自訂語言測試駝峰/蛇形命名、運算子、潛在類型
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週電子報
每週一封,可隨時退訂。