🤖較早收集於 14m

PRISM:僅相位語言模型透過 FFT 干涉

PRISM:僅相位語言模型透過 FFT 干涉
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#fft-mixing#phase-only#wave-interferenceprismprismfnetrope

💡僅相位 LM 透過 FFT 波干涉勝 Transformer—物理啟發 AI 效率!(28字)

⚡ 30-Second TL;DR

有什麼變化

強制單位幅度 (|z|=1),於相位角度儲存資訊,受 RoPE 啟發

為什麼重要

挑戰語言模型傳統幅度信號機制,或許促成模擬物理的架構,在光子硬體上高效。揭示干涉極限,啟發參數更少混合模型。

下一步行動

閱讀 arXiv 論文 https://arxiv.org/abs/2512.01208 並測試 PRISM 的單權杖失效。

誰應關注:Researchers & Academics

關鍵要點

  • 強制單位幅度 (|z|=1),於相位角度儲存資訊,受 RoPE 啟發
  • 使用 1D FFT 分頻並施加相位旋轉,而非幅度放大
  • 學習波干涉:相關詞建構性、無關詞破壞性
  • 單權杖失效(需 ≥4 縫干涉),對縮放/雜訊幅度不變

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • PRISM 在機器翻譯基準測試中達到 0.799 COMET 分數,接近 FNet 的 0.805,展示被動波干涉足以捕捉大部分語義對齊[1]
  • PRISM 採用相位調制 (PM) 而非幅度調制 (AM),與 FNet 的簽名對齊機制形成根本差異,使其能透過幾何旋轉引導語義[1]
  • PRISM 編碼器密度比 FNet 降低超過 10%,同時在參數數量相當的情況下(13.0M vs 14.7M)保持競爭力[1]
  • 該架構透過快速傅立葉變換 (FFT) 實現全局混合,具有線性對數複雜度 O(N log N),相比標準 Transformer 的注意力機制更具效率[1][2]
📊 競品分析▸ Show
特徵PRISMFNet標準 Transformer
混合機制相位調制 (FFT)幅度調制 (FFT)注意力機制
複雜度O(N log N)O(N log N)O(N²)
編碼器層數6 層7 層標準配置
參數數量13.0M14.7M可變
COMET 分數0.7990.8050.821
語義引導幾何旋轉簽名對齊注意力權重

🛠️ 技術深入

單位範數約束:強制 |z|=1,將所有資訊編碼於複數相位角度,而非幅度 • 相位旋轉機制:受 RoPE (Rotary Position Embedding) 啟發,使用 1D FFT 分解頻率並施加相位旋轉 • 波干涉學習:模型學習相關詞彙間的建構性干涉與無關詞彙間的破壞性干涉 • 單詞彙失效特性:單一詞彙輸入導致模型失效(類似雙縫實驗中單縫的行為),需至少 4 個詞彙以實現干涉效應 • 縮放與雜訊不變性:架構對輸入縮放和雜訊幅度具有不變性 • 靜態 RoSE 配置:靜態 PRISM 編碼器使用固定位置編碼,達到 0.799 COMET,證明被動波干涉的有效性[1]

🔮 前景展望AI analysis grounded in cited sources

相位編碼可能成為大規模語言模型的替代範式
PRISM 在參數效率上超越 FNet 且接近 Transformer 性能,暗示相位調制可能在更大規模模型中提供計算優勢
波干涉原理可推廣至多模態架構
PRISM 的同構性質與波力學相符,可能啟發視覺-語言模型中的新型特徵融合機制

時間線

2025-12
PRISM 論文發表於 arXiv (版本 v3),介紹相位旋轉干涉譜模型架構
2026-01
相關研究 Prism (認知負荷降低系統) 發表於 arXiv,展示 LLM 意圖澄清應用
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。