利用語義壓縮突破上下文視窗限制
本提案提出了一種受擴散模型啟發的方法,透過將語義壓縮作為漸進式渲染工具來處理超長 AI 對話。藉由將文本壓縮為從粗略到精細的片段,模型能夠在超出原生上下文視窗的情況下保持對話連貫性。
Tag: #long-context86 results
本提案提出了一種受擴散模型啟發的方法,透過將語義壓縮作為漸進式渲染工具來處理超長 AI 對話。藉由將文本壓縮為從粗略到精細的片段,模型能夠在超出原生上下文視窗的情況下保持對話連貫性。
海光資訊完成深算3號DCU與騰訊混元Hy3預覽大模型的深度適配。該295B參數模型支援256K超長上下文,在複雜推理、Agent及程式碼生成方面表現優異。

使用者展示 Qwen3.5-35B 透過提示及 qwen-code CLI 從研究論文建立完整網頁應用。分享 GitHub 儲存庫包含 research-webapp-skill 範例。模型在 70-80k 脈絡保持優於 Gemma4 26B,可於 16GB RTX 5080 執行。

使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。
r/MachineLearning 分享 TriAttention 論文,為長上下文推理提供高效 KV 快取壓縮方法。針對 LLM 改進。連結完整論文與討論。
全新 GGUF 量化版本,合併 Qwen3.5-27B 在 Claude Opus 資料集微調,無審查並修復 attn_v/ffn_gate_exps 層。達 96.91% HumanEval、KL 減 75%、持 262K 上下文。推薦 Q4_K_M 以獲穩固效能。

AICon 深圳場次聚焦於多模態推理的高效長上下文建模。現有文章摘要未提供具體模型架構、基準測試或實作細節。
一份 Reddit 研究報告聲稱,長篇且主題連貫的良性前綴,可能大幅改變 google/gemma-3-1b-it 的內部啟動狀態,並在沒有明確越獄指令的情況下削弱其 RLHF 拒答行為。作者表示,隨機打亂文字的消融測試產生了不同結果,顯示語義連貫性可能是關鍵,但仍需獨立驗證。
一篇社群分析認為,Gemma 4 QAT 若以現代 q4_k 格式為目標,而非 q4_0,可能保留更多模型品質。作者表示,QAT 雖能降低記憶體使用量,但在程式設計、創意寫作、長上下文回憶與知識任務上,可能不如高精度的 Q4_K 變體。
Monodratic 是一種稀疏因果注意力架構,利用學習式乘積雜湊路由選取遠端來源區塊,同時保留保證的區域注意力。在合成聯想回憶任務中,使用兩個遠端區塊時平均準確率達 99.35%,CPU 測試的擬合伸縮指數約為 0.993,接近線性。