RTX 5070 Ti 上 Qwen3.6-35B 以 --n-cpu-moe 達 79 t/s
基準測試顯示 --n-cpu-moe 20 旗標在 16GB GPU 上將 Qwen3.6-35B-A3B 速度提升 54%,優化 MoE 層 VRAM 使用。在消費級硬體上達 79 t/s 生成與 128K 上下文。提供完整 llama.cpp 指令與 VRAM 調校指南。
直接匹配不多,已補上最新動態。
Tag: #moe-optimization3 results
基準測試顯示 --n-cpu-moe 20 旗標在 16GB GPU 上將 Qwen3.6-35B-A3B 速度提升 54%,優化 MoE 層 VRAM 使用。在消費級硬體上達 79 t/s 生成與 128K 上下文。提供完整 llama.cpp 指令與 VRAM 調校指南。
經 36 項 autoresearch 實驗,將 Qwen3.5-397B 在 M5 Max 128GB 上推至 20.34 tok/s 解碼,透過 flash-moe 最佳化。關鍵提升來自 IO 執行緒、專家預測及 Q3-GGUF 量化,儘管 209GB 模型從 SSD 串流。建基於 Dan Woods 及 Anemll 工作,新增 Metal 層級調整。

Atlas 是純 Rust LLM 推論引擎,針對 GB10 的 SM121 架構自訂 CUDA 核心,在 Qwen3.5-35B-A3B 上達 102 安定 tok/s,比 vLLM 快 2.3 倍。具 2 分鐘冷啟動、僅 2GB 映像,並在 Qwen3-Next-80B-A3B 上達 82 tok/s。解決 DGX Spark 的軟體問題,實現桌面 petaflop 運算。

Eon 使用漏積分放電(LIF)模型,將果蠅大腦重建為數位系統。中國團隊據稱進一步採用精細神經元建模,以及支援跨身體遷移的平台,推進具身智慧研究。

據報導,UBTECH 已在 WRC 內以 1:1 比例重建客戶產線。此舉為具身智慧提供更實際的驗證與部署路徑,強調產線效能與系統整合,而非機器人出貨量。

Outer Biosciences 脫離隱身模式,開發出一套能讓手術切除的人類皮膚存活最長一個月的方法。該新創將組織產生的資料輸入 AI 模型,以預測可能有用的化合物,目前已籌得約 2,300 萬美元。

中國汽車製造商表示,受 AI 資料中心需求推動,印刷電路板與多層陶瓷電容器在全球短缺 20% 至 30%,價格已超過去年的三倍。汽車記憶體價格也在短短三個月內上漲約 180%。

Truffle Security 發現 768 組外洩的 AWS 金鑰,可對企業帳戶提供廣泛控制權,其中包括 526 組根金鑰。在受測憑證中,仍有 88% 處於啟用狀態;而 AWS 的隔離政策仍允許許多具破壞性的操作。

GDS Holdings 顯示,AI 相關資料中心訂單的增長速度快於已確認收入。這項趨勢反映需求強勁,但基礎設施擴建週期也使獲利延後。

TikTok 與 ByteDance 同意支付 4 億美元,和解美國司法部提起的案件;該案指控數百萬名未滿 13 歲兒童使用平台,且其資料在未獲家長同意下遭到蒐集。愛爾蘭監管機構也曾在 2023 年因兒童帳戶問題對 TikTok 罰款 3.45 億歐元。