
Gemma 4 124B MoE 開放發佈傳聞
Reddit 上根據 Jeff Dean 刪除的推文猜測 Gemma 4 124B MoE 可能超越 Gemini 3 Flash-Lite。社群期待 Google 開放此更大模型變體。最近發佈後,更多驚喜預期。
Tag: #benchmarks166 results

Reddit 上根據 Jeff Dean 刪除的推文猜測 Gemma 4 124B MoE 可能超越 Gemini 3 Flash-Lite。社群期待 Google 開放此更大模型變體。最近發佈後,更多驚喜預期。

Reddit 用戶對 Qwen 3.6B 的 Q2 至 Q8 量化版本進行基準測試。本地 LLM 愛好者可查看結果。由 /u/PraxisOG 發佈於 r/LocalLLaMA。

傳統 AI 基準以人類對抗機器於孤立任務如西洋棋或編碼。此人機對比框架誘人卻有缺陷。亟需超越簡單比較的新評估方法。

Intel尚未發布的Core 300系列Wildcat Lake處理器,包括Core 3 310和Core 5 320,出現在CrossMark和Geekbench跑分中。它們單核性能追平高端Core Ultra 9,儘管定位超低價。這是首度公開其性能數據。
使用者測試顯示 Qwen3.5-27B (Q6_K_XL) 在開發任務匹敵 Nemotron-120B、Qwen3.5-122B 及 GPT-5.4。在 2x RTX 3090 上達 803pp/25tg,256k 上下文。可取代 API 訂閱用於日常編碼。
發文者強調 Qwen3.5 系列,特別是 27B 模型,在 Artificial Analysis 基準測試中知識密度超越 Minimax M2.7 與 Mistral Small 4 等對手。詢問 Qwen 團隊使用何種技巧(如 RL 擴展)使其尺寸/效能比優異。自 v3 起社群高度讚揚。
Mac Mini(32GB)執行 unsloth gpt-oss-20b-Q4_K_S.gguf 的效能基準,使用 OpenClaw 2026.3.8 及 LM Studio。初始提示後達 34 令牌/秒解碼速度及 0.7 秒首令牌時間,脈絡達 26k。
研究者檢視 VLMs 的影片基準如 VideoMME、MLVU、MVBench、LVBench。尋求缺失部分想法,特別是物理開放世界評估。在 r/MachineLearning 發文。

初步基準測試顯示 M5 Max 晶片在 16 吋 MacBook Pro 上表現更好。14 吋機型在高負載下會限制晶片效能,因熱管理限制。這影響高效能任務。