記憶體基準:Mem0 49%、Zep 340 倍 Token
基準顯示 Mem0 回憶率 49%(不如擲幣),token 低;Zep 63.8% 但 340 倍 token;Letta 83.2% 透過分頁。核心問題:代理無法有效遺忘,囤積或抹除記憶。呼籲主動策展模擬人類遺忘曲線。
Tag: #benchmark195 results
基準顯示 Mem0 回憶率 49%(不如擲幣),token 低;Zep 63.8% 但 340 倍 token;Letta 83.2% 透過分頁。核心問題:代理無法有效遺忘,囤積或抹除記憶。呼籲主動策展模擬人類遺忘曲線。

用戶提議新基準:HTML SVG 顯示馬坐在 F1 賽車內,因鵜鶘騎單車測試過度使用。分享 Gemini 3.1 Pro、DeepSeek Expert、GLM 5.1、MiniMax 2.7、Kimi K2.5、Claude Sonnet 4.6、Qwen 3.6 Plus 的輸出。

ArcDeck 是一個多代理框架,透過話語樹和全球承諾文件建模學術論文的邏輯流程,從論文生成投影片。專門代理迭代精煉大綱,然後渲染視覺效果。它推出 ArcBench 新基準,顯示改善敘事連貫性。

宇樹機器人刷新跑步速度紀錄。創辦人宣稱年内將超越博爾特速度。這標誌機器人敏捷性的躍進,在晨間科技新聞彙總中。

GLM 5.1 在自製社交推理基準(基於 Blood on the Clocktower 遊戲)中與頂級模型競爭。遊戲成本僅 $0.92,遠低於 Claude Opus 的 $3.69,且工具錯誤率為 0%。需更多比賽以確保可靠性。

Mac 專用 MiniMax M2.7 量化版在 200q MMLU 達 88% (63GB) 及 95% (89GB)。M5 Max 上高效 ~50 tokens/s 及 400pp。定位為「家用 Sonnet 4.5」水準。

使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。

使用輕量嵌入分類器 + 範例重排序(無 LLM)於 BANKING77 測試集達成 94.42% 準確率。嚴格全訓練協議,5 折 CV;模型 68 MiB,225ms 推論。排行榜第 2,超越基準 +0.59pp。

在 Intel Lunar Lake iGPU 上對 Qwen3.5-4B GGUF 量化版本進行詳細基準測試,比較 tk/s、KLD 散度、大小與效率。Unsloth 與 Bartowski 量化 KLD 低於 0.01 領先。有助邊緣硬體本地推理的最佳選擇。

Raspberry Pi 5 搭配官方 M.2 HAT+ 及 PCIe Gen3,將 SSD 速度加倍至 798 MB/秒,提升模型推論 1.5-2 倍。Gemma4 E2B-it Q8_0 提示處理達 41.76 t/s。使用 llama.cpp 基準測試多個 GGUF 模型標準設定。