
Gemma 4 31B 推測解碼平均加速 29%
使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。
Tag: #benchmark195 results

使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。

影片生成模型 HappyHorse-1.0 在 Artificial Analysis 的 AI Video Arena 排行榜奪冠。Elo 分數達 1383。開發者和技術細節尚未公開。

PaperOrchestra 是一個多代理框架,能將非結構化研究材料轉換成提交就緒的 LaTeX 稿件,包括文獻綜述與圖表視覺化。它推出 PaperWritingBench,這是首個從 200 篇頂級 AI 會議論文逆向工程的基準測試。人類評估顯示其文獻綜述品質勝出基線 50-68%,整體品質勝出 14-38%。

推出 Flourishing AI Benchmark: Christian Single-Turn (FAI-C-ST),用以評估 LLM 在基督教人類繁榮的七個維度表現。測試 20 個前沿模型顯示,相較基督教標準平均下降 17 分,在信仰與靈性維度更達 31 分。AI 預設採程序世俗主義,缺乏神學一致性。

國產 AI 模型在預測未來能力上碾壓馬斯克的 Grok-4,登頂全球排行榜。馬斯克曾表示,預測未來是測試模型智能的最佳方式。這是國產 AI 的重大成就。

Gemma 4 31B 在 FoodTruck Bench 取得第三名,超越 GLM 5、Qwen 3.5 397B 及所有 Claude Sonnets。它擅長長時程任務,並遵循自身規劃建議。發文者興奮但澄清非基準作者。

SuperCLUE 發布 2026 年 3 月中文原生圖像編輯測評榜單,涵蓋 19 個主流模型。OpenAI 的 GPT-Image-1.5 以 87.03 分穩居全球第一。騰訊 Hunyuan-Image-3.0-Instruct 以 83.00 分拿下中國第一,後有字節、阿里等模型緊隨。
PhAIL 是一個開放基準測試,用於在真實硬體上評估視覺-語言-動作 (VLA) 模型進行 bin-to-bin 訂單揀選。頂尖模型如 OpenPI 和 GR00T 分別達到 65 和 60 UPH,相比遙控操作的 330 UPH 和人類手的 1,331 UPH,平均故障間隔 (MTBF) 約 4 分鐘。所有數據、影片和提交工具均公開於 phail.ai。

SciVisAgentBench 推出全面基準,用於評估 LLM 驅動的科學資料分析與視覺化代理,涵蓋 108 個專家設計案例。它具備四維度結構化分類,並採用多模態評估流程,結合 LLM 評判與確定性指標。此基準建立基線並揭示 SciVis 與程式碼代理的能力差距。