
中國 AI 模型 API 調用量超越美國
中國 AI 模型在 OpenRouter 的 API 調用量已連續六週超越美國模型。DeepSeek-V4-Flash 處於領先地位,而 MiniMax M3 也成功躋身全球前三名。
Tag: #llm-benchmarks36 results

中國 AI 模型在 OpenRouter 的 API 調用量已連續六週超越美國模型。DeepSeek-V4-Flash 處於領先地位,而 MiniMax M3 也成功躋身全球前三名。

DeepSeek 已躍居全球 API 調用榜首,標誌著大型語言模型競爭格局的重大轉變。這一里程碑凸顯了開發者社群對高效能 AI 模型的採用率正持續攀升。

Together AI 發布了針對編碼代理的全新基準測試,顯示其在效能上顯著優於 TensorRT-LLM 與 Claude Opus。測試結果強調了在大規模推理中,吞吐量、首字延遲與成本效益的顯著提升。

陳天橋的 MiroMind AI 精準預測15天後黃金價格。在慢互動驗證中超越 Gemini-3.1-Pro 和 GPT-5.4-Thinking。強調預測準確性而非速度。

PyPDDLEngine 是一個開源 PDDL 模擬引擎,讓 LLM 透過工具呼叫進行互動式規劃。它支援逐步動作選擇、狀態觀察與重置。在 IPC Blocksworld 上,代理式 LLM 規劃成功率 66.7%,略勝直接提示的 63.7%,但落後傳統規劃器 85.3%。

這篇立場論文主張,AI 推理應被操作性地定義為一種以有效且健全推論為基礎、可學習的規則式流程。論文提出基於文獻整合的框架與檢核清單,讓推理評估更加嚴謹且可驗證。
一家名為 Z.ai 的中國 AI 公司在矽谷工程師中受到關注,其模型性能接近美國頂尖模型,但成本卻大幅降低。這顯示了國際替代方案在 LLM 市場中帶來的競爭壓力日益增加。

Elon Musk 公開預測 Zhipu AI 的 GLM 模型將在明年第一季追平 Fable。Zhipu AI 的唐傑對此回應,表示達成該目標的時間將比 Musk 預期的更短。
社群報告指出 GLM-5.2 (max) 在所有開源與閉源模型中表現位居第三。這標誌著 GLM 架構在競爭激烈的基準測試中達到了重要里程碑。

本文介紹了協助 Gemini 在國際數學奧林匹亞(IMO)競賽中取得金牌的關鍵研究人員。文章探討了高階數學推理能力與創意天賦在 AI 模型開發中的跨界結合。