
DeepSeek V4-Pro-0813 基準測試公開
r/LocalLLaMA 的 Reddit 貼文聚焦於 DeepSeek V4-Pro-0813 的基準測試。提供的內容未列出個別分數、測試方法或比較模型。
Tag: #benchmarks166 results

r/LocalLLaMA 的 Reddit 貼文聚焦於 DeepSeek V4-Pro-0813 的基準測試。提供的內容未列出個別分數、測試方法或比較模型。

最新的 PassMark 跑分顯示,Intel Core Ultra 7 270HX Plus 儘管核心數較少,但在效能上卻超越了更高階的 Ultra 9 275HX。效能提升歸功於晶片間互聯頻率的優化與更高的 P 核睿頻。

WeRide 再次刷新紀錄,連續六次奪得中國智駕大賽冠軍。此成就彰顯了該公司在自動駕駛技術領域的穩定領先地位。

文章探討百萬上下文後LLM競爭焦點。DeepSeek V4的分數被視為最不值一提的部分。暗示AI模型評估優先順序轉變。

AI 主宰科技新聞,每天有新模型與產品推出。ZDNET 分享他們評估最新 AI 發展的嚴格流程。此透明度有助於在快速變化的 AI 領域做出明智決策。

聯發科天璣 9600 Pro 的 Geekbench 跑分曝光,顯示雙超大核頻率接近 5GHz,早期 ES 樣片多核估分超過 12000 分。採用台積電 N2p 製程,具備 2xCanyon+3xGelas-b+3xGelas 架構、SME2 AI 支援、Arm Magni GPU,以及 LPDDR6+UFS 5.0。OPPO 和 vivo Pro Max 旗艦機型可能搭載滿血版。

SBTI 因其出色底層演算法而在社群刷屏。使用者表示測試不完,根本測不盡。

Reddit 討論推測頂級模型如 Opus 在推出數週後快速退化,可能因成本節省或運算壓力。使用者呼籲持續基準測試,指出供應商可能限制基準帳戶。marginlab.ai 和 aistupidlevel.info 等追蹤器監測變化。

初步測試比較 Gemma 4 與 Qwen 3.5 在前端生成與基準,Gemma 進步但 Qwen 在精緻度、一致性、程式碼與推理更優。Gemma 在多語言與視覺任務出色,但較大尺寸影響可及性。

Reddit 貼文討論 Gemma 4 與 Qwen3.5 在共享基準上的表現。來自 r/LocalLLaMA 社群。提供連結與評論。