
Gemini 再次稱霸基準測試
Google 的 Gemini 模型再次在 AI 基準測試中名列前茅,鞏固其領導地位。本新聞通訊強調 10 倍更快的模型以提升效能。它也討論 AI 領域日益增長的諮詢機會。
Tag: #benchmarks166 results

Google 的 Gemini 模型再次在 AI 基準測試中名列前茅,鞏固其領導地位。本新聞通訊強調 10 倍更快的模型以提升效能。它也討論 AI 領域日益增長的諮詢機會。

這篇 arXiv 立場論文指出,聚焦於自主超人表現的 AI 評估,實際上默默將取代人類視為目標。論文主張改以人機團隊的整體表現進行評估,以建立能補足人類能力並帶來更佳社會成果的系統。

NVIDIA 的 Blackwell 平台在最新的 MLPerf Training v6.0 基準測試中取得全面勝利。該平台展現了業界領先的規模與效能,在所有測試中均實現了最快的訓練時間與最高的單加速器效率。

Corti 推出無股權加速器,針對醫療與生命科學新創,提供其 Symphony 臨床 AI 模型堆疊存取權。Symphony 在 HealthBench Professional 基準測試中超越 OpenAI。此計劃向全球創辦人提供信用額度與監管支援,正值歐洲監管成本上升之際。

新 arXiv 論文指出,現有 AI 基準測試無法衡量醫療保健真實工作流程中的可靠性、安全性及臨床相關性。先進模型在考試中表現出色,但在文件記錄(0.74-0.85)、臨床決策支援(0.61-0.76)及行政任務(0.53-0.63)上得分低落。呼籲建立原則性框架,以彌補效能與實用性差距。

Perceptron 推出旗艦影片分析推理模型 Mk1,比 Anthropic 的 Claude Sonnet 4.5、OpenAI 的 GPT-5 及 Google 的 Gemini 3.1 Pro 便宜 80-90%。定價為每百萬輸入 token 0.15 美元、輸出 1.50 美元,在 EmbSpatialBench (85.1) 和 VSI-Bench (88.5) 等空間與影片基準測試中表現出色。提供公開演示網站供測試。

Anthropic的Opus 4.7、OpenAI的GPT 5.5及DeepSeek的V4在推理與程式碼基準稱霸,但回應機械、過度圓滑。RLHF對齊優先安全而犧牲R1與Opus 4.6的人格、猶豫與魅力語言,造就「語言恐怖谷」,阻礙病毒傳播。

GPT-5.5 Pro推理達人類前0.1%,知識盲區卻86%給錯答案,Claude Opus 4.7僅36%。智商競爭邊際遞減,轉向可控成本可靠運行。

根據 Artificial Analysis,DeepSeek 的 V4 Pro 在頂級開源模型中排名第二,僅次於 Moonshot AI 的 Kimi K2.6。它顯示明顯進步,但落後國內與美國對手。此模型難以複製早期 R1 的成功。