Search

Tag: #benchmarks166 results

以人機團隊重新思考 AI 評估

以人機團隊重新思考 AI 評估

這篇 arXiv 立場論文指出,聚焦於自主超人表現的 AI 評估,實際上默默將取代人類視為目標。論文主張改以人機團隊的整體表現進行評估,以建立能補足人類能力並帶來更佳社會成果的系統。

ArXiv AIResearch5d ago#benchmarks
Corti 向醫療新創開放 Symphony 模型

Corti 向醫療新創開放 Symphony 模型

Corti 推出無股權加速器,針對醫療與生命科學新創,提供其 Symphony 臨床 AI 模型堆疊存取權。Symphony 在 HealthBench Professional 基準測試中超越 OpenAI。此計劃向全球創辦人提供信用額度與監管支援,正值歐洲監管成本上升之際。

The Next Web (TNW)MediaMay 13#healthcare-ai#accelerator#benchmarks
醫療保健 AI 可靠性基準測試

醫療保健 AI 可靠性基準測試

新 arXiv 論文指出,現有 AI 基準測試無法衡量醫療保健真實工作流程中的可靠性、安全性及臨床相關性。先進模型在考試中表現出色,但在文件記錄(0.74-0.85)、臨床決策支援(0.61-0.76)及行政任務(0.53-0.63)上得分低落。呼籲建立原則性框架,以彌補效能與實用性差距。

ArXiv AIResearchMay 13#healthcare-ai#benchmarks#agentic-ai
四月LLM跑分暴漲,卻失人味

四月LLM跑分暴漲,卻失人味

Anthropic的Opus 4.7、OpenAI的GPT 5.5及DeepSeek的V4在推理與程式碼基準稱霸,但回應機械、過度圓滑。RLHF對齊優先安全而犧牲R1與Opus 4.6的人格、猶豫與魅力語言,造就「語言恐怖谷」,阻礙病毒傳播。

虎嗅MediaApr 28#rlhf#alignment#human-likeness
⚙️

推測解碼儲存庫上線

新 GitHub 儲存庫從頭實作推測解碼方法:EAGLE-3、Medusa-1、PARD、草稿模型、n-gram、尾綴解碼。針對 Qwen2.5-7B-Instruct 提供共享訓練/推論,基準測試澄清提案者品質對驗證者成本及吞吐量細微差異。定位為演算法-系統教育資源。

Reddit r/MachineLearningCommunityApr 26#speculative-decoding#inference#benchmarks
Page 4 of 17