
RAG 對於提升本地 LLM 技術問答準確度至關重要
開發者實驗顯示,本地 LLM 若無 RAG 支援,在回答技術問題時表現不佳,但結合知識庫後效果顯著。該研究測試了包括 Apple Intelligence 和 Qwen 在內的多種模型,證實了上下文注入的有效性。
Tag: #benchmarking171 results

開發者實驗顯示,本地 LLM 若無 RAG 支援,在回答技術問題時表現不佳,但結合知識庫後效果顯著。該研究測試了包括 Apple Intelligence 和 Qwen 在內的多種模型,證實了上下文注入的有效性。

MedCalc-Pro 是一個包含 2,268 個臨床案例與 77 種醫療計算器的全新基準測試,旨在解決現有 LLM 醫療評估的侷限性。該研究同時提出了一種專用代理框架,能處理多工具選擇與嵌套計算,並有效抑制參數誤差傳播。
對中國國產GPU廠商(礪算、摩爾線程)與行業領導者Nvidia進行實機性能對比。測試評估了國產晶片處理如《Cyberpunk 2077》等高負載任務的能力。
REAP 是一個全新的框架,透過從互動式生產環境的使用數據中提取資訊,自動化建構編碼代理(Coding Agent)的基準測試。此研究旨在縮小合成基準測試與真實軟體工程任務之間的差距。
OpenAI 推出了 GeneBench-Pro,這是一項專門的基準測試,旨在評估 AI 模型在基因組學、生物學和科學研究方面的表現。它利用複雜的真實世界數據集來衡量在這些高風險領域的能力。

這個最初源自 UC Berkeley 研究計畫的群眾外包 AI 排行榜,在推出首款商業產品僅八個月後,年化營收已達到 1 億美元。

NormAct 是一項新的基準測試,旨在評估多模態大型語言模型 (MLLM) 在具身規劃中如何處理隱性社會規範。研究顯示,儘管模型能很好地達成明確目標,但在沒有特定干預的情況下,難以將隱性社會約束落地並應用。

OpenFinGym 是一個全新的統一環境,旨在評估跨多階段量化金融工作流程的 AI 代理。它提供了一個容器化且可驗證的平台,支援從預測到即時交易等多種任務。

MKG-RAG-Bench 是一個全新的跨領域基準測試,旨在評估多模態知識圖譜增強生成(MKG-RAG)中的檢索效能。它透過提供經過策劃的數據集來測試檢索與下游生成品質,解決了異質數據對齊這一關鍵瓶頸。

這篇研究論文分析了當前多模態 LLM 基準測試的局限性,這些測試往往無法評估跨模態整合能力。研究強調了在時空一致性和物理世界理解等領域建立更好評估指標的必要性。