Search

直接匹配不多,已補上最新動態。

Tag: #source-quality1 results

SourceBench:AI 是否引用優質網路來源?

SourceBench:AI 是否引用優質網路來源?

SourceBench 推出一個基準測試,用以評估大型語言模型(LLM)在各種意圖的 100 個真實世界查詢中引用的網路來源品質。它採用八項指標框架,評估內容相關性、事實準確性、客觀性、新鮮度、權威性和清晰度,並以人工標註資料集和校準的 LLM 評估器為後盾。此基準測試了八個 LLM、Google Search 和三個 AI 搜尋工具在 3996 個來源上的表現,揭示了 GenAI 和網路搜尋的關鍵洞見。

Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。