Search

直接匹配不多,已補上最新動態。

Tag: #llm-eval2 results

🤖

政治基準測試揭露 LLM 拒答偏見

新開源基準使用 98 題跨 14 政策領域,將 LLM 映射至 2D 政治羅盤,將拒答計為保守立場。GPT-5.3 有選擇退出時 100% 拒答,轉為右威權;Claude 象限翻轉;KIMI K2 維持左自由主義,儘管台灣題被阻。揭示沉默即政治立場。

Reddit r/MachineLearningCommunityApr 16#benchmark#political-bias#llm-eval
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。