
Gemini、ChatGPT、Claude 影片分析測試勝者
測試 Gemini、ChatGPT 及 Claude 在 YouTube 影片與本地檔案的分析能力。探討 AI 是否真正理解影片或僅模擬之。公布最佳表現者。
Tag: #llm-benchmark24 results

測試 Gemini、ChatGPT 及 Claude 在 YouTube 影片與本地檔案的分析能力。探討 AI 是否真正理解影片或僅模擬之。公布最佳表現者。

測試 8 款 LLM 作為代理桌上遊戲 GM;27B 模型在敘事品質勝過 405B,儘管工具呼叫具挑戰。小模型如 Mistral Small 3.1 在低階硬體上 4-5 次工具呼叫後失效。本地可靠使用門檻為 70B+ 於 64GB RAM。

一項分析顯示 Google 的 AI Overviews 功能錯誤率達 10%。這引發了 90% 準確率是否足以應對 AI 驅動搜尋結果的疑問。
arXiv 創始人親測 LLM 生成「水論文」(填充內容)。Grok 在配合度和品質最強。Claude 最不配合。