Search

Tag: #benchmarks166 results

ByteShape Qwen 3.5 9B 量化指南

ByteShape Qwen 3.5 9B 量化指南

ByteShape 發布 Qwen 3.5 9B 量化版本,並跨 5090/4080 等 GPU 及 CPU 基準測試。GPU 關鍵選擇:5.10 bpw 基準、4.43 bpw 平衡、3.60 bpw 快速。部落格提供互動圖表供硬體特定選擇;首波 Qwen 發布,後續更多。

Reddit r/LocalLLaMACommunityMar 31#quantization#benchmarks#qwen
艱難 CoT 解釋任務釋出

艱難 CoT 解釋任務釋出

研究人員推出九個目標導向的思考鏈解釋任務,黑盒 LLM 監控在 OOD 表現不佳。他們開源資料集,包含同分布與 OOD 評估,對探針、TF-IDF 及 LLM 監控進行基準測試,非 LLM 方法在 OOD 表現更優。此測試平台用於基準社區進展,超越單純閱讀 CoT。

AI Alignment ForumCommunityMar 26#interpretability#mechinterp#ai-safety
Fin Apex 1.0 在客服解析勝過 GPT-5.4

Fin Apex 1.0 在客服解析勝過 GPT-5.4

Intercom 推出 Fin Apex 1.0,這款小型後訓練 AI 模型在客服解析率上勝過 GPT-5.4(73.1% 對 71.1%)及 Claude 模型。它提供更快的 3.7 秒回應、幻覺減少 65%,且成本僅五分之一。此模型擁有數億參數,基於開源權重,驅動 Intercom 的 Fin AI 代理。

Page 7 of 17