Qwen3.5-35B 在 VLLM A100 基準測試稱霸
在雙 A100 40GB GPU 上使用 VLLM 進行的基準測試顯示,Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer 最快,輸出 352 tok/s,總計 1357 tok/s。Qwen3-30B 變體落後,FP8 FlashAttn 最慢。測試涵蓋 FP8/AWQ 量化及 FlashAttn/FlashInfer 注意力機制。
Tag: #benchmark195 results
在雙 A100 40GB GPU 上使用 VLLM 進行的基準測試顯示,Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer 最快,輸出 352 tok/s,總計 1357 tok/s。Qwen3-30B 變體落後,FP8 FlashAttn 最慢。測試涵蓋 FP8/AWQ 量化及 FlashAttn/FlashInfer 注意力機制。
作者在AWS上基準測試開源LLM,用於安全研究與紅隊任務。Qwen2.5-Coder-32B-Instruct-abliterated以低拒絕率與腳本實用性勝出。模型擅長基礎任務,但在複雜漏洞發現上產生幻覺。

VeRO 推出可重現的代理優化評估框架,具備版本化代理快照、預算控制評估及結構化執行追蹤。它提供目標代理與任務的基準測試套件,並附參考評估程序。實證研究比較優化器配置,揭示提升代理效能的有效修改,並釋出 VeRO 以支持社群研究。

ConstraintBench 推出一個基準測試,用於評估 LLM 在 10 個營運研究領域中直接解決約束最佳化問題,無需求解器。對六個前沿模型在 200 個任務上的評估顯示,可行性是主要瓶頸,最佳模型僅達 65% 約束滿足率,但聯合最佳性低。基準測試與評估工具將公開發布。

PreScience 推出一個基準測試,讓 AI 透過四項任務預測科學進展:合作者預測、先前工作選擇、貢獻生成及影響預測。它使用 98K 篇 AI 論文資料集,涵蓋總計 502K 篇論文及元資料。先進 LLM 表現中等,生成的合成研究較缺乏多樣性。

Together AI 發布 CoderForge-Preview,這是用於訓練編碼代理的最大開放資料集。它包含 161K 個經過測試驗證的編碼代理軌跡,在 SWE-Bench Verified 上達到 59.4%。

使用者評測 100 多個 LLM 在 7 個 Python 工程推理類別上的表現,強調速度與效率。最愛模型包括 Grok 4.1 Fast、GPT OSS 120B 及本地 Qwen3 4B。完整結果見 py.eval.draftroad.com。

Kimi K2.5 在藥物領域 Placebo Bench 幻覺基準勝過 Opus 4.6。Opus 幻覺率最高,因虛構協議。資料集在 Hugging Face 上提供。
SourceBench 推出一個基準測試,用以評估大型語言模型(LLM)在各種意圖的 100 個真實世界查詢中引用的網路來源品質。它採用八項指標框架,評估內容相關性、事實準確性、客觀性、新鮮度、權威性和清晰度,並以人工標註資料集和校準的 LLM 評估器為後盾。此基準測試了八個 LLM、Google Search 和三個 AI 搜尋工具在 3996 個來源上的表現,揭示了 GenAI 和網路搜尋的關鍵洞見。
LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。