Search

Tag: #benchmarks166 results

Cursor 推出 Composer 2 編碼模型

Cursor 推出 Composer 2 編碼模型

Cursor 推出 Composer 2,自家編碼模型在基準測試中擊敗 Claude Opus 4.6,但落後 GPT-5.4。它比 Composer 1.5 便宜 86%,並提供更快的變體,專為 Cursor 中的長程代理編碼優化。模型具備 200k 令牌上下文,並針對工具使用和多檔案編輯進行調整。

VentureBeatMediaMar 19#coding-model#agentic-ai#benchmarks
MiniMax M2.7 在 OpenRouter 上線

MiniMax M2.7 在 OpenRouter 上線

MiniMax-M2.7 現已在 OpenRouter 上提供,具 204k 上下文,輸入 $0.30/M、輸出 $1.20/M 權杖。它擅長代理任務如除錯、金融建模及文件生成,透過多代理協作。基準:SWE-Pro 56.2%、Terminal Bench 2 57.0%、GDPval-AA 1495 ELO。

Reddit r/LocalLLaMACommunityMar 18#agentic-ai#api-pricing#benchmarks
🔬

跨模型潛在轉移加速代理

AVP 讓代理傳遞 KV-cache 潛在狀態而非文字,現支援跨模型轉移,基準測試顯示程式碼生成準確度提升及 2-6 倍加速。提供免費 T4 的 Colab 筆記本,使用 HuggingFace Transformers 於 GPU 測試。基於 LatentMAS,下一步支援 vLLM。

Reddit r/LocalLLaMACommunityMar 17#kv-cache#multi-agent#benchmarks
Qwen3-8B 微調基準測試稱霸 SLM

Qwen3-8B 微調基準測試稱霸 SLM

對 15 款小型語言模型在 9 項任務進行基準測試,找出最佳微調模型。Qwen3-8B 以最佳平均排名和一致性領先。LFM2-350M 在可調性增益上表現出色;Qwen3-4B 在 8/9 基準測試中勝過 120B 教師模型。

Reddit r/LocalLLaMACommunityMar 16#fine-tuning#benchmarks#slms
🔬

泰語嵌入模型 MTEB 排名

使用 A100 GPU 在泰國 LANTA 超級電腦上測試 14 種嵌入模型於 15 項泰語 MTEB 任務。Qwen3-Embedding-4B 以 74.41 分領先,KaLM-Gemma3-12B 以 73.92 分緊追。結果已合併至官方 MTEB 儲存庫,並提供互動排行榜。

Reddit r/LocalLLaMACommunityMar 16#embeddings#thai-language#benchmarks
Page 8 of 17