
Kimi K3 疑似以匿名模型 Kivine 身份現身 LMArena
一個名為「Kivine」的神祕模型現身 LMArena,其強大的長上下文處理能力與外界對 Moonshot AI 下一代模型 Kimi K3 的預期高度吻合。後台洩漏資訊與性能表現顯示該模型即將正式發布。
Tag: #llm-benchmark24 results

一個名為「Kivine」的神祕模型現身 LMArena,其強大的長上下文處理能力與外界對 Moonshot AI 下一代模型 Kimi K3 的預期高度吻合。後台洩漏資訊與性能表現顯示該模型即將正式發布。

Moonshot 推出的 2.8 兆參數 Kimi K3 模型,在效能上展現出與 GPT-4o 和 Claude 3.5 Sonnet 競爭的實力。值得注意的是,它維持開放權重架構,為開發者提供了一個強大的替代選擇。

OpenAI 突然發布了 GPT-5.6 系列模型,一次性推出了三款新模型。此舉直接挑戰了 Fable5 在當前 AI 領域的領先地位。
字節跳動發布了 Doubao 2.1,具備增強的 Agent 能力,能在 18 小時內完成複雜的晶片設計程式碼。該模型的程式設計效能目前已可媲美 OpenAI 的 Opus 4.7。
阿里巴巴最新旗艦模型 Qwen3.7-Max 在 ArtificialAnalysis 榜單中獲得 56.6 分,成為中國國產模型第一,全球排名第五。該模型即將透過阿里雲百煉平台提供 API 服務。

阿里 Qwen3.6-Plus 發佈一天內於 OpenRouter 達 1.4 萬億詞元,打破單模型日紀錄。在程式基準中國第一、全球第二。免費預覽上線,為近期最強模型。

YC-Bench 基準測試模擬 LLM 經營一年初創公司,包含延遲回饋與惡意客戶。GLM-5 平均資金達 121 萬美元,接近 Claude Opus 的 127 萬美元,但 API 成本僅 1/11。持續筆記本使用預測成功。

針對 Kimi K3 模型與 Claude Opus 4.8 在 WebGL 與 GSAP 動畫等複雜前端開發任務上的對比測試。
Anthropic 的 claude-fable-5 在最新一期 Arena 週榜中穩居榜首,美國模型持續壟斷前十名。中國模型如 Qwen3.7-max-preview 表現穩定,並在前 30 名中佔據重要席位。

Anthropic 已正式發布 Claude Fable 5,早期測試報告顯示其性能有顯著提升。該模型在首批用戶中獲得了極高的評價。