
100+ LLM 在 Python 工程推理上評測
使用者評測 100 多個 LLM 在 7 個 Python 工程推理類別上的表現,強調速度與效率。最愛模型包括 Grok 4.1 Fast、GPT OSS 120B 及本地 Qwen3 4B。完整結果見 py.eval.draftroad.com。
Tag: #local-inference188 results

使用者評測 100 多個 LLM 在 7 個 Python 工程推理類別上的表現,強調速度與效率。最愛模型包括 Grok 4.1 Fast、GPT OSS 120B 及本地 Qwen3 4B。完整結果見 py.eval.draftroad.com。

Distil Labs 推出 VoiceTeller 銀行語音助理,用微調 Qwen3-0.6B 取代雲端 LLM,工具呼叫準確率達 90.9%,勝過 120B 教師模型的 87.5%。腦部階段延遲降至 40ms,整體管線約 315ms,在 Apple Silicon 上本地運行。開源程式碼、訓練資料與 GGUF 模型。

GGML 和 llama.cpp,這兩個本地 AI 推理的關鍵工具,正式加入 Hugging Face。此整合旨在確保它們的長期開發與維護。Hugging Face 將提供資源推動本地 AI 進展。
一個由社群維護的 Jinja 聊天模板,修正官方模板在 Qwen 3.5、3.6 與 3.8 中出現的推理、對話歷史、工具呼叫與代理迴圈問題。它加入推理強度控制、恢復關閉思考功能,並支援多種本機推理執行環境。

這個微調版 Qwen2.5-Coder-1.5B 模型可將自然語言需求轉換為 Shell 指令,並能在本機以每次查詢約 0.59 秒的速度運行。Q4_K_M 版本大小為 941MB,在 InterCode-ALFA 上 đạt 0.620 分,並包含靜態安全檢查器。

根據 Reddit 的 r/LocalLLaMA 貼文,Qwen3.8-2.4T-A95B 據報已正式發布。文章未提供模型規格、存取方式或評測結果。
academi_slide 是一款開源工具,使用本地 LLM 將研究論文與文件轉換成簡報和摘要。它能擷取章節、表格、圖表、指標與引用,並支援 Ollama、llama.cpp、雲端模型及多語言工作流程。

Moonshot 似乎正準備或已推出 Kimi K3 開放權重模型,讓中國主要 AI 模型家族之一更容易被外界取得。這項消息源自社群媒體討論與 Wired 報導,目前官方發布細節仍然有限。

一名 Reddit 使用者詢問 Mach-1 Additive 是否能以約十分之一的規模,達到 Qwen 3.6 35B 95% 的效能。貼文將此結果描述為可能具重大意義的效率提升,但未提供基準測試方法或驗證資料。
llama.cpp 的一個 Pull Request 將多 Token 預測(MTP)使用者的取樣工作從 CPU 移至 GPU。貢獻者表示,搭配 Qwen3.6-35B 時,RTX 5090 約提升 8%,Tesla P40 約提升 4%,且接受率維持不變。