本地 LLM 網路研究設定揭露
使用者分享使用 Qwen3.5:27B-Q3_K_M 在 RTX 4090 上進行高速本地網路刮取及研究,40 tk/s 及 200k 上下文。透過 llama.cpp Web UI 啟用 MCP 工具,包括 webmcp 並行擷取 URL、清理 HTML 及轉 Markdown。程式碼詳述 async Playwright 瀏覽器、DDGS 搜尋及 readability 提取。
Tag: #local-llm172 results
使用者分享使用 Qwen3.5:27B-Q3_K_M 在 RTX 4090 上進行高速本地網路刮取及研究,40 tk/s 及 200k 上下文。透過 llama.cpp Web UI 啟用 MCP 工具,包括 webmcp 並行擷取 URL、清理 HTML 及轉 Markdown。程式碼詳述 async Playwright 瀏覽器、DDGS 搜尋及 readability 提取。
Ace Step 團隊在上週發布公告後忘記上傳模型,現已推出 1.5 XL 模型。變體包括 Turbo、Base 和 SFT。現在可供本地使用。

Reddit 貼文展示 Gemma 4 在 Android Studio 的本地推論整合。由 /u/jacek2023 發佈,含連結與評論。強調新模型系列的行動部署。
Reddit 用戶讚揚 Qwen3.5-27B 優於 Gemini 3.1 Pro 和 GPT-5.3 Codex,因為它在面對檔案權限錯誤時拒絕產生危險腳本。像 Claude 和 Copilot 等專有模型會失控寫 Perl 或 NodeJS 駭客程式。用戶希望有更多謹慎的本地模型用於可靠開發。

r/LocalLLaMA 的 Reddit 貼文分享下載 Anthropic claude-code 套件 2.1.88 版的簡單 npm 指令。以「一開始 vs 現在」的迷因格式強調本地 AI 工具進展。使用者可輕鬆打包特定檔案。

使用者示範 Qwen3.5-27B 在 RTX 4090 上透過 llama.cpp 作為 OpenCode 程式碼代理的主要模型,實現良好工具呼叫及程式碼任務。設定使用 4-bit 量化、64K 上下文,生成約 40 tok/s。部落格詳述完整工作流程,包括代理技能及 Context7 整合。
擁有 RTX 5080/5090 計畫及 AMD 9950X3D 的使用者徵詢 RAM 升級建議:廉價新增 2x32GB DDR5 6000(總 4x32GB)或購買較貴的 2x64GB 5600MT/s 40CL。擔心 4-DIMM 配置對模型卸載至 RAM 及遊戲的潛在減速。
開發者打造 Python + PostgreSQL 系統,利用 LLM 從查詢生成 SQL、擷取資料並進行計算處理結果。面臨複雜多參數查詢需進階推理時準確度難維持的挑戰。尋求免費/開源 LLM 以匹敵 Gemini 能力。

使用者放棄快速但易崩潰的 Qwen3 Coder Next,改用較慢但穩定的 Qwen3.5 122B,儘管 token 速度減半,卻完成兩倍任務數。穩定性、更少重試及更好程式碼品質帶來代理工作流程的實際提升。建議有足夠硬體時用大型模型處理複雜編碼。

GLM 5.1 已發布,由 Reddit r/LocalLLaMA 子版塊宣布。貼文由 /u/Namra_7 提交,包含連結至詳細資訊與評論。