Qwen 3.8 27B 在超低量化下仍表現亮眼
一名 Reddit 使用者表示,Qwen 3.8 27B 即使採用 Q3_xxs 量化,仍保有很強的能力,能一次完成多項嚴肅的程式設計任務。據稱它在 RTX 4060 Ti 16GB 上完整載入 VRAM 時可達每秒 30–35 個 token,但在基本計數、排序與日常對話中偶爾表現較弱。
Tag: #local-llm172 results
一名 Reddit 使用者表示,Qwen 3.8 27B 即使採用 Q3_xxs 量化,仍保有很強的能力,能一次完成多項嚴肅的程式設計任務。據稱它在 RTX 4060 Ti 16GB 上完整載入 VRAM 時可達每秒 30–35 個 token,但在基本計數、排序與日常對話中偶爾表現較弱。
Claude Pro 訂閱到期後,一名 Reddit 使用者改用搭載 24GB RTX 5090M 的系統,在 Pi 上運行 Qwen3.8-27B 執行編碼任務。使用者表示,在一個專案中其開發速度與 Claude Sonnet 5 相近,但 Claude 的科學結果更佳。
Ornith AI 發布三款新的 Ornith 1.5 模型變體:9B、35B-A3B 與 397B。Hugging Face 已提供原始模型格式及 GGUF 版本的下載頁面。

PrismML 發布了 Bonsai 27B,這是 Qwen3.6 的三元量化版本,僅需 10GB 記憶體即可達到接近 fp16 的精度。此突破使高效能的 27B 模型能在消費級硬體上運行。
OpenClaw 已成為 GitHub 上最受歡迎的開源專案,提供了一個本地優先、可自託管的自主 AI Agent 平台。近期更新深度整合了飛書,為企業用戶實現了自動化工作流程。
 机制在需要时“重启”进程继续训练 。</p><p>报道进一步称,这一过程完全没有写入 NAND 闪存,而是把数据和状态都保留在 RAM 中,从而显著提升速度 。在绕开软件限制后,M4 在 iPad 或 Mac 上可达到约 15.8TFLOPS 的 AI 处理性能,足以进行模型训练,而无需依赖昂贵的独立电脑或高端 NVIDIA GPU 。</p><p><img src="https://static.cnbetacdn.com/article/2026/0616/9d8ceec3c3fd536.jpg)
開發者繞過了 Apple M4 晶片神經引擎的軟體限制,解鎖了 15.8 TFLOPS 的 AI 算力。該實現方案使用自定義的 Model Intermediate Language (MIL) 直接與硬體進行通信。

DeepMind 發布了 DiffusionGemma,這是一款採用圖像風格擴散模型進行文字生成的開源權重模型。該模型能並行生成文字而非逐個 token 生成,並具備即時錯誤修正與極高的推論速度。

Google 發布了 Gemma 4 12B 多模態模型,旨在於消費級硬體上本地運行。該模型在僅需 16GB 記憶體的條件下,提供了媲美 26B 版本的效能。

Liquid AI 發布了 LFM2.5-8B-A1B,這是一款升級後的邊緣運算模型,具備 128K 上下文視窗與 38T token 預訓練。該模型專為處理複雜任務與工具調用而設計,且能在入門級筆電上高效運行。