
Meta 開源可本地運行的視覺智能體模型
Meta 開源了一款可在本地運行的智能體模型,支援視覺理解與工具調用。這項發布有望為開發者提供更易部署的多模態智能體基礎,降低對託管服務的完全依賴。
Tag: #local-inference187 results

Meta 開源了一款可在本地運行的智能體模型,支援視覺理解與工具調用。這項發布有望為開發者提供更易部署的多模態智能體基礎,降低對託管服務的完全依賴。

全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。
一套搭載 DFlash2 的高度最佳化 Qwen3.8-27B 推論堆疊,在受限功耗的 RTX 3090 上達到約每秒 138 個 token,64 個請求的吞吐量則達到 942 TPS。前綴快取也將長對話後續回合的延遲,從約 23 秒降至 1.4 秒以下。

Alibaba 以 Apache 2.0 授權發布 Qwen3.8-27B,提供可下載權重,並具備多模態理解、程式設計、推理與代理工作流程能力。其 4-bit 版本約需 17GB 記憶體,第三方評測顯示其表現可媲美部分專有前沿模型。

一名 Reddit 使用者表示,Qwen3.8-27B Q6 已連續近 20 小時執行目標導向的代理式程式設計。模型在 RTX 3090 與 RTX 3060 的配置上,持續維持約每秒 60–63 個 tokens 的速度。

Unsloth 發布新的 Qwen3.8-27B GGUF 量化版本,宣稱在相同檔案大小下準確度提升 10%。此次更新也包含可保留 77% 準確度、並能在 8GB RAM 上執行的 1-bit 量化版本。

一名開發者表示,透過兩組 PLX PEX88096 交換器連接 16 張 RTX 5060 Ti 16GB,DeepSeek V4 Flash-0731 可達約每秒 130–150 個 token。該配置在 Tensor Parallelism 8 下支援最高 500,000 token context,在 Tensor Parallelism 4 下則可達 100 萬 token。

一名 Reddit 使用者表示,Qwen3.8-27B 僅憑登入憑證與大學名稱,就透過 80 次工具呼叫自主取得課表。另一項測試中,它下載並分析社群媒體影片、自行安裝 Whisper 進行轉錄,還強化影片畫面,全程無需人工介入。

一名社群開發者透過策略性移除 Qwen3.8-27B 的層,製作出約 22.7B 參數的 Qwen3.8-23B-Mini-Me,且推理能力沒有嚴重退化。據稱該模型適合程式設計、代理任務與多輪對話,但尚未進行基準測試,在邊界案例與資訊不完整的提示上較弱。

北京一間 AI 主題酒吧以約 1.5 美元的飲品提供不限量免費 DeepSeek 程式編碼 Token。店主表示,酒吧目前正在虧損,並使用兩台 Nvidia DGX Spark mini-PC 執行本地推論。