🦙較早收集於 52m

本地 Qwen 8B + 4B 逐步重規劃完成瀏覽器自動化

本地 Qwen 8B + 4B 逐步重規劃完成瀏覽器自動化
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#browser-automation#stepwise-planning#dom-snapshots#local-agentsqwen-8b-+-4bqwen-8bqwen-4b

💡用微型本地 LLM 解鎖瀏覽器自動化:15K 令牌,處理模態框,勝過視覺法(50K+)。

⚡ 30-Second TL;DR

有什麼變化

從當前 DOM 逐步重規劃優於陌生網站上的預先多步驟計劃

為什麼重要

使小型本地 LLM 能可靠運行瀏覽器代理,大幅降低令牌成本並提升真實網站穩健性。無需雲端依賴,推動邊緣裝置網路自動化民主化。

下一步行動

在您的本地 LLM 瀏覽器代理中使用 Qwen 8B/4B 實作緊湊 DOM 表格與逐步重規劃。

誰應關注:Developers & AI Engineers

關鍵要點

  • 從當前 DOM 逐步重規劃優於陌生網站上的預先多步驟計劃
  • 緊湊語義表格 DOM 表示(總計 ~15K 令牌)適合小型本地模型
  • 自動模態框處理(關閉按鈕)修復許多覆蓋層失敗
  • Qwen 8B + 4B 在 Ace Hardware 完成完整購物車流程,無需視覺

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3 系列模型已整合至 Amazon Bedrock,其中 Qwen3-Coder-480B 在代理編碼、瀏覽器使用和工具調用基準測試中表現出色,為企業級瀏覽器自動化提供了商業化部署選項[6]
  • Qwen3 模型透過改進的代理能力和 MCP(Model Context Protocol)支持,能夠在單次模型調用中處理多步驟推理和結構化規劃,支持工具調用以實現與外部環境的標準化通信[5][6]
  • 本地 Qwen 模型(包括 0.6B 和 8B 版本)已在實際測試中展示了多輪對話迭代能力,能夠生成功能性代碼並逐步改進輸出質量,達到每秒 97 令牌的推理速度[3]

🛠️ 技術深入

  • Qwen3-Embedding-8B 支持 100+ 語言,上下文長度 32k,嵌入維度最高 4096,支持用戶自定義輸出維度(32-4096 範圍)[4]
  • Qwen-Agent 框架支持 FastAPI 後端流式傳輸,可使用本地 Ollama 運行 Qwen3:1.7B 模型,透過 標籤抑制內部推理過程,優化摘要生成[1]
  • Qwen3 MoE 架構包括 Qwen3-235B-A22B(235B 總參數,22B 激活參數)和 Qwen3-Coder-480B-A35B(480B 總參數,35B 激活參數),針對編碼和代理任務優化[5][6]
  • LocalAI 與 Qwen 指令/編碼器模型集成時,將工具表面限制為僅瀏覽器(當瀏覽器存在時),以減少工具漂移至進程/執行操作[2]

🔮 前景展望AI analysis grounded in cited sources

本地小型模型的瀏覽器自動化將成為企業成本優化的關鍵策略
Qwen 8B+4B 組合僅需 15K 令牌相比視覺方法的 50-100K+,結合 Amazon Bedrock 的商業化部署,表明企業可在本地運行高效自動化而無需大型雲端模型。
MCP 標準化將推動異構工具生態系統的互操作性
Qwen3 對 MCP 的強化支持與 OpenClaw 整合,預示著 AI 代理框架將朝向標準化工具調用協議發展,降低多工具編排的集成複雜度。

時間線

2024-Q4
Qwen3 系列模型發布,包含 235B-A22B 和 Coder-480B-A35B MoE 模型,強化代理能力和 MCP 支持
2025-Q1
Qwen3-Embedding-8B 發布,支持 100+ 語言和 32k 上下文長度的文本嵌入和排序任務
2025-Q2
Qwen 模型在 Amazon Bedrock 上線,提供商業化部署選項,支持代理編碼、瀏覽器使用和工具調用
2025-Q3
Qwen3.5 與 OpenClaw 第三方代理環境集成,支持網頁搜索、信息收集和結構化輸出
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。