🦙Reddit r/LocalLLaMA•較早收集於 47m
開源LLM紅隊與安全研究基準測試
#benchmark#red-teaming#cybersecurity#abliteratedqwen2.5-coder-32b-instruct-abliteratedqwen2.5-coder-32bseneca-cybersecurity-llmdolphin-2.9-llama3llama-3.1-whiterabbitneogemma-2-27b
💡Qwen2.5-Coder在無審查安全紅隊基準中勝開源,超越商業GPT。
⚡ 30-Second TL;DR
有什麼變化
測試Qwen2.5-Coder-32B、Seneca-Cybersecurity-LLM、Dolphin-Llama3-70B、Llama-3.1-WhiteRabbitNeo、Gemma-2-27B。
為什麼重要
提升開源模型在敏感安全工作流程的採用,避開商業過濾。引發社群對漏洞研究模型精進的興趣。
下一步行動
本地部署Qwen2.5-Coder-32B-Instruct-abliterated-GGUF,用於紅隊PoC生成。
誰應關注:Researchers & Academics
關鍵要點
- •測試Qwen2.5-Coder-32B、Seneca-Cybersecurity-LLM、Dolphin-Llama3-70B、Llama-3.1-WhiteRabbitNeo、Gemma-2-27B。
- •Qwen2.5-Coder以無限制回應與PoC腳本勝出。
- •相較商業模型隱私優勢強;進階多階段模擬弱。
- •自動評分拒絕率、準確性、實用性、完整性。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen2.5-Coder-32B-Instruct 被駭客用於 LAMEHUG 惡意軟體,透過 Hugging Face API 產生基於描述的命令,用以收集受害者系統資訊並透過 SFTP 或 HTTP 外洩[1][5]。
- •該模型訓練資料包含超過 5.5 兆 tokens,涵蓋 92 種程式語言,比例為 70% 程式碼、20% 文字、10% 數學,來源自 GitHub 儲存庫、拉取請求與 Kaggle 資料集[4]。
- •在評估基準如 HumanEval(164 個 Python 任務)、MBPP(974 個程式問題)與 LiveCodeBench(超過 600 個程式問題)中表現優異,涵蓋程式碼生成、完成、推理與除錯能力[4]。
🛠️ 技術深入
- •架構:密集 Transformer,32.5 億參數,64 層,支持最高 131,072 tokens 上下文長度[2]。
- •關鍵技術:RoPE(Rotary Position Embedding)位置編碼、SwiGLU 激活函數、RMSNorm 正規化、Attention QKV bias[2]。
- •部署效能:使用 vLLM 時,平均 21.32 tokens/秒,256 tokens 文字生成延遲 10.32 秒,冷啟動時間 40.17 秒[2]。
- •輸入/輸出:文字輸入(字串格式),支援 max_tokens、repetition_penalty(預設 1.18)、temperature(預設 0.6)、top_p、top_k 等參數[2][6]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-07
CERT-UA 發現 LAMEHUG 惡意軟體使用 Qwen2.5-Coder-32B-Instruct 產生命令
2025-11
Google 揭露 PromptSteal 惡意軟體由 APT28 使用該模型生成 Windows 命令
2025-12
Qwen2.5-Coder 系列發布,包含 32B-Instruct 模型作為 SOTA 開源程式碼 LLM
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

