📄較早收集於 5h

零樣本基準測試提升 Solidity 錯誤召回率

零樣本基準測試提升 Solidity 錯誤召回率
PostLinkedIn
📄閱讀原文: ArXiv AI

💡CoT/ToT 在 Solidity 錯誤上達 99% 召回率—AI 驅動區塊鏈安全的關鍵(32 字元)

⚡ 30-Second TL;DR

有什麼變化

在平衡的 400 合約資料集上評估 LLM 的二元漏洞檢測與分類任務。

為什麼重要

推進 LLM 在區塊鏈安全審計的應用,可實現高召回率的漏洞掃描以減輕財務風險。揭示提示策略的權衡,對生產部署至關重要。

下一步行動

使用零樣本 ToT 提示測試 Claude 3 Opus 於您的 Solidity 合約進行漏洞檢測。

誰應關注:Researchers & Academics

關鍵要點

  • 在平衡的 400 合約資料集上評估 LLM 的二元漏洞檢測與分類任務。
  • CoT/ToT 提示在錯誤檢測中達到約 95-99% 召回率,但犧牲精確度。
  • Claude 3 Opus 在 ToT 提示下於分類任務取得最高 90.8 加權 F1 分數。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • 該論文使用來自 GitHub 的真實世界 Solidity 智慧合約資料集,平衡包含 400 個合約進行漏洞檢測評估。[1]
  • ToT 提示透過讓模型探索多條推理路徑(如列出多種可能漏洞並評估可能性)來減少假陽性,提升結構化探索效果。[1]
  • 結構化推理策略如零樣本 CoT 和 ToT 在 Solidity 漏洞檢測基準上持續優於純零樣本提示,提供去中心化應用安全洞察。[1]

🛠️ 技術深入

  • 零樣本提示示例:'Is the following smart contract vulnerable? Please answer yes or no.' 用於二元分類,評估模型對原始理解能力。[1]
  • 零樣本 CoT 提示:'Explain your reasoning step by step, then conclude whether the contract is vulnerable.' 引發逐步邏輯和控制流評估。[1]
  • 零樣本 ToT 提示:指示模型'list multiple possible vulnerabilities and evaluate their likelihood',模擬多路徑並行探索以選最可能路徑。[1]

🔮 前景展望AI analysis grounded in cited sources

LLM 將成為 Solidity 審計輔助工具
ToT 等提示提升召回率至 95-99%,可整合進自動化審計流程,儘管精確度需優化。
Claude 3 Opus 將主導智慧合約分類基準
其在 ToT 下達 90.8 加權 F1 分數領先,預示在錯誤分類任務中優於其他模型。

時間線

2025-06
零樣本 CoT 提示正式定義,引入'Let’s think step by step'觸發器提升 LLM 推理。
2025-06-17
Cheng et al. 發表零樣本 CoT 協議,匹配少樣本效能於數學和邏輯任務。
2026-03
ArXiv 發佈 Solidity 零樣本基準測試論文,Claude 3 Opus 以 ToT 領先錯誤分類。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。