📄ArXiv AI•較早收集於 5h
零樣本基準測試提升 Solidity 錯誤召回率

💡CoT/ToT 在 Solidity 錯誤上達 99% 召回率—AI 驅動區塊鏈安全的關鍵(32 字元)
⚡ 30-Second TL;DR
有什麼變化
在平衡的 400 合約資料集上評估 LLM 的二元漏洞檢測與分類任務。
為什麼重要
推進 LLM 在區塊鏈安全審計的應用,可實現高召回率的漏洞掃描以減輕財務風險。揭示提示策略的權衡,對生產部署至關重要。
下一步行動
使用零樣本 ToT 提示測試 Claude 3 Opus 於您的 Solidity 合約進行漏洞檢測。
誰應關注:Researchers & Academics
關鍵要點
- •在平衡的 400 合約資料集上評估 LLM 的二元漏洞檢測與分類任務。
- •CoT/ToT 提示在錯誤檢測中達到約 95-99% 召回率,但犧牲精確度。
- •Claude 3 Opus 在 ToT 提示下於分類任務取得最高 90.8 加權 F1 分數。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
🛠️ 技術深入
- •零樣本提示示例:'Is the following smart contract vulnerable? Please answer yes or no.' 用於二元分類,評估模型對原始理解能力。[1]
- •零樣本 CoT 提示:'Explain your reasoning step by step, then conclude whether the contract is vulnerable.' 引發逐步邏輯和控制流評估。[1]
- •零樣本 ToT 提示:指示模型'list multiple possible vulnerabilities and evaluate their likelihood',模擬多路徑並行探索以選最可能路徑。[1]
🔮 前景展望AI analysis grounded in cited sources
LLM 將成為 Solidity 審計輔助工具
ToT 等提示提升召回率至 95-99%,可整合進自動化審計流程,儘管精確度需優化。
Claude 3 Opus 將主導智慧合約分類基準
其在 ToT 下達 90.8 加權 F1 分數領先,預示在錯誤分類任務中優於其他模型。
⏳ 時間線
2025-06
零樣本 CoT 提示正式定義,引入'Let’s think step by step'觸發器提升 LLM 推理。
2025-06-17
Cheng et al. 發表零樣本 CoT 協議,匹配少樣本效能於數學和邏輯任務。
2026-03
ArXiv 發佈 Solidity 零樣本基準測試論文,Claude 3 Opus 以 ToT 領先錯誤分類。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。