
Claude 90分鐘挖穿20年漏洞!5w星「安全」系統跌下神壇
Claude AI 在短短90分鐘內發掘出一個50k星GitHub安全系統的20年舊漏洞。此舉讓該系統名譽掃地。AI 在安全審計方面的能力已遠超預期,並呈指數級增長。
Tag: #llm-reasoning33 results

Claude AI 在短短90分鐘內發掘出一個50k星GitHub安全系統的20年舊漏洞。此舉讓該系統名譽掃地。AI 在安全審計方面的能力已遠超預期,並呈指數級增長。

研究人員引入了「干預式基礎審計」(interventional grounding audits),用於測試 LLM 在思維鏈推理過程中是否真正依賴於既定前提。透過將謂詞替換為新符號,該方法能識別出模型即便推理過程存在缺陷或邏輯斷層,仍能得出正確答案的情況。
這篇文章探討了從顯性思維鏈(CoT)轉向潛在推理(Latent Reasoning)的趨勢,旨在解決模型推理的系統成本與可靠性問題。BDH(Dragon Hatchling)作為一種結合語言建模與狀態化潛在計算的新興研究方向,展示了在無需回溯的情況下處理複雜約束問題的潛力。

Hypothesis Evolution Protocol (HEP) 為 LLM 代理進行科學研究提供了一個結構化框架。它將非結構化的推理轉化為可審計的操作,從而能夠更好地驗證假設生成、測試和信念更新的過程。

本研究提出了一種框架,將 LLM 從被動推理轉變為具備迭代證據搜尋能力的診斷代理。透過結合強化學習與可驗證獎勵 (RLVR) 以及 RAGES 模擬器,該模型實現了高保真的臨床推理。
MathFormer 是一個僅有 4M 參數的小型模型,在沒有明確數學知識的情況下,於符號數學任務中達到了 98.6% 的準確率。這表明大型語言模型(LLM)可能是在進行結構化的模式補全,而非真正的邏輯推理。

策略引導策略優化(SGPO)以可重用的策略蒸餾取代了標準的軌跡模仿,旨在提升大語言模型的推理能力。透過使用自適應加權和標記級前向 KL 散度目標,該方法能幫助模型學習可遷移的問題解決技能,而非僅僅是死記硬背步驟。

MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。
一個使用 Django 和 React 建構的全端管線,透過從文本中建立知識圖譜來解決多跳推理問題。它結合了混合檢索、社群偵測與重排序技術以提升準確度。

研究人員提出了一種新的測試時運算資源分配方法,該方法根據失敗的潛在成本而非僅僅是預測難度來優先處理任務。這種方法通過將運算資源動態分配給高風險操作,顯著降低了軟體工程任務中的成本加權損失。