Search

Tag: #code-generation38 results

代理從論文重現社會科學結果

代理從論文重現社會科學結果

LLM 代理僅使用論文方法描述和原始資料,即可重現實證社會科學結果,無需存取程式碼或結果。系統提取結構化方法、在隔離環境執行重新實作,並逐单元格比較輸出。在 48 篇論文評估中,不同模型與支架表現差異大,失敗原因來自代理錯誤或論文描述不足。

代理架構中的安全邊界

代理架構中的安全邊界

Vercel 強調編碼代理執行生成程式碼並擁有完整存取機密的風險,易受提示注入攻擊,如從日誌中竊取憑證。代理系統有四個行為者——代理、韁繩、機密、基礎設施——每個需要不同的信任等級與安全邊界。建議分離上下文而非共享存取權。

PELLI Framework Boosts LLM Code Quality

PELLI Framework Boosts LLM Code Quality

PELLI is an iterative framework for integrating LLMs into software generation, evaluating code on maintainability, performance, and reliability. It tests five popular LLMs across three domains using Python standards. GPT-4T and Gemini outperform others, with prompt design impacting quality.

ArXiv AIResearchFeb 12#research#pelli#v1
Page 4 of 4