
DUPLEX:可靠LLM機器人規劃
DUPLEX 是一種神經符號架構,將 LLM 限制於資訊提取以進行基於 PDDL 的機器人規劃。快速系統使用輕量 LLM 快速將自然語言映射至 PDDL;規劃失敗時啟動慢速系統進行迭代修復。在 12 個規劃領域的成功率優於基準。
直接匹配不多,已補上最新動態。
Tag: #agentic-planning2 results

DUPLEX 是一種神經符號架構,將 LLM 限制於資訊提取以進行基於 PDDL 的機器人規劃。快速系統使用輕量 LLM 快速將自然語言映射至 PDDL;規劃失敗時啟動慢速系統進行迭代修復。在 12 個規劃領域的成功率優於基準。

PyPDDLEngine 是一個開源 PDDL 模擬引擎,讓 LLM 透過工具呼叫進行互動式規劃。它支援逐步動作選擇、狀態觀察與重置。在 IPC Blocksworld 上,代理式 LLM 規劃成功率 66.7%,略勝直接提示的 63.7%,但落後傳統規劃器 85.3%。

Truffle Security 發現 768 組外洩的 AWS 金鑰,可對企業帳戶提供廣泛控制權,其中包括 526 組根金鑰。在受測憑證中,仍有 88% 處於啟用狀態;而 AWS 的隔離政策仍允許許多具破壞性的操作。

GDS Holdings 顯示,AI 相關資料中心訂單的增長速度快於已確認收入。這項趨勢反映需求強勁,但基礎設施擴建週期也使獲利延後。

TikTok 與 ByteDance 同意支付 4 億美元,和解美國司法部提起的案件;該案指控數百萬名未滿 13 歲兒童使用平台,且其資料在未獲家長同意下遭到蒐集。愛爾蘭監管機構也曾在 2023 年因兒童帳戶問題對 TikTok 罰款 3.45 億歐元。

隨著 AI 工作負載提高對系統資源的需求,Microsoft 正重新最佳化 8GB 以上裝置的 Windows 記憶體使用。文章認為,舊版相容性、整合服務、WebView2 與分散的資源管理,正壓縮本地模型和 AI Agent 可用的記憶體空間。

文章探討具身智能如何進入一場長期尋找產品市場契合度(PMF)的過程。文章認為,商業成功不會立即到來,因為技術路線仍未定型,而場景與規模之爭才剛開始。

一份最新報告警告,生成式AI正助長大學無人監考線上考試中的大規模作弊。相關機構敦促高校重新檢視這類評量,因為考試很容易被繞過,可能已無法可靠衡量學生的知識。

量子位報導星海圖與產業夥伴共同討論具身智能從模型走向生產力的路徑。文章強調透過產業協作,推動具身智能真正落地到多個行業。

OpenAI 表示 Codex 活躍使用者已突破 2,000 萬,第三方追蹤數據則顯示其近期增速超越 Claude Code。Claude Code 目前規模仍較大且深受開發者採用,但隨著 Anthropic 接近早期市場飽和,其高速成長已經放緩。