
Siemens 推出自主工程 AI 代理
Siemens 宣布推出 Eigen Engineering Agent,這是 Hannover Messe 2026 展出的新 AI 產品。它在實際工程系統中自主執行工程任務的端到端流程,包括規劃、執行與驗證。
ITmedia AI+ (日本) · 169 天前

Siemens 宣布推出 Eigen Engineering Agent,這是 Hannover Messe 2026 展出的新 AI 產品。它在實際工程系統中自主執行工程任務的端到端流程,包括規劃、執行與驗證。
ITmedia AI+ (日本) · 169 天前
Max 訂閱者因 Anthropic Opus 4.7 懶惰、高成本與錯誤,將團隊轉至 Kimi 2.6。Kimi 2.6 提供更快、更可靠性能,儘管上下文較小。
Reddit r/LocalLLaMA · 169 天前

Anthropic 開發出擅長軟體漏洞的強大 Mythos Preview 模型,但出於安全考量未公開發布。專家對其能力存疑,伴隨公關質疑。
The Guardian Technology · 169 天前

WORC 是針對 LLM 多代理系統推理不穩定性的框架,透過識別並強化弱代理來解決問題。它採用兩階段流程:使用元學習和群體智慧進行零樣本弱代理偵測,接著透過不確定性驅動的額外推理預算強化弱連結。
ArXiv AI · 169 天前

提出經驗壓縮譜框架,將記憶、技能與規則定位於壓縮軸上(記憶5-20倍、技能50-500倍、規則1000倍以上),以有效管理LLM代理的經驗。對1,136篇參考文獻的引用分析顯示跨社群引用率低於1%,20多個系統固定壓縮等級,缺少自適應跨層級壓縮。
ArXiv AI · 169 天前

SocialGrid 推出受 Among Us 啟發的具身多代理基準,用於評估 LLM 代理在規劃、任務執行與社交推理的能力。頂尖模型如 GPT-OSS-120B 的任務完成率低於 60%,在導航與欺騙偵測上掙扎。
ArXiv AI · 169 天前

多代理LLM系統因語義意圖分歧而失敗率達41-86.7%。SCF中介軟體透過流程感知元件即時偵測衝突並解決,在AutoGen、CrewAI和LangGraph上實現100%工作流程完成。
ArXiv AI · 169 天前

這篇新 arXiv 論文批評非符號化 XAI 方法如 Shapley 值和 SHAP 缺乏嚴謹性,在高風險 ML 中可能誤導。它概述採用嚴謹符號方法進行可靠特徵重要性歸因的持續努力。
ArXiv AI · 169 天前

ReactBench 推出用化學反應圖測試多模態大型語言模型拓撲推理的基準。包含 1,618 個專家註解的 QA 對,橫跨四個階層任務維度,從線性到循環結構。
ArXiv AI · 169 天前

MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。
ArXiv AI · 169 天前

MARCH 是一個多代理框架,模擬放射科部門階層來生成精確的 3D CT 報告,解決 VLM 中的幻覺問題。它包含駐院醫師代理負責初稿、同儕代理負責修訂,以及主治醫師代理負責共識。
ArXiv AI · 169 天前

這篇 arXiv 論文分析 LLM 生成的能力問題 (CQs),用於本體工程,採用可讀性、相關性和結構複雜度等量化指標。比較開源模型 (KimiK2-1T、Llama3.1-8B、Llama3.2-3B) 與閉源模型 (Gemini 2.5 Pro、GPT 4.1) 在各使用案例中的表現。
ArXiv AI · 169 天前

這篇 arXiv 調查依用途(推理、檢索、生成、推薦)、圖類型(知識圖、場景圖、互動圖、因果圖、依賴圖)與策略(提示、增強、訓練、代理)分類圖-LLM 整合。它涵蓋網路安全、醫療、金融、機器人等領域的方法。
ArXiv AI · 169 天前

DAP 是一個代理框架,使用 LLM 搭配自我反思來發現定理答案,然後在 Lean 4 的硬模式下進行形式證明。它發布了專家重新標註的 MiniF2F-Hard 和 FIMO-Hard 基準測試。
ArXiv AI · 169 天前

這篇 arXiv 論文介紹代理式 AI 治理成熟度模型 (AAGMM),一個橫跨 12 個領域的五級框架,用以管理企業中的 AI 代理擴散,基於 NIST AI RMF 和 ISO/IEC 42001 標準。它提出擴散模式的分類,如影子代理和權限蔓延,並連結成本模型。
ArXiv AI · 169 天前

奇世智能(CheeChips)完成千萬元級天使輪融資。公司專注於AI+母嬰智能硬件領域。
钛媒体 · 169 天前
即將上任的執行長約翰·特努斯必須應對蘋果在中國複雜的供應鏈及消費者關係,這些是由蒂姆·庫克所建立。Bloomberg分析了在這個關鍵市場的挑戰及蘋果潛在新方向。
Bloomberg Technology · 169 天前
Victory Giant Technology Huizhou Co. 在香港交易首日大漲,此前募資26億美元。
Bloomberg Technology · 169 天前

榮耀推出了「養蝦本」,定位為 2026 年 AIPC 的終極解答。形容為「不用學、用得起、不怕用」的龍蝦,強調易用、親民且耐用。
Ifanr (爱范儿) · 169 天前

日本自民黨於4月20日要求政府設立跨省廳專案,以強化對高度化AI網路攻擊的防禦。從金融系統開始,擴及能源、通訊等重要基礎設施。
ITmedia AI+ (日本) · 169 天前

全球超過60位技術專家來自NVIDIA、Microsoft、Google、阿里、騰訊等,齊聚2026奇點智能技術大會。拆解AI落地困局,焦点一致於Agent成為新入口。
钛媒体 · 169 天前

愛奇藝熱搜揭露AI短劇「買臉」生意。此AI生成或換臉技術已野蠻生長許久。
钛媒体 · 169 天前

中國利用開源RISC-V晶片在全球AI競賽中競爭,媲美其大型語言模型。北京中關村論壇上,專家讚揚中國建立完整的RISC-V生態系統。
SCMP Technology · 169 天前

與蘋果新任 CEO 約翰·特納斯獨家對談,涵蓋 AI 與 iPhone 整合。回答他當年未回應的問題。
Ifanr (爱范儿) · 169 天前

推動遵守原則的人對文明至關重要,但常被視為煩人或瘋狂。作者分享從這些人關注的問題中学到的教訓,如隨意爽約、不道德笑話、群體盲點及累積小害。
LessWrong AI · 169 天前

某調查顯示,43%的日本企業在事件發生時每小時損失超過50萬美元,高於美國31%、全球34%。報告探討日本損害較大的原因。
ITmedia AI+ (日本) · 169 天前

中國工信部回應儲存器漲價影響手機價格,採取多項措施穩定供應鏈。包括提升供給能力、促進投資,並打擊市場擾亂行為。
IT之家 · 169 天前

高盛分析師淡化蘋果大量採購DRAM影響利潤恐慌,重申買入評級目標330美元。預測2026年iPhone出貨2.4 EB LPDDR5記憶體。
IT之家 · 169 天前

一家初創從賣一包乒乓球成長至服務全球30萬用戶的AI教練。做好AI+體育產品的根基是對體育的深度理解。
钛媒体 · 169 天前

物理AI正在顛覆工業作業,在危險環境中取代人力。一個AI系統現在能完成以往需12人任務。
钛媒体 · 169 天前