AI代理可靠性科學
AI代理在基準測試上表現出色,但在實務中因單一成功指標忽略一致性、穩健性、可預測性和安全性而失敗。本 arXiv 論文提出 12 項具體指標,沿著這四個維度分解可靠性,基於安全關鍵工程。
ArXiv AI · 211 天前
AI代理在基準測試上表現出色,但在實務中因單一成功指標忽略一致性、穩健性、可預測性和安全性而失敗。本 arXiv 論文提出 12 項具體指標,沿著這四個維度分解可靠性,基於安全關鍵工程。
ArXiv AI · 211 天前
代理狀態評估提出 LLM 驅動的模擬框架,用於基準測試多輪工具呼叫代理,避免昂貴的確定性後端。它使用情境定義目標和狀態,LLM 追蹤器從互動軌跡推斷代理狀態進行驗證。
ArXiv AI · 211 天前
PAHF 是一個持續個人化 AI 代理的框架,透過明確的每用戶記憶從即時人類互動中線上學習。它使用三步迴圈:行動前澄清、基於記憶偏好採取行動,以及行動後反饋更新記憶。
ArXiv AI · 211 天前
January Mirror,一個基於證據的臨床推理系統,在2025內分泌委員會風格的120題考試中獲得87.5%準確率,超越人類專家(62.3%)和前沿LLM如GPT-5.2(74.6%)。它在最難題目上表現出色(76.7%準確率),在無網路存取的封閉證據限制下運行。
ArXiv AI · 211 天前
研究人員展示序列模型的脈絡內學習可在多代理強化學習中誘發合作,而無需硬編碼共同玩家假設或時間尺度分離。針對多樣共同玩家的訓練會產生快速劇集內最佳回應策略。
ArXiv AI · 211 天前
研究人員推出 GPSBench,一個包含 57,800 個樣本、橫跨 17 項任務的資料集,用以探測大型語言模型(LLM)在無工具輔助下的地理空間推理能力。14 款最先進 LLM 在地理知識上較可靠,但在距離與方位等幾何計算上掙扎。
ArXiv AI · 211 天前
FoT 推出通用框架,用於大型語言模型的動態推理方案,克服 Chain of Thought、Tree of Thoughts 和 Graph of Thoughts 的靜態結構限制。它具備超參數調整、提示優化、並行執行和快取功能,以提升效能。
ArXiv AI · 211 天前
Surge AI 推出 Corecraft,為 EnterpriseGym 中首個高保真 RL 環境,模擬企業客戶支援,包含 2,500+ 實體與 23 工具。透過 GRPO 訓練 GLM 4.6,將保留評估任務的任務通過率從 25% 提升至 37%,並轉移至 BFCL (+4.5%)、τ²-Bench Retail (+7.4%) 與 Toolathlon (+6.8%)。
ArXiv AI · 211 天前
神經求解器在簡單路由問題上表現出色,但在複雜約束下仍顯不足。CaR 提出首個通用框架,透過明確的學習式可行性精煉及聯合訓練,產生多樣高品質解以供輕量改善。
ArXiv AI · 211 天前
CAFE 將自動特徵工程重新表述為因果引導的順序決策過程,使用因果發現獲得軟因果先驗,並透過多代理強化學習進行特徵建構。它在 15 個基準測試上優於基線高達 7%,並在共變量偏移下將效能下降減少 4 倍。
ArXiv AI · 211 天前
提出一個可訓練框架,利用資訊不對稱的多輪反饋,將可驗證任務轉化為互動式上下文學習。經訓練的小型模型效能幾乎追平大十倍模型,並泛化至程式碼、謎題和迷宮導航。
ArXiv AI · 211 天前
這篇arXiv論文提出「先儲存後依需求提取」的AI記憶方法,以保留原始經驗並避免當前主流「提取後儲存」方法的資訊遺失。它還探討從機率經驗集合中發掘更深層洞見,以及透過共享儲存提升效率。
ArXiv AI · 211 天前
自主代理式工作流程出現優化不穩定現象,反覆自我改進反而降低分類器效能,特別在低盛行率臨床症狀如長COVID腦霧(3%)上表現明顯。使用開源Pythia框架,驗證敏感度在1.0與0.0之間劇烈波動。
ArXiv AI · 211 天前
ArXiv 論文為代理技能框架提供數學定義,並評估其在資料安全限制的工業環境中小型語言模型(SLM)的益處。中等規模 SLM(12B-30B 參數)在準確度和減少幻覺方面顯著提升;80B 程式碼專用變體以更佳 GPU 效率匹配專有模型。
ArXiv AI · 211 天前

摩根士丹利指出,今年將成為中國人形機器人市場爆發的關鍵拐點,類比2019-2020年中國新能源汽車市場轉折。IDC預測,到2026年,中國人形機器人應用場景將提升至當前的3倍以上。
cnBeta (Full RSS) · 211 天前

特斯拉宣布 FSD(輔助監督版)累計行駛里程超過 80 億英里,從 2024 年 12 月的 70 億英里快速增長。此數據加速無監督全自動駕駛訓練。
IT之家 · 211 天前

螞蟻集團推出萬億參數開源模型,在人性理解與執行上卓越。情商與Agent戰鬥力全面拉滿。
量子位 · 211 天前

中國春晚(春晚)之後,各種 AI 系統和機器人匯聚到一個地點。此地穩穩接住了春晚的「流浪」元素,並以 doge 表情暗示。
量子位 · 211 天前

2026春晚後,騰訊元寶AI及松延動力、宇樹機器人轉戰B站進行直播互動,延續熱度。B站興趣房間及AI社群帶來百萬級觀看峰值。
虎嗅 · 211 天前

中國巨頭在2026春節砸下超過45億人民幣補貼AI語音支付,以搶佔用戶意圖。字節跳動的豆包AI手機遭微信、支付寶生態封殺,而阿里千問則憑內部閉環整合,6天完成1.2億筆訂單。
虎嗅 · 211 天前

Telstra 已找出 380 個潛在 AI 用例遍及其營運。該公司警告 AI 成本效益需密切檢視,以確保可行實施。
iTNews Australia · 211 天前

HBR研究顯示,AI透過模糊界線、擴大任務並消除休息空隙,使工作更密集。員工面臨工作量蔓延、角色模糊及「速度暴政」,無時間節省。
虎嗅 · 211 天前
OpenAI正與印度塔塔集團合作開發AI技術。合作包括建造數據中心基礎設施。
Bloomberg Technology · 211 天前
印度總理納倫德拉·莫迪和法國總統埃馬紐埃爾·馬克宏將在印度AI峰會上發表演說。全球科技領袖也將出席此活動。
Bloomberg Technology · 211 天前

中國AI與機器人公司如騰訊和AgiBot正任命千禧世代及Z世代人才為首席科學家,領導AI和機器人研究。最受矚目的是28歲的Vinces Yao Shunyu,前OpenAI研究員,於12月加入騰訊擔任首席AI科學家,直接向總裁Martin Lau匯報。
SCMP Technology · 211 天前

亞馬遜的生成AI搭載次世代助理Alexa+已在美國推出。亞馬遜日本在Echo Dot特別款發表會上表示,日本是僅次於美國與加拿大的優先市場,但未透露具體時程。
ITmedia AI+ (日本) · 211 天前

本地AI代理OpenClaw因廉價硬體熱潮,推樹莓派股價3天近翻倍至10億英鎊。於100美元Pi運行安全邊緣任務,勝雲端或昂貴Mac。
虎嗅 · 211 天前
太初元碁完成多款國產主流開源大模型深度適配,包括智譜GLM-5.0、阿里千問Qwen3.5-397B-A17B,均在其自研T100加速卡上進行。在SDAA軟體棧中推出階梯式開發工具鏈,全面涵蓋從入門到高階需求。
36氪 · 211 天前

微軟 Project Silica 使用飛秒雷射將資料蝕刻進玻璃,12 公分見方可存 4.84TB,室溫下穩定逾萬年。讀取採用顯微鏡與 CNN;寫入速度僅 8MB/s,一塊板需 150 小時以上。
IT之家 · 211 天前