
多層級因果嵌入框架
介紹因果嵌入作為因果模型抽象的泛化,允許多個詳細模型映射到較粗模型的子系統,同時保留因果關係。定義廣義一致性概念及多解析度邊際問題,連結統計與因果邊際議題。
ArXiv AI · 204 天前

介紹因果嵌入作為因果模型抽象的泛化,允許多個詳細模型映射到較粗模型的子系統,同時保留因果關係。定義廣義一致性概念及多解析度邊際問題,連結統計與因果邊際議題。
ArXiv AI · 204 天前

這篇 arXiv 論文分析潛在推理方法,該方法在連續潛在空間中執行多步驟推理。研究發現普遍存在捷徑行為,且缺乏真正的 BFS 式探索,而是隱式修剪。
ArXiv AI · 204 天前

研究人員提出異質代理透過校準自身可靠性並在不自信時棄權投票的框架,推廣孔多塞陪審團定理。他們推導出選擇性參與設定下的群體成功機率非漸近下界。
ArXiv AI · 204 天前

恒生科技指數持續下跌,網際網路巨頭難扶;AI 大潮下,資金青睞 MiniMax、智譜 AI 等原生模型公司。
虎嗅 · 204 天前

GYWI結合共同作者知識圖譜與RAG,為LLM提供可控上下文與可追溯靈感路徑,用於科學構想生成。它具備混合檢索(RAG+GraphRAG)、強化學習提示優化,並在arXiv資料上評估GPT-4o、DeepSeek-V3等模型。
ArXiv AI · 204 天前

FIRE 推出基準測試 LLM 的財務知識,透過考試題目與 3,000 個實務情境題。涵蓋理論考試與商業活動,使用封閉式與開放式題型。
ArXiv AI · 204 天前

CWM使用InfoNCE對比學習與硬挖掘負例,對LLM進行微調作為動作評分器,以區分可行與無效動作。它在最小編輯硬負例上Precision@1優於SFT達+6.76個百分點,並達成更高AUC-ROC(0.929)。
ArXiv AI · 204 天前

研究人員推出CogARC,這是ARC的適應人類子集,包含75個視覺推理任務,由260名參與者測試,準確率約85%。高解析度數據記錄觀看、編輯和嘗試,顯示困難問題上的多樣策略,即使錯誤解決方案也趨於收斂。
ArXiv AI · 204 天前

ArchAgent 是基於 AlphaEvolve 的代理式 AI 系統,能自動化電腦架構發現,生成最先進的快取替換政策。它在 2 天內於 Google 多核心追蹤上實現 5.3% IPC 加速,在 SPEC06 上 18 天內實現 0.9%,比人類快 3-5 倍。
ArXiv AI · 204 天前

這篇 arXiv 論文介紹「vibe researching」,AI 代理具備專門技能,能自主處理社會科學完整研究流程。以 Claude Code 的 scholar-skill 插件為例,這是涵蓋從構想到提交的 21 項技能工具,並提出認知任務框架,按可編碼性和隱性知識需求分類,定義委託邊界。
ArXiv AI · 204 天前

研究人員提出評估代理 (EA),用於評估 AutoML 管道中 AI 代理的中間決策,涵蓋有效性、推理一致性、模型風險及反事實影響。不同於僅聚焦結果的評估,EA 以 F1=0.919 偵測錯誤,並歸因效能變化(-4.9% 至 +8.3%)。
ArXiv AI · 204 天前

介紹代理行為合約 (ABC),一個規範 AI 代理的前提條件、不變式、治理政策與恢復機制的框架。在 AgentAssert 函式庫中實現運行時執行,證明漂移界限並在 200 個情境與 7 個模型上評估。
ArXiv AI · 204 天前

習近平在中國的AI雄心正與脆弱的就業市場發生衝突。最近,AI人形機器人在新年表演中與舞者一同驚豔觀眾。
Bloomberg Technology · 204 天前
沃尔核材目前擁有16台進口發泡芯線擠出機,其中部分設備正有序安裝調試,高速線整體產能已大幅提升。公司大量採購繞包設備以滿足數據中心高速線規格需求,目前設備正陸續到貨。
36氪 · 204 天前

Meta停止Olympus先進AI訓練晶片開發,先前Iris專案亦棄。回應以巨額交易:超1000億美元採購AMD MI450晶片(6GW運算),及多年Google TPU租賃用於訓練,或直接購買。
虎嗅 · 204 天前

2026春節檔票房暴跌39.5%至575.2億元人民幣,內容疲軟所致。華策影視轉向AI電影,壓縮成本週期。
虎嗅 · 204 天前
天融信在互動平台表示,公司暫未向字節跳動Seedance 2.0提供安全防護。
36氪 · 204 天前

JAXA 發布「JAXA Earth API for Python」v0.1.5 版本。此更新新增 MCP 支援,讓生成 AI 工具能直接顯示與分析地球觀測資料。
ITmedia AI+ (日本) · 204 天前

Google 為 Gemini 3 Flash 推出新功能「Agentic Vision」,結合視覺推論與程式碼執行。它會自動產生 Python 程式碼調查影像,將影像理解精度提升 10%。
ITmedia AI+ (日本) · 204 天前
QuestMobile數據顯示,千問春節DAU達7352萬,增幅940%。「春節請客計劃」首日吸引1475萬用戶,總下單超1.3億人。
36氪 · 204 天前

網易兩年「斷捨離」策略使現金儲備激增320億至1635億元,透過砍弱項聚焦熱門遊戲。《夢幻西遊》復興創紀錄;新作《燕雲十六聲》登Steam熱銷第二。
虎嗅 · 204 天前

自動駕駛正狂飆邁向2030年的商業化。這帶來商業化浪潮與規則重構。
钛媒体 · 204 天前
抖音推出長圖文功能,支持最高8000字,並透過AI生成熱點新聞摘要。字節跳動在音樂、小說等內容中廣泛整合AI。
36氪 · 204 天前

DeepSeek 聯手清華、北大發表新論文,推出 DualPath 推理系統,針對智能體 LLM 優化 KV-Cache 載入。透過雙路徑載入解決 PD 分離架構下的儲存頻寬不均問題。
机器之心 · 204 天前
AWE2026 在上海 W3 館推出 5,000 平方米創新科技展區,展示宇樹科技、魔法原子、元點智能等公司的具身智能機器人與硬體。展區聚焦人形機器人、AI 硬體及新型互動,從實驗室走向商業應用。
36氪 · 204 天前

文章探討AI Agent創業公司是否必然被收購,由CloudBot事件引爆。強調能動手幹活的AI才是真AI。
钛媒体 · 204 天前

AI崛起帶來「復魅」,扮演「算計之巫」,透過提示產生黑箱預言。對比人類「感通之巫」在感知與靈性上的獨特優勢。
虎嗅 · 204 天前
研究人員提出模型歸罪技術,用以揭露 LLM 誤行為背後動機,區分陰謀與混亂或錯誤。他們使用黑盒方法調查自發行為,如告密、欺騙、作弊與沙袋戰。
AI Alignment Forum · 204 天前

研究人員證實,大型語言模型可剝除線上用戶的匿名性,以每人僅幾美元揭露真實身份。此技術利用 LLMs 連結偽名與公開資料的能力。
iTNews Australia · 204 天前