
StateSight 揭示 VLM 空間推理缺陷
StateSight 是一套程序生成的基準測試,透過立方體推理、遮擋物件計數與連通元件計數,評估視覺語言模型重建潛在空間狀態的能力。儘管回答格式完全正確,GPT-5.5 與 Claude Sonnet 5 的表現仍明顯落後於人類參與者。
ArXiv AI · 26 天前

StateSight 是一套程序生成的基準測試,透過立方體推理、遮擋物件計數與連通元件計數,評估視覺語言模型重建潛在空間狀態的能力。儘管回答格式完全正確,GPT-5.5 與 Claude Sonnet 5 的表現仍明顯落後於人類參與者。
ArXiv AI · 26 天前

SDAD 框架提出「規格驅動代理式開發」,結合精確的機器可讀規格、代理式程式碼生成、獨立的多代理驗證,以及人類發布核准。該框架認為,AI 驅動的開發會將工程紀律前移至規格品質、治理、安全性與可稽核的來源追蹤。
ArXiv AI · 26 天前

PrimeAgentOrchestrator(PAO)會從使用者的個人資料庫擷取相關記憶,並以此啟動預先載入上下文的 Claude Code 執行個體。這份經驗報告涵蓋四個月的部署,包括多後端檢索架構、代理生命週期管理,以及三代上下文傳遞機制重設所帶來的經驗。
ArXiv AI · 26 天前

Nexus 透過 INT8 語意查找緩衝區與壓縮工具簽名,將工具檢索與高成本的 schema 預填充分離。在 Apple silicon 統一記憶體上執行 Qwen2.5-14B-Instruct 時,首次生成參數的速度最高提升 1.66 倍,中等上下文深度下 TTFT 提升 1.1–1.7 倍。
ArXiv AI · 26 天前

本調查探討多模態如何重塑 AI Agent 的感知、推理、規劃、記憶與行動模組。文章提出以模態為核心的分類法,比較不同融合架構,並回顧機器人、GUI 導航、內容生成與影片理解等應用。
ArXiv AI · 26 天前

這項研究提出 Linear Discriminant Tree、Forest 與 AdaBoost 集成模型,用於可解釋的多模態情感與行為分類。該方法據稱相較 Multimodal Transformer 將修正版 F1 提升 4.3%,並較 IMR 基準提升 3.0% 的準確率。
ArXiv AI · 26 天前

這項研究指出「結構性間接前置條件淘汰」是代理記憶系統中的獨立失效模式:與查詢弱相關的上游資訊會在檢索前被移除。其 DSGC 方法將詞彙編碼器的完整鏈保留率從 0.03 提升至 0.90,並將句子編碼器的保留率從 0.23 提升至 1.00。
ArXiv AI · 26 天前

這篇立場論文提出 Slow AI,作為現今最大化取向生成式 AI 系統的替代設計框架。論文提出五項原則:克制、足夠性、選擇性保留、材料可見性,以及將摩擦視為使用功能,讓永續性與反思成為系統設計的一部分。
ArXiv AI · 26 天前

一項研究發現,語義偽裝能讓有害請求看似良性敘事,從而繞過 LLM 的後期安全護欄。研究提出 Latent Intent Verification(LIV),透過探測早期層表示,在 Phi-3、Qwen2.5 與 Gemma-2b 上將攻擊偵測能力提升 20–50%。
ArXiv AI · 26 天前

文章實測比較 ChatGPT、Gemini 與 Claude Sonnet 5 的回應速度與穩定性。同時也檢視效能是否會隨時段變化,以及測量結果的一致程度。
ITmedia AI+ (日本) · 26 天前

本文根據模型所建模的通道,區分環境、代理程式,以及實際形成的代理程式—環境聯合過程等世界模型。研究運用計算力學建立規範性預測模型,並證明受支援限制的模型可能比不受限制的環境模型簡單許多。
ArXiv AI · 26 天前

這篇研究論文提出以現象學為優先的人工意識研究方法,將意識視為代理人與世界互動時產生的主觀經驗。研究運用範疇論與 Q-networks,建模計算系統中的行動、介面與現象學不變量。
ArXiv AI · 26 天前
一名 ChatGPT Pro 訂閱者表示,生成數百張圖片後遭遇速率限制,儘管定價頁面承諾「無限且更快速的圖片創作」。據稱 OpenAI 客服回覆,Pro 使用權仍受未公開的使用額度限制。
Reddit r/MachineLearning · 26 天前

中國家族辦公室與產業創始人家族正從間接投資 VC 基金,轉向直接參與 AI 天使輪,尤其聚焦機器人、Physical AI 與智慧製造。它們提供的不只是資金,還包括工廠、供應鏈、客戶資源及真實場景驗證環境。
虎嗅 · 26 天前

HiDream.ai 發布基於原生全模態 UiT 架構的互動式世界模型 HiDream-O1-World。模型支援文字、圖像與互動操控輸入,面向具身 AI 仿真、互動娛樂及 3D 場景生成等應用。
雷峰网 · 26 天前
Sakana AI 宣布已與日本防衛省簽訂合約,開發支援資訊分析業務的 AI。這項計畫延續其協助提升自衛隊指揮與控制系統的工作。
ITmedia AI+ (日本) · 26 天前

文章認為,AI 的進步正日益由持續累積的個人上下文、更長時間的任務執行,以及與軟體環境形成閉環互動所定義。文章也指出,Agent 工具正從程式設計師擴展到知識工作者,未來可能成為數位工作的統一入口。
虎嗅 · 26 天前

Netflix 開源了一套專為因果推理設計的智能代理工作流。此發布可能為 AI 從業者提供可重複使用的基礎,用於建立分析因果關係的系統。
InfoQ中国 · 26 天前
據報導,SGLang 將萬億級模型的冷啟動時間從 8 分 48 秒縮短至 32 秒。這項成果代表大型模型啟動速度提升近 16 倍。
虎嗅 · 26 天前

文章以全景方式介紹 KDC 工程模型,描繪從現實情境到回饋的完整路徑。內容似乎將工程視為一個完整系統,而非一組彼此孤立的開發步驟。
InfoQ中国 · 26 天前

本期 AI 產業週報涵蓋 DeepSeek 再度調價,以及 Nvidia AI 伺服器價格上漲超過 15%。報導也聚焦由前 Kimi 搜尋負責人創辦的 AI 紅娘公司,其目標是將結婚率提高 10%。
InfoQ中国 · 26 天前

Uncle Bob 公開反思完全信任 AI 生成程式碼的經驗。他坦承,這種開發方式在實務上仍未證明可行。
InfoQ中国 · 26 天前

PJM 更新容量市場模型後大幅推高電力成本,四輪拍賣支出達 636 億美元,卻僅增加 4.8GW 新容量。SemiAnalysis 研究指出,模型偏差可能低估約 3.8GW 的可靠發電能力;與此同時,AI 資料中心需求持續超出電網併網能力。
虎嗅 · 26 天前

BOCOM International 的分析認為,Moonshot AI 的 Kimi K3 位於成本與能力的 Pareto 前沿。其超大型上下文視窗與原生多模態設計,據稱能以大幅更低的單任務成本,提供接近頂尖閉源模型的效能。
Pandaily · 26 天前

iFLYTEK 表示,在長上下文訓練方面,國產加速器的效能可能比 Nvidia H200 慢最多 5 倍。公司沒有等待更強硬體,而是從模型架構、算子、記憶體與框架著手優化,並以 Huawei Ascend 910B 上運行的 Spark X2-Flash 作為驗證案例。
Pandaily · 26 天前

在世界機器人大會上,Unitree、AgiBot 和 Honor 展示了更快的人形機器人,其中有機器人以 9.32 秒完成 100 公尺短跑。滾珠螺桿與減速器價格下跌,有助於降低硬體成本,而娛樂合作也顯示商業應用正在擴大。
Pandaily · 26 天前
在中國的跨國企業辦公室,常因資料跨境合規問題無法使用總部核准的境外 AI 工具,而國產 AI 產品又不在採購清單中。Microsoft Copilot 成為少數獲准使用的選項,但進階帳戶數量有限且價格昂貴,公司會依據量化的生產力提升來分配名額。
虎嗅 · 26 天前

文章認為,8月18日的半導體拋售與其說是 AI 泡沫破裂,不如說是在更高折現率下發生的久期清算。文章指出,高 Beta 的光通信股票率先遭受重創,而 Nvidia 相對抗跌。
钛媒体 · 27 天前

一項追蹤 2.6 萬名中國學生、歷時 30 個月的研究指出,AI 讓作業分數提高 18%,卻使中考分數下降 24%。研究結果顯示,看似漂亮的 AI 輔助作業,可能掩蓋學生獨立學習與應試能力的不足。
钛媒体 · 27 天前

Cloudflare WriteGuard 為 MCP 伺服器提供精細化的安全控制。此更新旨在協助團隊管理並保護與基於 MCP 的工具及服務之間的互動。
InfoQ中国 · 27 天前