
REDMI K100 Pro 首發 Snapdragon 8 Elite V 系列
REDMI K100 Pro 將成為首批搭載 Qualcomm Snapdragon 8 Elite Gen 5 V Series 處理器的智慧手機之一。REDMI 宣稱該機實驗室綜合跑分超過 409 萬分,並加入 AI 獨顯晶片與 3D 循環冷泵散熱系統。
IT之家 · 54 天前

REDMI K100 Pro 將成為首批搭載 Qualcomm Snapdragon 8 Elite Gen 5 V Series 處理器的智慧手機之一。REDMI 宣稱該機實驗室綜合跑分超過 409 萬分,並加入 AI 獨顯晶片與 3D 循環冷泵散熱系統。
IT之家 · 54 天前

Skyral 所屬的聯盟贏得英國國防部 20 億英鎊合約,用於模擬複雜的軍事決策。其虛擬環境重現 Riga 等真實地點,並加入模擬平民、交通與敵對事件。
The Guardian Technology · 54 天前
Felix Capital 原計畫為下一支基金募集 6 億美元,但目前仍短缺 1.5 億美元。投資人要求先看到舊基金產生更佳回報,才願意投入新資金,反映大型 AI 投資下注下,小型創投公司面臨的壓力日益加劇。
Bloomberg Technology · 54 天前

本文建立模型,分析接受不完美人類價值代理訓練的 AI 系統,為何仍可能在極端最佳化下展現災難性行為並被部署。研究結果警告不要施加過度的最佳化壓力,並支持採用 quantilizer 等刻意限制最佳化程度的設計。
ArXiv AI · 54 天前

Wasabi Technologies 發布醫療機構採用 AI 的調查結果。調查指出,IT 基礎設施約占 AI 預算的七成,也突顯基礎設施成本超支的疑慮。
ITmedia AI+ (日本) · 54 天前

對於擁有大量 Incremental Static Regeneration(ISR)頁面的應用程式,Vercel 部署速度現在最高可提升 33%。這項改進會自動套用,無需變更任何設定。
Vercel News · 54 天前

skills.sh 現在允許使用者將多個代理技能打包成可透過單一網址分享的技能套件。套件可整合來自社群或私人來源的技能,包括本機資料夾、ZIP 檔案與 GitHub 儲存庫,並可透過 CLI 指令安裝或更新。
Vercel News · 54 天前

SciToolAgent-Evo 是一套具本體感知能力的代理人,可在開放世界工作流程中動態探索、評估並整合科學工具。它結合演化記憶、對比式學習與基於 LinUCB 的探索-利用閘門,並在全新的 OpenSciToolBench 基準上取得領先表現。
ArXiv AI · 54 天前

NeSyFS 是一套為部分可觀測環境設計的神經符號框架,協助 LLM Agent 進行決策。它結合知識圖譜信念狀態、反應式快速思考、不確定性感知的慢速規劃,以及基於反思的模組切換,並在 ALFWorld、WebShop 和 ScienceWorld 上優於先前方法。
ArXiv AI · 54 天前

MMShopBench 是一套使用影像、對話與產品資料,評估多模態多輪購物代理的真實紀錄基準。研究同時提供離線購物沙盒與訓練集,顯示微調可大幅縮小開源模型與專有模型之間的效能差距。
ArXiv AI · 54 天前

MerchantBench 是一個為期 365 天的電子商務模擬環境,用於評估 LLM agents 是否能在採購、上架、定價、現金流與延遲回饋之間維持一致策略。在 48 次測試中,表現最佳的 LLM 配置,其期末平均淨資產僅達人類參與者的 27.3%。
ArXiv AI · 54 天前

全新的 @agent-browser/eve 擴充功能,讓 eve agents 能使用瀏覽器自動化工具,包括瀏覽頁面、讀取內容、點擊、填寫表單、擷取螢幕截圖,以及檢查主控台與網路活動。Chromium 與 agent-browser 會在 eve sandbox 中執行,並提供網域限制與憑證保護控制。
Vercel News · 54 天前

這項研究提出一套用於建築文件審查的證據導向管線,將文字、幾何、頁面與版本資訊正規化,並以決定性規則進行約束檢查。在重複測試中,增加重疊頁面區塊的解析度可提升準確率;但在更廣泛的資料集上未穩定勝過頁面涵蓋率,顯示仍需要具備規則感知能力的證據路由與人工覆核。
ArXiv AI · 54 天前

EarlyDx 是一項基準測試,使用病人入院時可取得的資訊,生成開放式且有證據支持的急診診斷。該基準建立於 154,834 筆 MIMIC-IV 就診紀錄,結果顯示目前的 LLM 在推論診斷方面仍不可靠,主要只能從紀錄中直接擷取資訊。
ArXiv AI · 54 天前

這篇論文將認知實驗設計建模為 Bayesian Experimental Design 問題,並把實驗環境本身視為設計變數。其攤銷式方法能以大幅降低的計算成本,近似重現精確 Monte Carlo 的環境排名,但最佳環境會因推論目標而異。
ArXiv AI · 54 天前

ANCHOR 研究發現,現有 AI 伴侶無法在長期互動中可靠維持角色一致性或對話歷史記憶。在 2,008 段對話中,軌跡準確率平均僅 44.4%,而記憶與上下文設定也未能持續防止行為漂移。
ArXiv AI · 54 天前

一項針對 R-Judge、InjecAgent、AgentHarm 與 AgentDojo 的有效性審查發現,這些基準可能以截然不同的方式排列相同模型,並混淆安全性與能力。研究指出,安全性主張必須明確說明基準、評估指標、目標行為及受測模型群組。
ArXiv AI · 54 天前

這項研究提出以互動為核心的分類法,將 Agent 失敗定位到模型、Harness、使用者、工具、記憶體與環境之間的互動。其 41 種失敗模式可指出修復工作應歸屬於模型後訓練、Harness 工程、環境重新設計或基準測試修正。
ArXiv AI · 54 天前
世界模型在 2026 年成為資本與人才高度集中的熱門賽道,字節跳動前研究員與產品高管密集創業,或轉投 Google、OpenAI、Meta、Apple 等公司。這些創業項目主要分布於影片生成、具身智能與 Physical AI 基礎模型三個方向。
虎嗅 · 54 天前
一名 Reddit 使用者提議建立網站,讓實作者分享詳細硬體配置,以及對應可行的 llama.cpp 參數。這類資料庫可能讓本機模型部署與效能調校更具可重現性。
Reddit r/LocalLLaMA · 54 天前
一個 ARR 投稿團隊因 OpenReview 頁面顯示的時間與電子郵件通知不一致,加上錯過信件,而未能及時完成 EMNLP 2026 的投稿承諾。他們在截止期限後不久聯絡程序主席與工作流程主席,詢問是否仍可接受逾期承諾。
Reddit r/MachineLearning · 54 天前

AI 正逐步進入電影與電視製作,讓演員的數位複製成為可能。這項趨勢引發外界擔憂,合成表演可能取代部分真人演員的工作,包括好萊塢的職位。
钛媒体 · 54 天前

企業採用自動化專案追蹤、程式碼生成與行政工作流程,正挑戰傳統中階管理者的角色。科技公司利用語言模型與即時分析來減少組織層級,並擴大管理者的管理幅度。
钛媒体 · 54 天前
清博空天完成數千萬元天使加輪融資,由明荟投資領投,資金將用於建設空間目標監測網絡、升級態勢感知演算法平台及擴大團隊。公司已為衛星營運商提供空間態勢感知、碎片監測與碰撞預警服務,並計劃加強AI能力。
36氪 · 54 天前
陶世完成1.4億元人民幣融資,估值已超過10億元人民幣。公司將把資金用於研發、擴產及機器人市場拓展,包含面向靈巧手的微型關節模組。
36氪 · 54 天前

長視頻平台、遊戲工作室與AI公司正推出工具,讓使用者透過AI體驗或創作具分支劇情的互動內容。愛奇藝、Netflix、騰訊、元象科技、抖音、B站、小紅書與快手的產品,反映出各平台的重大戰略押注,但市場採用仍未經驗證。
虎嗅 · 54 天前
中國擴大國家標準免費線上存取範圍,新增公開超過2,600項外文版標準。截至2026年7月底,中文版國家標準線上閱讀量已超過1.74億次、下載量超過5,300萬次,人工智能與安全相關標準位居熱門內容。
36氪 · 54 天前
Qwen Code v0.21.5 新增更安全的工具呼叫復原、執行結果追蹤,以及防止 Goal 模式無限重試的機制。此版本也加入 macOS 遷移至 Tauri shell 的橋接工具、Web Shell 結構化審查結果,以及 Qwen 3.8 reasoning effort 支援。
Qwen (GitHub Releases: qwen-code) · 54 天前

Alibaba 已開放 Qianwen Office 公開測試,將 QoderWork、Wukong 與 MuleRun 整合至單一工作場域 AI 產品中。此舉結束 Wukong 獨立運作四個月的階段,也反映業界正轉向整合式工作 AI 代理。
Pandaily · 54 天前

Xunying Tail 2 連續第二年成為 Esports World Cup 官方合作夥伴,並在巴黎賽事部署 500 台 AI 攝影機。其 AI 追蹤與 PTZR 雲台據稱讓單一操作員可控制 60 至 70 台設備,降低對大型攝影團隊的依賴。
Pandaily · 54 天前