
把城市變成機器人的「試驗場」:Changsha 的具身智能實驗
Changsha 正將真實城市與生產環境作為具身智能機器人的測試場。這種方法強調讓機器人在產線上吸收真實失敗經驗,而不只是依賴模擬訓練。
钛媒体 · 23 天前

Changsha 正將真實城市與生產環境作為具身智能機器人的測試場。這種方法強調讓機器人在產線上吸收真實失敗經驗,而不只是依賴模擬訓練。
钛媒体 · 23 天前

Alibaba 的 Qwen 團隊計畫於 8 月 26 日開源 Qwen3.8-Flash-Next 及其 FP8 版本。這款多模態混合專家模型採用下一代 Qwen4 架構,讓開發者能在完整 Qwen4 發布前提前了解其能力。
TechNode · 23 天前
Huawei 提議在埃及建置供軍事、監控及其他公共部門使用的 AI 資料中心。這項行動凸顯 Huawei 拓展全球 AI 晶片業務的企圖,也引發華盛頓方面的疑慮。
Bloomberg Technology · 23 天前

Tesla 中國內部人士表示,關於公司撤空上海 FSD 資料中心並撤回相關團隊的報導並不屬實。公開資訊顯示,Tesla 仍持續在中國推進 FSD 的資料合規與本地化適配工作。
TechNode · 23 天前

華為諾亞方舟實驗室推出 RoboHarness,讓 VLA、WAM、強化學習策略與 TAMP 規劃器協同處理複雜機器人任務。在不重新訓練底層策略的前提下,Coding Agent 可拆解任務、分派子任務並動態切換策略,支援長時序執行與零樣本任務完成。
雷峰网 · 23 天前

被形容為頂級影片 AI 工具的 Agnes Video 2.5 Flash 現已免費開放。文章透過精緻版《牛來》作品,展示其目前可使用的影片生成能力。
量子位 · 23 天前

一個神秘的具身 AI 模型被展示用於控制或支援與 Unitree 和智元機器人相關的機器人。示範據稱以一鏡到底方式持續 10 分鐘,但模型名稱與技術規格尚未公開。
量子位 · 23 天前

由前剪映負責人張琪智創立的 OJO,已完成近億元人民幣天使輪融資。公司獲順為資本與聯想創投支持,正打造設計 Agent 團隊的協作工作平台。
钛媒体 · 23 天前

這篇分析聚焦機器人產業中的草根階層,以及中小型業者如何讓機器人產品更接近一般消費者的預算。文章強調各行各業的創業者與企業,將在降低具身 AI 使用門檻方面扮演重要角色。
钛媒体 · 23 天前

文章探討 AI 在養老社區中的實際試驗。文章指出,AI 若要進入真實產業場景,必須與業務流程、專業人員及組織體系深度融合。
钛媒体 · 23 天前

據報 DeepSeek 即將完成上市前融資,投資前估值約為 5,000 億元人民幣,即 740 億美元。公司計劃募集約 500 億元人民幣,並可能於 2027 年在上海科創板上市。
SCMP Technology · 23 天前

樂聚機器人在準備IPO之際,已對人形機器人零部件、具身AI軟體、資料與應用場景進行13次對外投資。這項策略旨在降低硬體成本、建立多元AI能力,並將夸父從單一機器人拓展為整合式方案,但持續虧損與投資協同效益不明仍是重大風險。
虎嗅 · 23 天前
Sam Altman 表示,儘管模型能力快速提升,他低估了企業與個人在 GPT-4 之後改變工作流程的緩慢程度。他將 OpenAI 理想的發展方向描述為平台:提供統一的 AI 入口與開放給開發者使用的 API,同時強調算力基礎設施、實際部署與可調整的安全實務。
虎嗅 · 23 天前

文章指出,各大科技公司正競相掌控晶片、資料中心、模型、Agent、應用與終端,但過度擴張可能造成協調與資源分配問題。OpenAI 對平台定位的強調,以及 Google 的 AI 組織重組,都顯示聚焦關鍵控制點可能比全盤自建更具可持續性。
虎嗅 · 23 天前

中國工業和信息化部表示,新能源汽車產業在「十四五」期間已由百萬輛級成長至千萬輛級。下一個五年規劃將聚焦汽車產品品質、自動駕駛安全、准入試點,以及「車路雲一體化」發展。
IT之家 · 23 天前

Apple 提前發布搭載 M6、M5 Ultra 的新款 Mac mini 與 Mac Studio,藉此展示 2 奈米晶片、多晶粒封裝與本地 AI 算力路線。Mac mini 被重新定位為全天候智能體運算工具,而高記憶體配置與 Mac 叢集則瞄準開發者、小型團隊及重視隱私的企業。
虎嗅 · 23 天前

Confluent 的調查發現,僅有 17% 的日本企業已在正式環境中運行 AI Agent 等自主型 AI,在受調查市場中排名最低。報告探討企業部署停留在概念驗證階段的原因,以及如何推進至實際營運。
ITmedia AI+ (日本) · 23 天前

TRACE 是一套用於 LLM 代理多目標材料探索的轉換感知殘差控制框架。透過學習父項目標—編輯—子項目標轉換及其屬性變化,宏平均命中率從 LLEMA 的 18.13% 提升至 25.96%。
ArXiv AI · 23 天前

Okta Japan 報告指出,約每兩家企業就有一家同時使用多種 AI 工具,而非只依賴 ChatGPT 等單一服務。該報告分析了超過 20,000 個使用 Okta Platform 的組織,為期四年的匿名化存取資料。
ITmedia AI+ (日本) · 23 天前

STEP-KTODER 是一套程式碼偏好最佳化框架,將模組層級函式視為學習步驟,並透過自動產生的單元測試進行標註。在 HumanEval(+)、MBPP(+)、BigCodeBench 與 LiveCodeBench 上,該方法優於僅使用結果回饋的 KTO 與 DPO。
ArXiv AI · 23 天前

RENDER 是一項基準控制方法,用於評估記憶與 RAG 輸入的讀取格式如何影響 LLM 的回答品質。在 500 道 LongMemEval 題目與 9 個模型的測試中,已解析的記憶封包大幅優於依近期性截斷的原始對話,而實際部署風格的模板也造成模型間顯著的效能差距。
ArXiv AI · 23 天前

MolEmb 將多模態大型語言模型調整為通用分子嵌入模型,能同時根據分子特徵與自然語言脈絡產生表示。此框架在分子性質預測上具競爭力,並支援跨模態的分子—文字檢索。
ArXiv AI · 23 天前

一項案例研究稽核發現,LLM 生成的 366 篇自傳式內容中,有 354 篇無法通過獨立紀錄的場景層級驗證,失敗率達 96.7%。以受試者語料庫作為生成依據雖能改善結果,但驗證失敗率仍高達 83.3%。
ArXiv AI · 23 天前

研究人員提出一套多代理框架,讓 LLM agents 能使用科學模擬模型,為製藥流程最佳化設計並執行受控實驗。透過比較模擬介入並解讀結果,系統相較於純語言推理,能產生更具體、可執行,且使用者評價更高的建議。
ArXiv AI · 23 天前

FLARE 是一套具備不確定性分析能力的框架,用於評估在醫療領域導入 AI 是否具備財務與營運效益。以中風照護為例的研究發現,每年約 3,992 名患者可達到損益平衡,而患者量約 5,000 人時,首年即可取得正投資報酬率。
ArXiv AI · 23 天前

ESQ-Bench 是一項以 Oracle 為核心的新基準,用於測試 NL2SQL 在真實企業結構中的方言泛化能力與隱性語意偏差。在三個複雜度層級中,即使通過執行測試的查詢也經常產生錯誤結果;Claude Sonnet 4.6 整體大幅優於 GPT-4o 與本地端 Llama 3.2。
ArXiv AI · 23 天前

一項研究發現,AION-1 高度依賴巡天分割圖,而非影像像素;即使只修改中繼資料,也會大幅改變模型預測的通量、大小、橢圓率與紅移。這種繼承自偵測流程的不完整性可能使斷層平均紅移偏離 LSST DESC 要求,而移除偵測通道即可消除影響,且未見可量測的效能損失。
ArXiv AI · 23 天前

這項 arXiv 研究發現,透過提示詞工具 eliciting AI 偏好時,測量結果會因工具不同而大幅變化。在八個模型、15 個模型福利結果與五種工具的測試中,偏好排名的泛化程度偏低,顯示單一工具測得的偏好,難以代表其他工具會得到的結果。
ArXiv AI · 23 天前

這篇 arXiv 立場論文指出,日益自主的 AI agent 可能削弱有效的人類監督,而不只是從中受益。論文建議設計能維持批判判斷力的 agent 工作流程與組織協議,並抵消長期使用自動化所造成的技能退化。
ArXiv AI · 23 天前

這篇 arXiv 論文提出一套框架,用於判斷由 LLM 輔助的科學研究何時仍具備認知正當性與可問責性。論文主張,人類驗證與責任歸屬比機器參與程度更重要,並提出「認知審計」以記錄任務委派、來源、驗證與責任。
ArXiv AI · 23 天前