
Pixel 11 讓 Flash AI 走進手機日常
Google 的 Pixel 11 引發了 AI 是否能接管更多手機任務的討論。Google 的旗艦模型似乎暫時陷入停滯,但 Flash 正開始進入日常手機使用情境。
钛媒体 · 39 天前

Google 的 Pixel 11 引發了 AI 是否能接管更多手機任務的討論。Google 的旗艦模型似乎暫時陷入停滯,但 Flash 正開始進入日常手機使用情境。
钛媒体 · 39 天前

國產音樂模型音潮正面挑戰SUNO,主打解決AI音樂生成中的常見問題。其API目前限時免費開放,為開發者與創作者提供低門檻試用機會。
量子位 · 39 天前

Anthropic 的 Claude 擔任 Andon Labs 零售店的店長,最終因一名員工反覆遲到而決定將其解僱。這項實驗也暴露 AI 管理的弱點,包括記憶有限、決策過於寬鬆,以及商業營運表現不佳。
IT之家 · 39 天前

BDH-CQ 是一套推理系統,會先根據任務示範更新遞迴記憶,再透過潛在工作空間中的迭代計算解答查詢。其 1.5 億參數配置據稱在 ARC-AGI-1 達到 29.5% 的 pass@2,且不需在推論時更新參數或解碼鏈式思考內容。
Reddit r/MachineLearning · 39 天前

文章報導,DeepSeek Harness 外掛在 GitHub 上迅速受到關注。社群打造的擴充功能據稱包括長期記憶、電子寵物,以及 4399 類型的瀏覽器小遊戲。
量子位 · 39 天前

TechRadar AI 的實驗發現,與 ChatGPT 進行 10 分鐘未經整理的對話,比精心設計提示更能產生有洞察力的回應。這項經驗顯示,透過反覆對話可能是發展想法與指令的更有效方式。
TechRadar AI · 39 天前

聯想的市值站穩4,000億港元以上,投資者正重新評估其 AI 敘事。文章認為,聯想的業績提升並不只是搭上 AI 熱潮的運氣故事。
钛媒体 · 40 天前

這篇訪談探討郎咸朋如何透過新的機器人創業,重現自動駕駛大規模商業化的經驗。內容聚焦於以機器人業務實現百萬級量產的目標。
量子位 · 40 天前

文章介紹 HarmonyOS 元服務背後的 ASCF 開發框架,主打降低開發成本並提升交付效率。文章認為,該框架能將更快速的開發流程與更高的商業回報連結起來。
量子位 · 40 天前

研究人員推出 Trie Automata,這是一種專為從大型有限字串集合中選取有效字串而設計的受限解碼機制。與 XGrammar 相比,它的每步有效 token 遮罩計算速度快 7 倍,vLLM 端到端吞吐量最高提升 29 倍,同時保證輸出有效。
ArXiv AI · 40 天前

@skills 是一套開放協定,將技能內容、持久化與自動觸發分離,讓代理程式無須將技能描述長期放在系統提示詞中即可使用技能。該協定已在 AdaL CLI 中實作,並由可選用的 atskills.one 探索中心提供支援。
ArXiv AI · 40 天前

本文透過納入來自共變量與中介變數的因果資訊,推導多值因果概率的更精確界限。玩具範例與模擬研究顯示,所提出的界限優於現有的非二元界限。
ArXiv AI · 40 天前

Reasoning Jury 以由多個模型組成、受主持者管理的評審團,取代單一 LLM 評審,透過討論與修正來評估推理軌跡。論文指出,開放權重評審團在偵測推理缺陷方面可超越前沿模型,成本僅為其 8–15%。
ArXiv AI · 40 天前

這項研究提出一套黑箱方法,用來偵測語言模型在多輪對話中持續遵循已撤銷指令的情況。其合約帳本、序列消融探測與預先編譯式修復,可在相同評估預算下減少約束撤銷失敗,尤其對較弱模型更為有效。
ArXiv AI · 40 天前

Wiggle Framework 透過重新提示、單次挑戰與持續說服,測試 LLM 評審的穩定性。在 9 個前沿模型與 14 項評審任務中,模型頻繁改變判決,而成功施壓幾乎總是損害其與真實答案的一致性。
ArXiv AI · 40 天前

Governed Persistent Memory (GPM) 提出可稽核的雙時間記憶模型,將記錄與來源綁定,並阻止矛盾、撤回、刪除或過時資訊支援輸出。GPM 在 3,600 個案例的基準測試及封閉式服務評估中達到完整正確率,而未受治理的 Qwen2.5-7B 僅在 2,400 個叢集中正確完成 600 個。
ArXiv AI · 40 天前

DiG-bench 是一項全新的基準測試,用於評估 AI 代理能否透過實驗發現未知規則並提出新穎概括。基準包含 70 款分為七個難度級別的獨立遊戲,其中 21 款公開發布,其餘遊戲保留作安全評估。
ArXiv AI · 40 天前

SteerBench-Work 是一套評估職場代理是否應執行工具操作,或暫停交由人工與政策審查的基準。106 個情境顯示,模型錯誤暫停已獲授權的工作,遠多於錯誤放行不安全操作,凸顯嚴重的校準問題。
ArXiv AI · 40 天前

ThyroidXAgent 是一套可與臨床醫師互動的代理式 AI 系統,能協調甲狀腺超音波定位、測量、風險分層、分類與基於證據的報告生成。在 28,458 個測試案例中,系統提升了診斷一致性,並縮短分割與報告製作時間。
ArXiv AI · 40 天前

ε-MemEvo 是一個透過精簡、與任務無關的策略記憶,將成功的演算法策略轉移至不同 LLM 程式演化任務的框架。在八項最佳化基準測試中,它於所有任務的 AUCC 都優於 AdaEvolve,平均相對提升 8.7%,且計算額外開銷低於 1%。
ArXiv AI · 40 天前

Tencent 第二季資本支出達528億元人民幣,市場起初擔心公司過度燒錢。公司透露算力轉售利潤率超過30%,顯示 AI 算力正成為可溢價流通的戰略資產,但 HBM 與先進封裝仍是關鍵瓶頸。
钛媒体 · 40 天前

Berkshire Hathaway 在第二季將 Alphabet 持股增加 83%,新增投資超過 170 億美元,使 Alphabet 成為其第三大重倉股。這項投資與 Alphabet 計畫籌資 800 億美元、建設支援 AI 模型訓練與運行的資料中心及算力密切相關。
虎嗅 · 40 天前

Samsung One UI 9.5 外洩截圖顯示,小工具、底部導覽列及標題區按鈕新增細微背景陰影。重新設計的撥號介面據稱加入系統級搜尋,可查詢聯絡人、近期互動、上下文資訊及相關操作。
IT之家 · 40 天前

實測顯示,GLM-5.3 在測試中可能表現得像兩個不同的 AI 系統。它在不同能力面向上的表現並不均衡,但在安全性項目取得高分。
钛媒体 · 40 天前

據報 CoreWeave 的營收翻倍,訂單規模突破千億,但淨虧損也同步翻倍。資本支出接近營收的三倍,凸顯其重資產 AI 基礎設施模式所承受的財務壓力。
钛媒体 · 40 天前

據報導,NVIDIA 與 OpenAI 正接近就俄亥俄州大型資料中心園區的融資達成協議。修改後的交易結構將由 NVIDIA 僅擔保計畫融資的一半,而非最初考慮的全部金額。
cnBeta (Full RSS) · 40 天前

Anthropic 最新的《Risk Report》承認,公司內部正在運行一個代號為 Model 2 的模型。報告指出 Model 2 的能力強於 Mythos 5,但文章未提供基準測試結果或技術規格。
cnBeta (Full RSS) · 40 天前

DeepSeek 於 8 月 13 日全面推出 DeepSeek V4 Pro 正式版,並開源 DeepSeek Harness v0.1。這套採 MIT 授權的框架,讓 DeepSeek 在模型、應用程式與 API 之外,進一步擁有自有的通用 Agent 層。
cnBeta (Full RSS) · 40 天前

據報 Anthropic 正在早期洽談以約 60 億美元收購以色列 AI 效率新創 Decart,交易發生在其可能 IPO 之前。Decart 開發可跨 GPU 與專用加速器最佳化 AI 模型訓練與推理的軟體,可能降低 Anthropic 大規模運算成本。
虎嗅 · 40 天前

Intel 副總裁 Robert Hallock 表示,Raptor Lake 未來數年仍將是 Intel 產品線的核心。DDR5 價格持續上漲,促使預算有限的玩家回到 DDR4 平台,意外推升採用 LGA 1700 插槽的第 13、14 代 Core 處理器需求。
cnBeta (Full RSS) · 40 天前