
AI 程式設計進入任務交付時代
文章聚焦一場持續 72 小時的 AI 巔峰競賽,指出程式設計仍是 AI 的核心能力。文章認為,AI 程式設計的競爭焦點正從交付程式碼,轉向完成端到端任務。
钛媒体 · 15 天前

文章聚焦一場持續 72 小時的 AI 巔峰競賽,指出程式設計仍是 AI 的核心能力。文章認為,AI 程式設計的競爭焦點正從交付程式碼,轉向完成端到端任務。
钛媒体 · 15 天前

AI 模型本身不會直接創造生產價值,企業還需要管理上下文、工具、狀態、權限與人工接管的 Harness 系統。當企業決定是否讓 AI 進入實際流程時,低成本驗收與清晰的責任設計往往比表面上的準確率更重要。
虎嗅 · 15 天前
鎂伽科技高階副總裁何源認為,AI for Science 應透過範圍明確且可驗證的實驗室流程擴張,而不是依賴完全自主工廠的宏大願景。真正困難的是整合異質儀器、讓機器人穩定運作、通過驗收測試,以及將客製化專案轉化為可重用模組。
虎嗅 · 15 天前
NVIDIA 推出 Personal AI Router(PAIR)測試版,這是一款免費開源、專為本地 AI 推理設計的虛擬路由器。它能在同一區域網路中發現相容電腦,整合閒置運算資源,支援 AI 代理與本地模型工作負載。
cnBeta (Full RSS) · 15 天前
CONFLICTGUI 基準測試揭示,多模態 GUI Agent 在指令彼此衝突或與介面情境不符時,容易出現偏向執行的過度服從。CONFLICTGUARD 加入可行性驗證與條件式行動調節,在維持一般任務表現的同時,提升衝突任務的成功率。
ArXiv AI · 15 天前
Speculative Macro Commit (SMC) 是一套執行時期系統,讓快速草稿模型預先執行多步驟工具操作鏈,同時由大型 Actor 模型保留最終決策權。在 τ²-Bench Telecom 子集上,相較於序列執行可降低 18.59% 延遲;在 AppWorld 上則降低 44.9%。
ArXiv AI · 15 天前
本研究提出一套提示工程框架,為 Jill Watson 等通用型 LLM/RAG 教學助理提供個人化能力。該框架結合六項學習者特徵與 Bloom’s Taxonomy,建立 96 種學習者輪廓,且不需重新訓練模型即可調整回應。
ArXiv AI · 15 天前
PlanFence 協定會根據建立計畫時所使用的確切共享紀錄,驗證代理即將執行的動作。在 30 個包含計畫後修訂的受控工作流程中,PlanFence 阻止了所有無效動作,而僅依賴資料新鮮度的驗證方式每次都失敗。
ArXiv AI · 15 天前
研究人員推出 NTEP-R,這是一套獎勵框架,用於監督代理式視覺語言模型的每次工具呼叫是否取得並利用必要證據。其 80 億參數實作 NTEP-8B 在七個圖像問答基準上提升了搜尋準確率與工具使用效率。
ArXiv AI · 15 天前
研究人員提出「敘事囚禁」這種失效模式:在多輪諮詢中,LLM 將未受質疑、為自己辯護的單方面說法視為完整資訊,並與敘述者的立場一致。在涵蓋 17 個 LLM 與 5,078 個人際衝突情境的測試中,模型判斷相較於配對的單輪基準平均偏移 25 個百分點。
ArXiv AI · 15 天前
Dude 是一套雙重偵測多代理系統,用於識別研究論文與程式碼實作之間的差異。其粒度對齊協商與兩階段顯著性過濾機制提升了召回率與精確率,相較基準方法最高可使 F1 分數提升 18.7%。
ArXiv AI · 15 天前
這篇 arXiv 研究提出一種受治理的企業分析方法:由 LLM 解讀問題,再由確定性政策選擇並執行預先核准的分析程式。在研究測試中,政策執行的分析器於 110 次測試中全部完成答案與證據契約;執行期規劃系統則沒有任何一次在所有資料集上完整達成要求。
ArXiv AI · 15 天前
這項研究提出 Provenance Density,透過介面視覺化文本中有多少主張受到驗證證據支持。在 81 名參與者的研究中,該介面顯著提升了辨識真實與捏造內容的能力;對 200 個樣本的技術稽核則發現,面對動態查詢時,一致性檢查比檢索密度更為關鍵。
ArXiv AI · 15 天前
DuplexSpeechBench-IFEval 提出包含 1,038 個測試案例的基準,用於衡量全雙工語音代理在八種助理角色中推斷並遵循隱性對話指令的能力。對六個系統的評估顯示,僅使用角色設定可能大幅降低對話輪次管理的遵循度,而安全衝突仍難以處理。
ArXiv AI · 15 天前
AutoGraphForge 是一套端到端流程,能生成、反駁、形式化並嘗試證明圖論猜想。最新執行產生了 6,522 個通過大量資料集與自動化檢查的猜想,並將 Lean 4 驗證與神經定理證明器整合至工作流程中。
ArXiv AI · 15 天前
一套全新的 AI 實用英語教科書透過自適應學習診斷學習者、生成任務、協調回饋,並支援教師管理。對 186 名大學生進行為期八週的原型測試後,相較於靜態電子教科書,系統提升了單元完成準確率與口說成績,也改善了教師工作效率。
ArXiv AI · 15 天前
RIZAP 表示,一名員工誤將客戶資訊上傳至其個人使用的外部生成式 AI 服務。公司已針對此事件致歉。
ITmedia AI+ (日本) · 15 天前

經濟學家 Lan Xiaohuan 討論中國的國家主導經濟模式、公共數據基礎設施、機器人與 AI,如何影響其經濟發展及與美國的競爭。訪談也涵蓋中國創紀錄的貿易順差,以及建立更強社會安全網的必要性。
SCMP Technology · 15 天前

Astro 推出由 Rust 驅動的 Markdown 與 MDX 處理器 Sätteri。據稱這項新工具可將建置速度提升最高 60%。
InfoQ中国 · 15 天前

機器人能夠成功移動只是第一步,更大的挑戰是將可靠的辨識結果整合進實際作業流程。在變電站、輸煤栈橋與大型書庫等場景中,工業 AI 必須多年持續提供準確且穩定的結果。
钛媒体 · 15 天前

美國最新科學與技術戰略正式將科技領導力列為國家安全目標。該政策優先發展 AI、太空、水下系統、半導體、量子資訊等戰略技術,同時強化科研安全,並使教育體系更貼合國家目標。
虎嗅 · 15 天前

據報 Kimi 的年度經常性收入約達 3 億美元,但仍持續尋求額外投資。這引發外界對 Kimi 資金需求、商業模式,以及其與 Anthropic 發展路徑差異的討論。
钛媒体 · 15 天前
由 Andreessen 投資支持的 AI 新創公司 Gimlet 在最新一輪融資中籌得 3 億美元,估值達到 30 億美元。該公司開發能將 AI 任務分配至不同晶片的技術。
Bloomberg Technology · 15 天前
本文透過 WorkBuddy 的開發與成長,回顧 Tencent 一年來的 AI 實踐。文章整理出 25 個關於 Tencent 如何發展 AI、而非盲目追逐市場風口的實務判斷。
钛媒体 · 15 天前

本文開啟對中國大模型產業及其快速加速發展的歷史記錄。文章探討模型持續擴大,與業界尚未清楚知道模型最終應轉化為何種產品或應用之間的矛盾。
钛媒体 · 15 天前

由 ZTE 與 ByteDance 聯合研發的 Nubia NaviX Ultra 預計於 9 月上市,主打以 Doubao 助手為核心的 AI 智慧體體驗。該機結合 ChangXin Memory 的 10667Mbps LPDDR5X、Snapdragon 8 Elite Gen 5 與 7100mAh 電池,並強調 AI 運算在本機完成。
IT之家 · 15 天前
RIZAP 一名員工誤將客戶的個人資料與健康等敏感資訊,上傳至私人使用的外部生成式 AI 服務。外洩資料據報包括姓名、疾病與保險證號,公司已對此致歉。
ITmedia AI+ (日本) · 15 天前

文章指出,Gemini 已重新取得動能,據稱輸出速度超越競爭模型,智能表現也回到第一梯隊。標題將此視為 Gemini 競爭地位的重要改善。
InfoQ中国 · 15 天前

文章探討個人如何打造以 DeepSeek 為基礎的程式開發 Harness。內容也質疑,當開發者能自行組合出相近工作流程時,是否仍需要訂閱 Claude Code 等工具。
InfoQ中国 · 15 天前

隨著 AI 運算基礎設施推升 MLCC 需求,Chaozhou Three-circle (Group) 上半年獲利大幅增長。廣東同業 Fenghua 與 Viiyong 也受惠於當地零組件製造商聚落。
Pandaily · 15 天前