AI 生成的 CUDA 核心可能導致模型訓練靜默失效
研究顯示,AI 生成的 CUDA 核心可能通過基準測試,卻在實際生產訓練中導致靜默數值錯誤。這些錯誤常表現為損失函數發散,容易被誤認為是研究方向錯誤。
Tag: #debugging29 results
研究顯示,AI 生成的 CUDA 核心可能通過基準測試,卻在實際生產訓練中導致靜默數值錯誤。這些錯誤常表現為損失函數發散,容易被誤認為是研究方向錯誤。

一套由六個 Agent 組成的系統,嘗試透過自動生成遊戲、實際遊玩與修復 Bug,完成遊戲開發循環。文章指出,程式碼能夠執行,並不代表遊戲真正好玩或具備良好可玩性。

Agent Runs 介面現已為 eve 專案新增 Subagents 分頁,提供子代理執行的詳細分析。使用者可在共享的時間軸上檢視提示詞、執行時間、失敗紀錄與資源消耗。

Vercel 在其 MCP 工具和 CLI 中引入了對「Agent Runs」的原生支援,讓開發者能直接檢查 AI Agent 的執行軌跡、推理過程與工具使用情況。此整合使編碼 Agent 能透過查詢專案元數據與追蹤資料,自動進行除錯。

Latitude 發布了一個採用 MIT 授權的開源平台,旨在監控生產環境中的 AI 代理。該工具允許開發者追蹤代理行為、識別故障,並直接在編輯器中進行修復。

AWS 推出了 Strands Evals,這是一款旨在診斷 AI Agent 故障的工具,可提供分類錯誤報告與信心分數。它讓開發者能將自動化根本原因分析直接整合至評估流程中。

Raindrop AI 發布了開源且採用 MIT 授權的 Workshop 工具,讓開發者能在本地除錯與評估 AI Agent。該工具透過本地儀表板提供即時遙測數據,並將 Agent 的執行軌跡儲存於輕量級 SQL 資料庫檔案中。
DeepMind研究員姚順宇分享了對AI研究的見解,強調了系統級思維、可靠性,以及在AI發展中經驗規律與科學規律之間的區別。

NVIDIA 的 NCCL Inspector 提供輕量級、即時效能監控,用於 NCCL 的分散式深度學習 GPU 間通訊。它加速除錯,精準定位運算、通訊、特定 rank 或硬體問題。此工具與 Prometheus 整合,提供持續可觀測性。

Cloudflare 將 Browser Rendering 改名為 Browser Run,新增 Live View、人機互動、CDP 存取和工作階段錄影功能。針對 AI 代理提供 4 倍更高的並行限制。此升級實現更穩健的網頁互動。