
英偉達 Groq 整合晶片供 OpenAI 推理
英偉達正為 OpenAI 及其他客戶打造定制處理器,整合 Groq 晶片技術,用於更快、更高效的 AI 推理。這是業務重大調整,或重塑 AI 競賽格局。
cnBeta (Full RSS) · 203 天前

英偉達正為 OpenAI 及其他客戶打造定制處理器,整合 Groq 晶片技術,用於更快、更高效的 AI 推理。這是業務重大調整,或重塑 AI 競賽格局。
cnBeta (Full RSS) · 203 天前
美國多個聯邦機構對 xAI 的 Grok 聊天機器人的安全與可靠性表示擔憂。GSA 報告指出 Grok-4 未符合聯邦 AI 安全標準,但五角大樓已批准其用於機密場景。
36氪 · 203 天前

美國聯邦機構近幾個月對xAI的Grok聊天機器人的安全性和可靠性表示擔憂。官員強調政府內部在AI模型部署問題上存在持續分歧。
cnBeta (Full RSS) · 203 天前
大众、賓士、福特、通用等車企2025年利潤腰斬50%以上,受電動化轉型、關稅、中國競爭影響。特斯拉营收首降,停產兩款車型轉向商用及AI業務。
虎嗅 · 203 天前

美國國防部據報禁止承包商與合作夥伴與 Anthropic 進行商業往來。這可能切斷 Anthropic 如 AWS 的雲端支援,促使使用者轉向本地模型。
Reddit r/LocalLLaMA · 203 天前
少數派的年度徵文使用 LLM 分析 2025 年熱門文章。高互動量文章強調真實性而非精緻。
少数派 · 203 天前
使用者報告 Qwen 3.5 在一般硬體上實現無監督代理編碼循環,超越先前本地模型。儘管基準未顯示重大躍進,但達成 4-6 小時無監督工作。
Reddit r/LocalLLaMA · 203 天前

VeRO 推出可重現的代理優化評估框架,具備版本化代理快照、預算控制評估及結構化執行追蹤。它提供目標代理與任務的基準測試套件,並附參考評估程序。
ArXiv AI · 203 天前

基於範例的數學推理指導不穩定,因為策略使用與可執行性之間存在差距,人類與模型策略存在系統性差異。論文提出 Selective Strategy Retrieval (SSR),一個測試時框架,使用多路徑訊號選擇性檢索並結合來源感知策略。
ArXiv AI · 203 天前

SideQuest 利用大型推理模型 (LRM) 本身,透過推理上下文 token 的有用性來壓縮 KV 快取,適用於長上下文代理任務。它將壓縮視為平行輔助任務執行,避免汙染主要推理上下文。
ArXiv AI · 203 天前

大型推理模型在複雜任務中因自我調控不足而失敗,儘管中間步驟正確。元認知行為調優(MBT)透過 MBT-S(從頭合成嚴謹推理軌跡)和 MBT-R(改寫軌跡穩定探索)注入元認知策略。
ArXiv AI · 203 天前

研究人員定義雙預測性(P),作為觀測、行動與結果間共享資訊的度量,證明嚴格界限:量子系統最高達1,經典系統≤0.5,引入代理後更低。在雙擺、RL代理及LLM對話中驗證,區分代理(依預測行動)與智能(學習、自監控、適應)。
ArXiv AI · 203 天前

這篇arXiv論文使用大型語言模型(LLMs)回顧人工智慧(AI)在生命週期評估(LCA)的整合,揭示趨勢與主題。它強調AI採用率急劇成長,特別是LLMs,並與LCA階段相關聯。
ArXiv AI · 203 天前

本文將心理測量評分者模型整合至AI評估中,以修正人類評分者的系統性錯誤。採用項目反應理論,特別是多面向Rasch模型,來分離輸出品質與評分者效應如嚴格度和中心性。
ArXiv AI · 203 天前

CourtGuard 是一個檢索增強的多代理框架,將 LLM 安全視為基於外部政策文件的證據辯論。它在 7 個安全基準上無需微調即達到最先進性能,超越專用政策遵循基線。
ArXiv AI · 203 天前

ConstraintBench 推出一個基準測試,用於評估 LLM 在 10 個營運研究領域中直接解決約束最佳化問題,無需求解器。對六個前沿模型在 200 個任務上的評估顯示,可行性是主要瓶頸,最佳模型僅達 65% 約束滿足率,但聯合最佳性低。
ArXiv AI · 203 天前

這篇arXiv立場論文主張,認知模型與AI演算法可為組合多個LLM的模組化語言代理提供藍圖。它形式化「代理模板」,定義個別LLM角色與組合方式。
ArXiv AI · 203 天前

AHCE 框架透過學習的人類反饋模組 (HFM) 在專業領域請求結構化專家推理,強化 LLM 代理。Minecraft 實驗顯示正常任務成功率提升 32%,高難任務近 70%,僅需最少人類介入。
ArXiv AI · 203 天前

這篇 arXiv 論文提出使用基於 LLM 的代理式 AI 框架,用於無蜂窩 O-RAN 的意圖驅動優化。監督代理將意圖轉譯為目標與速率要求,專門代理處理權重、DRL 的 O-RU 管理及監控。
ArXiv AI · 203 天前
介紹「Schelling 良善」,這是來自成功文明的多樣智能代理在假設道德協調遊戲中會收斂的觀點。強調這不是直接道德判斷,而是利用共同知識與生存壓力預測的協議。
AI Alignment Forum · 203 天前

愛范兒分享 Nano Banana 2 的 5 個神級玩法,稱其為 AI 生圖之神。文章附提示詞,建議收藏。
Ifanr (爱范儿) · 203 天前
阿里開源桌面 Agent 工具 CoPaw,用戶可一鍵在本機與雲端部署,並基於 CoPaw 進行二次開發,自訂模型、編寫 Skills 及接入專屬訊息應用。內建豐富 Skills 可實現社交平台內容摘要、資訊查詢與總結、桌面整理等任務。
36氪 · 203 天前

中國高速「小藍燈」標示智駕(NOA/NGP)激增,2025城市NOA滲透率11.6%,華為/小鵬記錄海量里程。他駕駛避讓、跟隨或挑釁,系統呈保守、暴躁或怪癖如鳴笛、誤判燈號。
虎嗅 · 203 天前
英偉達計劃推出專為 OpenAI 等定制的全新處理器,助力更快、更高效的 AI 推理工具。該平台整合 Groq 設計晶片,將於下月聖荷西 GTC 大會公布。
36氪 · 203 天前

文章辯論擎天租機器人租賃是否為20年一遇的創富機會,或是精準收割。機器人租賃值得關注,但遠未到盲目樂觀階段。
钛媒体 · 203 天前

一鍵部署方案讓 Windows 用戶輕鬆使用 OpenClaw。完美整合進飛書,適合新手快速上手。
虎嗅 · 203 天前

Workday創辦人回歸應對AI轉型困境。股價暴跌10%,引發市場疑慮。
钛媒体 · 203 天前

Meta砸600億收購備用芯片,集齊三大類型。Google TPU進軍商業戰場,Meta倒戈。
钛媒体 · 203 天前

英偉達財報獲利驚人,但股價未漲。分析質疑黃仁勳CEO的AI「金礦」策略,從淘金熱轉向煉金術。
钛媒体 · 203 天前