
教會 AI Agent 何時主動取得上下文
這篇論文將上下文取得建模為主動推論,讓 Agent 在澄清問題、檢索、工具呼叫、執行任務或停止之間做出選擇。研究提出 Optimal Question Asking 基準,評估語言模型在 25 至 300 個候選項目的任務表現,也探討生成前澄清與提示最佳化。
直接匹配不多,已補上最新動態。
Tag: #active-inference4 results

這篇論文將上下文取得建模為主動推論,讓 Agent 在澄清問題、檢索、工具呼叫、執行任務或停止之間做出選擇。研究提出 Optimal Question Asking 基準,評估語言模型在 25 至 300 個候選項目的任務表現,也探討生成前澄清與提示最佳化。

ODAR-Expert 提出 LLM 適應路由框架,透過基於主動推斷的難度估計器,動態將查詢導向快速啟發式代理或緩慢審議代理。它採用自由能融合機制,最小化變分自由能目標,平衡對數似然與認知不確定性。在 23 項基準測試中達到 MATH 98.2% 準確率與 HLE 54.8%,並在 Llama 4 + DeepSeek 上節省 82% 計算成本。

這項 arXiv 研究提出一種主動推論覓食代理,會將有限的內感受精度動態重新分配給最迫切的身體需求。在 AffectWorld 環境中,該方法的學習階段存活率較均勻精度代理提升逾一倍,也加快了受注意通道的學習速度。

這項研究將效價與喚起等情緒狀態納入人類駕駛的 active inference 模型。研究方法同時根據當前駕駛狀態與預測的未來結果估計情緒,並在兩個互動式情境中產生與既有研究報告相符的情緒訊號。

Cloudflare 推出 Agent Tracing,支援設定 Payload 截斷限制。不同支援的 Agent 框架在 Payload 預設記錄策略上有所差異,因此開發者在設定可觀測性時需要檢查各框架的個別設定。
AI 資料中心擴張正大幅推升磷化銦衍底的需求,這類材料用於高速光晶片。全球供應高度集中於三家海外供應商,而中國國內產能仍然有限,且正處於擴產爬坡階段。
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。

一項追蹤26,811名中國中學生、歷時30個月的研究發現,使用生成式 AI 的學生作業成績平均提高18%、完成時間縮短30%,但月考成績平均低20%。研究指出,長期使用者更容易將作業完全外包給 AI,使原本應透過草稿、試錯與推演建立的能力逐步流失。

日本將阻焊劑、GaN 基板、永磁體、鈣鈦礦電池與閃爍體五類技術,納入技術轉移前的申報與審查框架。這項措施涵蓋海外子公司、合資企業、公司、大學與研究機構,可能影響半導體、機器人、AI 伺服器及感測器供應鏈。

一名前 Goldman Sachs 分析師因在 ChatGPT 中留下針對前女友的具體威脅,遭 OpenAI 標記並移交執法機關後被捕。這起案件凸顯 AI 聊天記錄可能成為司法證據,也引發對隱私、威脅偵測標準與平台通報義務的討論。