Search

Tag: #evaluation51 results

LangSmith CLI 與技能推出

LangSmith CLI 與技能推出

LangChain 推出 CLI 與首套技能,讓 AI 程式碼代理具備 LangSmith 生態系統專業知識。技能涵蓋代理追蹤、執行理解、測試集建置及效能評估。此更新大幅提升 Claude Code 在評估集上的表現。

LangChain BlogMediaMar 4#cli#ai-agents#tracing
LangChain 技能強化 AI 代理

LangChain 技能強化 AI 代理

LangChain 推出首套技能,讓 AI 程式碼代理精通開源 LangChain 生態系統。技能聚焦使用 LangChain、LangGraph 及 Deep Agents 建置代理。此更新將 Claude Code 在評估集表現從 29% 提升至 95%。

LangChain BlogMediaMar 4#ai-agents#langgraph#evaluation
一致不等於對齊

一致不等於對齊

一項新研究發現,LLM 往往能與人類的道德判斷標籤一致,卻依賴不同的倫理原則與情境假設。研究團隊使用包含 500 個題目的 ETHICS 衍生基準,主張評估真正的對齊程度必須分析模型的推理依據。

🔬

偵測 LLM 幻覺的通用最低標準

一項預先註冊的研究在 10 個模型上評估 29 種模型內部訊號,結果顯示基於幾何的偵測器在大多數留出測試中都優於隨機機率。研究指出,或許存在通用的擬合程序,但目前沒有任何單一偵測器或訊號方向能在所有模型上可靠運作。

Reddit r/MachineLearningCommunityAug 3#evaluation#pre-registration
Page 3 of 6