🕸️LangChain Blog•最新收集於 3h
用 Pytest 與 Vitest 執行 LangSmith 評估

💡將 LLM 評估導入團隊現有的 Pytest 或 Vitest/Jest 工作流程。
⚡ 30-Second TL;DR
有什麼變化
新增 Pytest 整合,用於執行 LangSmith 評估
為什麼重要
使用標準測試執行器,可降低 LLM 評估導入既有工程流程的門檻。團隊也能更容易將評估與應用程式的自動化測試一併執行。
下一步行動
將一項 LangSmith 評估加入現有的 Pytest 或 Vitest/Jest 測試套件,並在 CI 中與應用程式測試一同執行。
誰應關注:Developers & AI Engineers
關鍵要點
- •新增 Pytest 整合,用於執行 LangSmith 評估
- •新增 Vitest/Jest 整合,支援 JavaScript 與 TypeScript 測試流程
- •可透過既有測試框架執行 evals,提供新的評估方式
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 11 個來源。
🔑 增強重點摘要
- •此整合於 2025 年初隨 SDK v0.3.0 版本發布,旨在解決 LLM 應用非確定性輸出與傳統單元測試之間的鴻溝。
- •Python 整合採用裝飾器(Decorator)模式,開發者僅需標註 @pytest.mark.langsmith 即可自動同步測試案例至 LangSmith 資料集。
- •此機制支援在 CI/CD 流程中設定評估指標閾值,若 AI 模型效能低於預期,可自動阻斷部署流程。
- •該架構特別適用於處理異質性評估邏輯,即針對不同資料集範例需執行不同驗證規則的複雜場景。
- •此工具鏈已成為測試「深度代理」(Deep Agents)狀態機、工具呼叫路徑及最終回應一致性的關鍵技術手段。
📊 競品分析▸ Show
| 功能/平台 | LangSmith (Pytest/Vitest) | Arize Phoenix | Weights & Biases (W&B) Prompts |
|---|---|---|---|
| 測試框架整合 | 原生支援 Pytest/Vitest | 需透過 SDK 整合 | 透過 API 整合 |
| 評估方式 | 離線與線上評估 | 側重於追蹤與評估 | 側重於實驗追蹤 |
| 定價模式 | 依用量計費 | 企業級方案 | 依專案/團隊計費 |
🛠️ 技術深入
- 採用裝飾器模式(Decorator Pattern)將測試函數與 LangSmith 實驗追蹤器綁定。
- 支援將測試結果自動序列化並上傳至 LangSmith 平台,以進行追蹤(Tracing)與輸入/輸出儲存。
- 整合機制允許在測試執行期間動態注入評估器(Evaluators),針對特定測試案例執行自定義邏輯。
- 透過 SDK 橋接,將非確定性的 LLM 輸出轉化為可量化的指標(Metrics),並與 CI/CD 環境變數進行交互。
- 支援對多步驟代理(Multi-step Agents)的執行路徑進行斷言(Assertion),確保工具呼叫(Tool Calls)的正確性。
🔮 前景展望AI analysis grounded in cited sources
AI 軟體工程將全面採用測試驅動開發(TDD)模式。
隨著評估工具與標準測試框架的深度整合,開發者將能像編寫傳統程式碼一樣,為 AI 代理編寫可自動化的單元測試。
評估指標將成為 CI/CD 部署的關鍵門檻。
將評估結果納入自動化測試流程,意味著效能衰退將直接導致軟體發布失敗,從而強制提升 AI 應用的穩定性。
⏳ 時間線
2025-01
LangSmith SDK v0.3.0 發布,正式引入 Pytest 與 Vitest 整合功能。
2025-06
擴展對深度代理(Deep Agents)評估的支援,強化對多步驟執行路徑的追蹤能力。
2026-03
優化 CI/CD 整合流程,支援更細緻的評估指標閾值設定與自動化阻斷機制。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: LangChain Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。



