
Galtea 籌資 320 萬美元助企業測試 AI 代理
Galtea 為巴塞隆納超級計算中心 18 個月前成立的衍生公司,由 42CAP 領投 Mozilla Ventures 參與,籌得 320 萬美元。该公司使用 AI 生成逼真測試情境,暴露企業 AI 代理的故障、幻覺、偏見及安全風險。這解決了演示與生產就緒 AI 之間的差距。
Tag: #ai-testing9 results

Galtea 為巴塞隆納超級計算中心 18 個月前成立的衍生公司,由 42CAP 領投 Mozilla Ventures 參與,籌得 320 萬美元。该公司使用 AI 生成逼真測試情境,暴露企業 AI 代理的故障、幻覺、偏見及安全風險。這解決了演示與生產就緒 AI 之間的差距。

UL Solutions 推出 UL 3115,這是一個結構化框架,用於在部署前後評估基於 AI 的產品。此標準因應 UL 從電子產品擴展至 AI 的安全測試需求。挑戰包括監管機構的認可及中國實驗室的的地緣政治問題。

Import AI 第 447 期涵蓋新興 AGI 經濟、透過生成遊戲測試 AI 的創新方法,以及代理生態。並推測超智能弧形城市的可能樣貌。

作者提出「體檢報告」式AI模型評測:結論前置、可重現快照、可執行評分、關鍵指標及典型案例,加速上線或修復決策。將基準視為資產,防洩漏維護並壞案例回歸。轉化評測為團隊系統加速迭代。

領先AI代理測試顯示權杖消耗量極大差異。缺乏成本透明度與成功保證。

傳統 AI 基準以人類對抗機器於孤立任務如西洋棋或編碼。此人機對比框架誘人卻有缺陷。亟需超越簡單比較的新評估方法。

文章分享生產自主 AI 代理的經驗,強調可靠性勝於模型自信,以避免如從 Slack 訊息誤讀導致重新安排董事會會議等災難。倡導分層可靠性架構,將傳統軟體模式適應 AI 的機率性質。提示工程與模型選擇為基礎,但電路斷路器對安全失敗至關重要。

Memvid 推出「AI 惡霸」工作,每日付 800 美元壓力測試聊天機器人。工作者逼迫 AI 至失效,暴露如遺忘上下文及重複錯誤等問題。這將常見聊天機器人挫折轉為付費機會。

加州新創公司 Memvid 提供日薪 800 美元的「AI 霸凌者」職位,專注測試領先聊天機器人的耐心與記憶力。此工作涉及挑釁 AI 以揭露不一致、遺忘、胡說或幻覺等問題,無需開會或處理郵件。這突顯了 AI 穩健性評估的獨特方法。