Search

直接匹配不多,已補上最新動態。

Tag: #llm-judges3 results

RubricForge 降低代理評估中的誤判通過

RubricForge 降低代理評估中的誤判通過

RubricForge 從少量具備真實結果標註的代理軌跡中,自動生成可讀的人類評分規範,之後可在不存取環境的情況下套用固定規範。在 tau-bench 與 WebShop 上,它大幅降低失敗軌跡被誤判為通過的比例,並改善分級結果排序;但整體一致性並未顯著優於 G-Eval。

日本收緊 AI 硬體供應鏈

日本收緊 AI 硬體供應鏈

日本將阻焊劑、GaN 基板、永磁體、鈣鈦礦電池與閃爍體五類技術,納入技術轉移前的申報與審查框架。這項措施涵蓋海外子公司、合資企業、公司、大學與研究機構,可能影響半導體、機器人、AI 伺服器及感測器供應鏈。

ChatGPT 威脅通報促成逮捕

ChatGPT 威脅通報促成逮捕

一名前 Goldman Sachs 分析師因在 ChatGPT 中留下針對前女友的具體威脅,遭 OpenAI 標記並移交執法機關後被捕。這起案件凸顯 AI 聊天記錄可能成為司法證據,也引發對隱私、威脅偵測標準與平台通報義務的討論。