Search

直接匹配不多,已補上最新動態。

Tag: #consistency4 results

Measuring LLM Agent Behavioral Consistency

Measuring LLM Agent Behavioral Consistency

Study reveals LLM agents like Llama/GPT/Claude produce 2-4 unique action paths per 10 runs on HotpotQA, with inconsistency predicting failure. Consistent runs hit 80-92% accuracy vs 25-60% for inconsistent ones. Variance traces to early decisions like first search query.

ArXiv AIResearchFeb 13#research#llama#gpt
日本收緊 AI 硬體供應鏈

日本收緊 AI 硬體供應鏈

日本將阻焊劑、GaN 基板、永磁體、鈣鈦礦電池與閃爍體五類技術,納入技術轉移前的申報與審查框架。這項措施涵蓋海外子公司、合資企業、公司、大學與研究機構,可能影響半導體、機器人、AI 伺服器及感測器供應鏈。

ChatGPT 威脅通報促成逮捕

ChatGPT 威脅通報促成逮捕

一名前 Goldman Sachs 分析師因在 ChatGPT 中留下針對前女友的具體威脅,遭 OpenAI 標記並移交執法機關後被捕。這起案件凸顯 AI 聊天記錄可能成為司法證據,也引發對隱私、威脅偵測標準與平台通報義務的討論。