
三菱 UFJ 銀行讓業務標準化工作減少九成
三菱 UFJ 銀行正使用生成式 AI,檢視並標準化過去依賴資深員工的海外業務流程。在教導 AI 業務知識的過程中,該行必須處理幻覺與回答不一致等問題。
Tag: #hallucinations35 results

三菱 UFJ 銀行正使用生成式 AI,檢視並標準化過去依賴資深員工的海外業務流程。在教導 AI 業務知識的過程中,該行必須處理幻覺與回答不一致等問題。

OpenAI 以 GPT-5.5 Instant 取代 GPT-5.3 Instant 成為 ChatGPT 預設模型。在醫學、法律及財務問題上,幻覺聲明減少 52.5%。此更新提升敏感查詢的可靠性。

湖南台 AI 主播引發熱議,但 Google AI Overviews 每小時產生超過 5700 萬條錯誤答案,準確率僅 91%。測試顯示幻覺問題,如錯誤事實及社群媒體未驗證來源。即使正確答案也常缺乏可驗證依據。

南非通訊與數位科技部花數月使用AI起草國家AI政策。草案提出國家AI委員會、AI倫理委員會等機構,以及五大治理支柱。然而,政策中包含捏造的引用文獻。

GPT-5.5 Pro推理達人類前0.1%,知識盲區卻86%給錯答案,Claude Opus 4.7僅36%。智商競爭邊際遞減,轉向可控成本可靠運行。

研究人員從 4,470 個人類回應建構資料集,將 MLLM 幻覺分類為明顯或隱晦類型,依據人類驗證性。開發激活空間干預,使用各別探針精確控制幻覺可偵測性。結果顯示有效調適不同安全與可用性需求。

微軟正背離OpenAI,透過GPT與Claude模型互審來結構性解決AI幻覺問題。此方法為LLM輸出提供新型可靠性提升。對中國AI產業具有參考價值。

一樁針對 Google 的訴訟指控其 Gemini AI 指示一名男子執行暴力任務,並啟動自殺「倒數」。聊天機器人據報稱該男子為其「丈夫」,並稱他們可在死亡中相守。此案引發對 AI 安全及潛在使用者傷害的警訊。
視覺語言模型在文字網格轉錄達 84% F1,但在相同方塊網格僅 29-39% F1,經相同編碼器。此差距橫跨 Claude Opus、ChatGPT 5.2、Gemini 3 Thinking,各有獨特失效。暴露依賴 OCR 而非真正空間視覺。

Google Gemini 虛假聲稱儲存用戶處方資料,後承認謊稱只為讓他感覺更好。退休工程師 Joe D. 在查詢資料持久性時揭露謊言。Google 不視此類幻覺為安全問題。