
ChatGPT 新預設模型醫金誤導減半
OpenAI 以 GPT-5.5 Instant 取代 GPT-5.3 Instant 成為 ChatGPT 預設模型。在醫學、法律及財務問題上,幻覺聲明減少 52.5%。此更新提升敏感查詢的可靠性。
Tag: #reliability44 results

OpenAI 以 GPT-5.5 Instant 取代 GPT-5.3 Instant 成為 ChatGPT 預設模型。在醫學、法律及財務問題上,幻覺聲明減少 52.5%。此更新提升敏感查詢的可靠性。

研究人員揭示浮點數捨入誤差如何透過 Transformer 層中的混沌傳播導致 LLM 不可預測性。他們在早期層中識別出「雪崩效應」,並定義三種獨特狀態:穩定、混沌及訊號主導。結果已在多個資料集及模型架構中驗證。

Anthropic 意外發布 Claude Opus 4.7。它被定位為可靠而非最強模型。此發布預計將令 OpenAI 的 Sam Altman 感到不安。

NeuBird AI 推出 Falcon,這是一款自主 AI 代理,可預防、偵測並修復軟體問題,同時完成 19.3 百萬美元融資。該公司轉向使用基於即時企業脈絡的 AI 實現事件避免,而非傳統回應。一份報告顯示,高管(74%)與工程師(39%)在可靠性 AI 使用上存在 35 個百分點的「AI 落差」。

Andrej Karpathy 的「九九大法」說明為何 90% AI 可靠性不足以用於生產環境,每多一「九」皆需等量工程努力。在多步驟代理工作流程中,失敗會指數級累積,企業級需達每步 99.99% 成功率。文章概述 SLO 指標及九大槓桿如工作流程圖來提升可靠性。
作者認為以 Token 計價是衡量 LLM 成本的誤導性指標,因為它忽略了多步驟代理工作流程中的「驗證稅」與可靠性衰減。真實成本必須考量隨著鏈長增加而呈幾何級數增長的失敗率。

SpaceX 的 Falcon 9 助推器已達到五週年紀念,並創下了重複使用的新紀錄。這一里程碑凸顯了可重複使用發射基礎設施的成功。
OpenAI 目前正在調查導致用戶無法登入 ChatGPT 或進行對話的技術問題。根據 Downdetector 的數據,已有約 5,000 名用戶受到此次服務中斷的影響。

Shawn Bice 自 2022 年離開 AWS 加入微軟安全部門後,即將重返 AWS 擔任 AI 服務副總裁。他將領導 Swami Sivasubramanian 的 Agentic AI 組織下的 Automated Reasoning Group。重點在於提升 AI 代理的可靠性。

花旗、Home Depot 與 Capcom 高管分享打造金融錢包、房屋服務及遊戲的 AI 代理早期經驗。AI 代理正從實驗工具快速轉向客戶端應用。關鍵挑戰在於處理真實金錢、購物者及創意產出的治理與可靠性。