安全關鍵系統應成為 ML 基準嗎?
一則 Reddit 討論主張,真實世界的安全關鍵系統應成為機器學習系統的終極基準。文章提出可在飛機控制、高速鐵路煞車、核反應爐保護、醫療設備與鐵路平交道等領域測試 AI,並質疑這種做法對 2026 年而言是否過於激進。
Tag: #safety-critical9 results
一則 Reddit 討論主張,真實世界的安全關鍵系統應成為機器學習系統的終極基準。文章提出可在飛機控制、高速鐵路煞車、核反應爐保護、醫療設備與鐵路平交道等領域測試 AI,並質疑這種做法對 2026 年而言是否過於激進。
微調 Qwen2.5-Coder-14B-Instruct 名為 Steelman R5 14B,在自訂 Ada 編譯基準上勝過 Claude Opus 4.6(68.6% 對 42.1%)。在 HumanEval-Ada 上達成首個開放模型 pass@1 47.1%。可在 Hugging Face 和 Ollama 以 GGUF 量化取得。

LLM-T1D 結合了強化學習與 LLaMA 3.1 和 Qwen3 等大型語言模型,打造出透明且具備可解釋性的胰島素幫浦控制器。該系統在實現高血糖控制精度的同時,能為其醫療決策提供人類可讀的解釋。

NeuroNL2LTL 是一個神經符號框架,能將自然語言轉換為線性時序邏輯 (LTL) 並提供形式正確性保證。透過整合「驗證迴圈」訓練流程,該系統利用形式驗證結果作為強化學習的獎勵訊號,確保規格產出的高可靠性。
開發者因封閉集分類對 OOD 影像自信失敗,放棄 YOLO 用於安全關鍵的手持植物與真菌辨識裝置。改用分層 OOD 偵測,包括 EfficientNet B2 專用模型、MobileNetV3 路由器、能量評分與集成方法。管線在 Hailo 8L 的 13 TOPS 電池限制內運行。

PIER 是一種物理資訊離線強化學習框架,從歷史 AIS 數據和海洋再分析中學習燃料高效、安全的海運路由,無需線上模擬器或預測。它相較大圓路由將平均 CO2 排放減少 10%,並將墨西哥灣 2023 年航線的災難性燃料浪費從 4.8% 降至 0.5%。該方法燃料變異量降低 3.5 倍,並可轉移至野火疏散等領域。

Amazon 旗下的 Zoox 宣布召回 105 台自動駕駛計程車的軟體,原因是感知系統無法識別濃煙。此漏洞導致車輛會駛入危險的濃煙覆蓋區域,公司已向 NHTSA 提交報備。
BlackBerry 執行長 John Giamatteo 指出,他們的安全認證軟體不易被 AI 取代。他強調了關鍵任務系統對安全性與穩定性的獨特要求。

一名 Tesla Cybertruck 駕駛為了測試車輛的「涉水模式」功能,故意將車開入德州的一個湖泊中,導致車輛故障並需由當地警方協助拖吊。此事件凸顯了消費者對自動化或先進功能的預期與現實物理限制之間的落差。