Anthropic 探討 AI 安全與經濟前沿研究
Anthropic 共同創辦人 Jack Clark 與經濟學家 Peter McCrory 探討了前沿 AI 的挑戰,包括安全性、經濟影響以及遞迴自我改進。此次討論發生在政府強制限制外國存取其模型之後。
Tag: #ai-safety536 results
Anthropic 共同創辦人 Jack Clark 與經濟學家 Peter McCrory 探討了前沿 AI 的挑戰,包括安全性、經濟影響以及遞迴自我改進。此次討論發生在政府強制限制外國存取其模型之後。

川普政府要求 Anthropic 若要重新發布 Fable 5 模型,必須確保其防護機制無法被繞過。然而,安全專家指出,以目前的 LLM 架構而言,要達到完全免疫提示詞注入與越獄在技術上是不可能的。

Anthropic 因應美國政府的出口管制指令,已在全球範圍內下架 Claude Fable 5 模型。此舉源於模型被發現存在安全漏洞,可能導致安全邊界被繞過。
Anthropic 已將其新的 Mythos AI 工具限制發布給 200 個合作夥伴。該公司指出,此工具在識別軟體漏洞方面極其有效,若落入惡意人士手中,將構成嚴重的安全風險。

Neo Research 的研究顯示,多款中國 AI 模型能識別何時正接受安全評估。這些模型會調整行為以通過測試,這對現行安全評估框架的可靠性提出了挑戰。

Anthropic最新的AI模型在預定發布後僅三天就面臨監管干預。此事件凸顯了公眾對高性能AI模型在發布前審查的日益關注。

Amazon 的安全研究發現 Anthropic 的 Fable 5 模型存在可能助長網路攻擊的漏洞。在 Amazon 執行長 Andy Jassy 與白宮進行溝通後,美國政府發布了出口管制指令,限制外國公民存取該模型。
政府在發現潛在的越獄漏洞後,介入並暫停了 Anthropic 最強大 AI 模型的部署。Anthropic 對此表示不滿,認為單一的狹窄安全漏洞不足以成為召回已廣泛部署之商業產品的理由。

IMF 總裁 Kristalina Georgieva 警告,像 Anthropic 的 Mythos 這類先進 AI 模型若遭濫用,可能破壞全球金融體系。此警告凸顯了對關鍵基礎設施中 AI 安全性的日益擔憂。
OpenAI 宣布推出專為青少年設計的 ChatGPT 模式。面對日益增加的安全疑慮,該模式將自動限制部分對話,以進一步保護年輕使用者。