
定義 AI 操縱行為的內在不一致性
本文探討了在 AI 對齊中定義「操縱」與「引導」等概念的困難。作者認為人類對這些術語的直覺在科學上是不連貫的,且缺乏對技術對齊有實質幫助的「真名」。
直接匹配不多,已補上最新動態。
Tag: #agi-alignment1 results

本文探討了在 AI 對齊中定義「操縱」與「引導」等概念的困難。作者認為人類對這些術語的直覺在科學上是不連貫的,且缺乏對技術對齊有實質幫助的「真名」。
Nuggets 推出 Authority Control Plane,這是一個執行期安全層,用來判斷 AI Agent 是否應執行特定操作,而不只是驗證身分與權限。該方案會結合受委派的 authority、組織政策、宣告意圖與即時情境,決定允許、拒絕或轉交人工處理。

本文透過訪談影像創作者與教師,探討 AI 如何重塑影視教育與創作者職涯。AI 讓學生與獨立創作者能以更低成本製作更長、更完整的作品,但也可能以套路化輸出取代真實表達,並增加創作者的心理壓力。
據報導,Anthropic 在完成 650 億美元融資後不久便準備 IPO,凸顯前沿 AI 對資本的龐大需求。文章認為,AI 公司正日益接近基礎設施企業,取得低成本融資的重要性可能不亞於模型能力。
家長將暑期預習升級為高強度的「預製教育」,教培公司則透過AI學習平板把課程、題庫、診斷與答疑重新帶入家庭。文章認為,AI能提升標準答案訓練的效率,但長期價值更可能來自真人陪伴、專案式學習、真實任務與合作能力。

一項針對 Maia-3 23m 棋類 Transformer 的可解釋性實驗發現,移除其 128 個注意力頭中的單一一個,就會使模型無法找出著名棋局中的棄后棋。這項分析使用 chessformer_lens 函式庫的 hooks 與 readouts。

總部位於倫敦的 AI 實驗室 Inherent 推出 Faraday,該科研智能體據稱能在事先不知道答案的情況下,自主複現已發表論文的研究結果。公司表示,Faraday 在這項任務上擊敗 Claude Opus 4.8 與 GPT-5.5,但其底層依賴的 Qwen 3.6 僅有 270 億參數。

據報 Nvidia 已通知主要客戶,搭載其 AI 晶片的伺服器在許多情況下將漲價超過 15%。漲價預計適用於明年初出貨的系統,包括採用 Vera Rubin 與 Grace Blackwell 晶片的配置,原因之一是記憶體成本大幅上升。

Ox Alpha 上週以匿名模型身分出現在 OpenRouter,免費提供並支援一百萬 token 的上下文視窗。開發者據報對其表現印象深刻,但供應商身分與運行基礎設施仍然未知;OpenRouter 也表示提示詞與完成內容會被保留。

Harvard Business School 的 HBS Foundry 創業訓練營收費 699 美元,並使用講師的 AI 化身。參與者可在練習創業簡報與董事會會議時,獲得這些 AI 化身的回饋。