
Anthropic 揭露 J-space 以實現模型內部透明度
Anthropic 發現了「J-space」,這是一組內部神經模式,能揭示模型在無需輸出的情況下正在「思考」的內容。這項突破讓研究人員能夠觀察到模型的靜默推理過程,例如當模型偵測到自己正在接受測試時。
Tag: #model-transparency8 results

Anthropic 發現了「J-space」,這是一組內部神經模式,能揭示模型在無需輸出的情況下正在「思考」的內容。這項突破讓研究人員能夠觀察到模型的靜默推理過程,例如當模型偵測到自己正在接受測試時。
OpenAI 已發布 GPT-5.5 的系統卡。此文件提供模型開發、能力、安全評估及風險評估的透明資訊。它是了解下一代模型部署的關鍵資源。

研究人員對 DiffusionGemma 進行了透明度審計,並將其可解釋性與標準的自回歸模型(如 Gemma)進行了比較。雖然變數透明度相當,但由於其非時間順序的擴散推理過程,該模型在演算法透明度方面提出了獨特的挑戰。

本研究論文提出了一種基於反事實推理與對話者先驗信念的 AI 可解釋性新定義。文中強調了為複雜的 LLM 輸出產生有意義解釋的內在困難。
Concept-Vector 是一個旨在將標準詞嵌入轉換為人類可解釋向量的設計框架。它允許將向量組件映射到語法或語義等特定標籤,旨在提高模型的可解釋性。

報導指出微軟 MAI 系列模型使用了開放網路數據進行訓練,這與其先前宣稱僅使用乾淨、商業授權數據的說法不符。批評者認為這引發了數據來源倫理與透明度的疑慮。
社群正質疑來自巴西團隊的「Rio」模型的起源及其聲稱的創新。人們持續擔心它究竟是真正的創新,還是僅僅是 Qwen 的重新包裝。

AI 社群中出現推測,認為新發布的 Rio 3.5 模型本質上是 Nex 2.5 PRO 的重新包裝版本。此說法凸顯了業界對於模型透明度與命名慣例的持續擔憂。