來源較早收集於 40m

利用大型視覺語言模型重現 Picbreeder

閱讀原文: ArXiv AI
#open-endedness#generative-ai

了解如何利用 VLM 在 AI 系統中實現開放式、自主的發現與創意演化。

30 秒速覽

有什麼變化

使用自主 VLM 重現了以人類為驅動的 Picbreeder 實驗。

為什麼重要

這項工作為理解 AI 如何實現開放式發現提供了一個框架,這是邁向自主科學與創意代理的關鍵一步。它突顯了 VLM 從簡單的提示回應任務演變為生成式、探索性系統的潛力。

下一步行動

複製 https://github.com/smearle/picbreeder-vlm 儲存庫,實驗不同的 VLM 架構如何影響生成視覺輸出的多樣性。

誰應關注:Researchers & Academics

關鍵要點

  • 使用自主 VLM 重現了以人類為驅動的 Picbreeder 實驗。
  • 分析了 AI 生成圖像中的系統發生複雜度以及視覺與語義的新穎性。
  • 識別了影響開放式生成能力的關鍵因素,包括行為多樣性與敘事記憶。
  • 提供開源實作,供進一步研究 AI 創造力使用。

深度解析

背景與延伸:來自公開資料,非原文內容。引用 21 個來源。

增強重點摘要

  • 原始 Picbreeder 實驗利用基於神經演化增強拓撲 (NEAT) 演算法演化的組合模式生成網路 (CPPNs) 來表示圖像,這些網路能夠產生具有遞增複雜度和有機外觀的圖像。
  • Picbreeder 的核心創新在於其協作式互動演化機制,允許使用者從其他人的圖像「分支」並繼續演化,從而培養了社會維度並克服了單一使用者疲勞的問題。
  • 原始 Picbreeder 證明了有趣的發現往往源於無目標的探索,而非目標導向的演化,使用者會憑藉對新穎事物的直覺進行選擇。
  • 大型視覺語言模型 (VLM) 是多模態系統,結合了視覺編碼器和解碼器風格的大型語言模型 (LLM),並透過大規模圖像-文本數據集進行訓練,使其能夠跨模態進行開放式推理和生成。
  • 當前研究指出,雖然生成式 AI 可以提升個體創造力,但在集體層面上可能導致創意產出的同質化,這項 VLM 重現 Picbreeder 的研究可能旨在解決或凸顯此挑戰。

競品分析

核心技術
本研究 (VLM 重現 Picbreeder)
自主 VLM 代理,取代人類使用者進行圖像演化與選擇。
Picbreeder (原始)
互動式演化計算 (IEC),基於 NEAT 演算法演化的 CPPNs。
Artbreeder
基於生成對抗網路 (GANs) 的圖像混合與演化。
VisionLLM
基於 LLM 的框架,將圖像視為外語,透過語言指令統一視覺與語言任務。
生成機制
本研究 (VLM 重現 Picbreeder)
VLM 驅動的開放式生成,分析探索性雜訊、行為多樣性與記憶的影響。
Picbreeder (原始)
人類使用者透過選擇圖像進行迭代演化,利用分支機制實現協作。
Artbreeder
允許使用者在 GAN 的潛在空間中混合、變異圖像,以探索新的視覺形式。
VisionLLM
透過語言指令實現開放式視覺任務的推理、生成與接地,支援細粒度到粗粒度的任務客製化。
目標
本研究 (VLM 重現 Picbreeder)
探索 AI 的開放式生成能力,評估 AI 代理如何產生新穎視覺形式。
Picbreeder (原始)
透過協作式互動演化,讓非專業使用者創造複雜且新穎的藝術圖像。
Artbreeder
提供一個平台,讓使用者能輕鬆探索和創造多樣化的圖像,如肖像、風景等。
VisionLLM
建立一個通用型視覺語言模型,能夠處理數百種視覺-語言任務,實現開放式視覺理解、感知和生成。
主要輸入
本研究 (VLM 重現 Picbreeder)
初始圖像/參數,VLM 內部決策。
Picbreeder (原始)
初始圖像或現有圖像的分支,人類使用者選擇。
Artbreeder
基礎圖像、使用者調整參數。
VisionLLM
圖像與自然語言指令。
創造力來源
本研究 (VLM 重現 Picbreeder)
AI 代理的探索性雜訊、行為多樣性與敘事記憶。
Picbreeder (原始)
人類使用者的主觀偏好與協作分支。
Artbreeder
GAN 潛在空間的探索與人類引導。
VisionLLM
LLM 的零樣本能力與語言指令的靈活性。

技術深入

  • 原始 Picbreeder 的圖像表示:使用組合模式生成網路 (CPPNs)。CPPNs 是一種神經網路,包含餘弦、正弦、高斯、恆等和 sigmoid 等激活函數,旨在捕捉自然界中常見的規律(例如對稱性、重複性、帶變化的重複性),且不帶有意的美學偏見。
  • 原始 Picbreeder 的演化演算法:採用神經演化增強拓撲 (NEAT) 演算法來演化 CPPNs。NEAT 演算法從簡單的網路結構開始,透過逐步增加複雜性(添加節點和連接)來演化網路拓撲和權重,並透過物種化來保護創新。
  • 大型視覺語言模型 (VLM) 的通用架構:大多數 VLM 將預訓練的視覺編碼器(如 Vision Transformer, ViT)與大型語言模型 (LLM) 主幹配對,透過學習的投影層或跨模態注意力機制將視覺特徵轉換為語言模型可解釋的表示。它們透過大規模多模態數據集(包含圖像-文本對)進行端到端訓練,並透過指令微調和人類回饋強化學習 (RLHF) 進行優化。
  • 本研究的 VLM 應用:研究透過自主 VLM 取代人類使用者,以重現 Picbreeder 實驗。這意味著 VLM 代理負責圖像的選擇和「繁殖」步驟,可能基於內部標準或學習到的美學進行評估,並為後續世代生成新的提示或參數。研究特別分析了探索性雜訊、行為多樣性與記憶對創意輸出的影響,暗示 VLM 的內部狀態和探索策略是其開放式生成能力的關鍵因素。

前景展望基於引用來源的 AI 分析

AI 驅動的開放式生成系統將透過自主探索廣闊的設計空間,加速科學發現和藝術創作。
透過消除人類在迭代選擇中的瓶頸,VLM 可以在適應度主觀或難以形式化的領域中快速發現新穎的形式和解決方案。
對 AI 在此類開放式任務中「創造過程」的研究將為創造力本身的本質提供新的見解。
分析 AI 代理如何產生新穎性、管理複雜性並利用記憶,可以揭示創造性思維背後的計算原理。
未來的人機協作創作平台將整合 VLM 驅動的探索與人類美學指導,以實現前所未有的創意成果。
結合 AI 生成多樣化選項的能力與人類主觀評估,可以克服純粹人類和純粹 AI 驅動的創造力的局限性。

時間線

1973
Harold Cohen 開發了開創性的 AI 藝術軟體 AARON,開始根據美學構圖規則生成原創作品。
2002
Kenneth Stanley 和 Risto Miikkulainen 開發了神經演化增強拓撲 (NEAT) 演算法。
2007-08
Picbreeder 網站向公眾開放,允許使用 CPPN-NEAT 進行協作式互動圖像演化。
2011
一篇案例研究進一步討論了 Picbreeder 作為協作式互動演化系統的優勢、挑戰和缺點。
2020
Picbreeder 網站由一個新團隊重新啟動。
2022
大型視覺語言模型 (LVLMs) 的發展迅速加速,整合了視覺感知和自然語言理解。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。