🐯虎嗅•較早收集於 24m
API探針估算隱藏LLM參數

#parameter-estimation#factual-probes#black-box-reverseincompressible-knowledge-probes-(ikp)gpt-5.5claude-opus-4.7gemini-2.5-prodeepseek-v4
💡黑盒參數估算器稱GPT-5.5=9T—立即在你的API上測試(爭議激烈)
⚡ 30-Second TL;DR
有什麼變化
IKP資料集:1400個稀缺問題分7級,測試188個模型。
為什麼重要
可逆向工程閉源模型,但置信區間寬且方法受批評,可靠性有限。可能轉移模型比較焦點至事實容量而非基準。
下一步行動
建置IKP資料集並探測你的黑盒LLM API以估算參數量。
誰應關注:Researchers & Academics
關鍵要點
- •IKP資料集:1400個稀缺問題分7級,測試188個模型。
- •89個開源模型對數線性擬合(R²=0.917),事實準確率與參數量相關。
- •估計:GPT-5.5 ~9T、Claude 4.7 ~4T、Gemini 2.5 Pro ~1.2T(90%置信區間0.3-3倍)。
- •挑戰:合成資料微調、MoE vs 稠密模型差異動搖假設。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •IKP框架的核心機制在於利用「長尾知識」的檢索難度,透過模型在極低機率事實上的準確率衰減曲線,反推其內部參數的儲存容量。
- •研究指出,MoE(混合專家模型)架構對此估算方法造成顯著干擾,因為該方法難以區分『總參數規模』與『推理時啟動參數規模』,導致部分模型估算值存在數量級誤差。
- •該研究揭示了模型訓練資料中的『知識密度』與『參數量』之間存在非線性關係,這意味著透過合成資料進行蒸餾的模型,其參數估算值可能被嚴重高估。
🛠️ 技術深入
- •IKP(Inference-based Knowledge Probing)框架:採用對數線性回歸模型(Log-linear regression)建立事實準確率與參數量的映射關係。
- •資料集構成:包含1400個跨領域的長尾事實問題,依據維基百科與學術資料庫的引用頻率分為7個稀缺度等級(Rarity Tiers)。
- •統計模型限制:採用90%置信區間(Confidence Interval)進行估算,主要受限於模型推理時的溫度設定(Temperature)與提示詞工程(Prompt Engineering)對事實檢索能力的影響。
- •架構偏差修正:針對MoE模型,研究引入了『有效參數密度因子』,試圖修正因稀疏激活導致的參數規模誤判。
🔮 前景展望AI analysis grounded in cited sources
LLM廠商將加強對API輸出機率分佈的混淆處理
為了防止參數規模被逆向工程,廠商可能在API層面引入隨機噪聲或限制Logit輸出,以破壞IKP框架的統計基礎。
參數規模將不再是衡量模型能力的唯一指標
隨著IKP等研究揭示參數與性能的非線性關係,產業重心將從單純的參數量競賽轉向『單位參數知識密度』的優化。
⏳ 時間線
2025-11
研究團隊首次發布IKP框架預印本,提出利用長尾事實估算黑盒模型規模的概念。
2026-02
IKP框架更新至2.0版本,擴充了對MoE架構模型的修正演算法。
2026-04
基於IKP框架的最新評測報告發布,首次對GPT-5.5及Claude 4.7等模型進行參數規模估算。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



