
算力,而非參數,才是 AI 智能的關鍵
唐杰指出,參數量並不是衡量 AI 能力的完整指標。更有意義的 Scaling Law 衡量方式是計算量,也就是訓練或推理所使用的 FLOPs。
Tag: #compute-efficiency19 results

唐杰指出,參數量並不是衡量 AI 能力的完整指標。更有意義的 Scaling Law 衡量方式是計算量,也就是訓練或推理所使用的 FLOPs。

一篇論文據稱指出,強化學習只會改變推理 token 的 1–3%。論文還宣稱,不使用 RL 也能以約千分之一的計算量重現類似成效。

對14家中國AI實驗室的實地考察顯示,儘管面臨嚴重的算力缺口,中國AI產業透過極致的效率優化與開源生態反饋,實現了極具競爭力的模型性能。

據報 Anthropic 正在早期洽談以約 60 億美元收購以色列 AI 效率新創 Decart,交易發生在其可能 IPO 之前。Decart 開發可跨 GPU 與專用加速器最佳化 AI 模型訓練與推理的軟體,可能降低 Anthropic 大規模運算成本。

SBCO 是一套針對具明確約束之規劃代理的自監督、驗證器驅動 harness 最佳化方法。它透過評分回饋改善代理輸出,不需人工標註或自我修改的元代理;在使用少 4 至 5.5 倍運算資源的情況下,仍能達到或超越客製化基準。
IBM 宣布在半導體製造領域取得突破,發表了全球首款 1 奈米以下晶片技術。這項發展是硬體微縮的重要里程碑,有望為 AI 運算基礎設施提供更強大且節能的效能。
本文指出,即使沒有發生「純軟體奇點」,全面自動化 AI 研發仍將顯著加速技術進程。文章強調了運算效率與遞迴自我改進如何為創新創造強大的回饋循環。

這項研究量化了前沿大型語言模型中的推理冗餘,發現 61% 到 93% 的推理步驟往往是不必要的。研究證明這種「過度思考」是當前長度無關結果獎勵訓練方法的結構性後果。

OpenAI的Sora據傳燒掉54億後失敗,被宣告「死了」。匿名中國模型僅用38秒生成影片,主宰排行榜。影片生成戰爭從模型能力轉向算力經濟與合規壁壘。

英偉達旗艦B200 GPU在典型使用中浪費60%的算力。普林斯頓研究人員開發技術,將利用率提升至71%,解決關鍵低效問題。甚至英偉達執行長黃仁勳也參考了他們的工作。