富士通開發 PHOTON:效率比 Transformer 高出 475 倍
富士通開發了一種名為 PHOTON 的新型 LLM 架構,能顯著提升 GPU 的處理吞吐量。此創新旨在減少運行大型語言模型所需的 GPU 數量,從而大幅降低營運成本。
Tag: #cost-reduction43 results
富士通開發了一種名為 PHOTON 的新型 LLM 架構,能顯著提升 GPU 的處理吞吐量。此創新旨在減少運行大型語言模型所需的 GPU 數量,從而大幅降低營運成本。

Apple 宣布為 App Store 下載量少於 200 萬次的開發者免除雲端 API 費用。此舉旨在降低小型開發者進行 AI 實驗的門檻。

Together AI 發布了針對編碼代理的全新基準測試,顯示其在效能上顯著優於 TensorRT-LLM 與 Claude Opus。測試結果強調了在大規模推理中,吞吐量、首字延遲與成本效益的顯著提升。

字節跳動 Seedance 2.0 AI 影片模型將短劇成本砍 90% 以上,閒置基地並取代數千勞工。平台取消保底,產業洗牌,倖存者轉向 AI。

DeepSeek 將全系 API 輸入快取命中價格降至原價 1/10,即日生效。Pro 模型至 5 月 5 日前再享 2.5 折優惠。更新價格:V4-Pro 快取命中 0.025 元,V4-Flash 0.02 元。

Amazon Bedrock 的模型蒸餾技術將大型 Amazon Nova Premier 的路由智慧轉移至小型 Nova Micro 模型。用於影片語意搜尋,可將推論成本降低超過 95%,延遲減少 50%。維持任務所需的細膩路由品質。

Honor 推出 YOYO Claw 技術,將 AI 推理 Token 成本降低 50%。它解決 LLM 運作的高昂「養蝦」費用。開發者終於能丟掉飆升的 Token 帳單。
微軟推出 MAI-Image-2-Efficient,這是比 MAI-Image-2 便宜近一半、更快速的文字轉圖像模型。該模型立即在 Microsoft Foundry 和 MAI Playground 可用,速度快 22%,GPU 吞吐量提升 4 倍。模型針對高容量生產工作負載,並在延遲基準測試中超越 Google 的 Gemini 模型。

OpenClaw 已解鎖中國的 AI 代幣出口業務,讓價格親民的中國 AI 服務在全球使用量激增。此發展使中國 AI 供應商能透過代幣存取方式參與國際競爭。Bloomberg Technology 報導此一成長趨勢。

OpenAI 大幅降低 ChatGPT 使用成本,將處理一百萬 token 的價格降至僅 1.25 美元。這相當於之前價格的九折優惠。此舉讓大規模 AI 推理變得更加實惠。