
Qwen 榮登華爾街辦公 Agent 實測第一
華爾街對全球 8 款主流 Agent 進行實測後,Qwen 在辦公場景綜合排名第一。這項比較也指出,成本正成為 Agent 商業化過程中日益重要的考量因素。
Tag: #cost-efficiency21 results

華爾街對全球 8 款主流 Agent 進行實測後,Qwen 在辦公場景綜合排名第一。這項比較也指出,成本正成為 Agent 商業化過程中日益重要的考量因素。
本文分析了 DeepSeek 如何通過優先考慮推理效率和開源生態,而非盲目追求參數規模和閉源模型,從而挑戰行業慣例,證明了個體的判斷力可以超越系統慣性。
百度正式發布新一代基礎大模型文心大模型 5.1。採用「多維彈性預訓練」技術,以業界同規模模型約6%的預訓練成本,達到領先效果,登上LMArena搜索榜國內第一。

YC-Bench 基準測試模擬 LLM 經營一年初創公司,包含延遲回饋與惡意客戶。GLM-5 平均資金達 121 萬美元,接近 Claude Opus 的 127 萬美元,但 API 成本僅 1/11。持續筆記本使用預測成功。

Luma AI 推出 Uni-1 圖像生成模型,在推理基準測試中超越 Google Nano Banana 2 和 OpenAI GPT Image 1.5,成本低 10-30%。它開創自回歸生成取代擴散模型,讓創作過程實現統一推理,提升企業工作流程效率。

Google 推出 Gemini 3.1 Flash-Lite,為 Gemini 3 系列中最具成本效益的模型,價格僅 Gemini 3.1 Pro 的八分之一。它比 Gemini 2.5 Flash 提供 2.5 倍更快的首 token 時間及 45% 更高的輸出速度(每秒 363 token)。新增思考等級功能,可動態調整推理強度以平衡速度與深度。
OrcaRouter 引入了一種多模型協作方法,其性能優於單一大型模型,為 Fable 5 提供了一種具成本效益的替代方案。
一款參數規模僅為1B的HRM模型近期備受矚目,獲得了HuggingFace執行長及Bengio團隊的背書。該模型證明了以極低的運算成本即可實現高品質的獎勵建模。

字節跳動的 Volcano Engine 推出基於開源 OpenClaw 的雲端代理工具 ArkClaw。公司押注未來 AI 將依賴更便宜的 token、更高的推理效率及更長的上下文窗口。代理相關 token 使用量正從個位數百分比快速成長。

Perceptron 推出旗艦影片分析推理模型 Mk1,比 Anthropic 的 Claude Sonnet 4.5、OpenAI 的 GPT-5 及 Google 的 Gemini 3.1 Pro 便宜 80-90%。定價為每百萬輸入 token 0.15 美元、輸出 1.50 美元,在 EmbSpatialBench (85.1) 和 VSI-Bench (88.5) 等空間與影片基準測試中表現出色。提供公開演示網站供測試。