
Gemma 4 以 0.20 美元/次主宰基準測試
Gemma 4 31B 在 FoodTruck Bench 上達到 100% 存活率與 +1,144% 中位 ROI,超越 GPT-5.2、Gemini 3 Pro 及所有測試的中國開源模型。只有 Opus 4.6 勝過它,但成本高 180 倍,為每次 0.20 美元。在 22 個測試模型中具最佳成本效能比。
直接匹配不多,已補上最新動態。
Tag: #cost-performance4 results

Gemma 4 31B 在 FoodTruck Bench 上達到 100% 存活率與 +1,144% 中位 ROI,超越 GPT-5.2、Gemini 3 Pro 及所有測試的中國開源模型。只有 Opus 4.6 勝過它,但成本高 180 倍,為每次 0.20 美元。在 22 個測試模型中具最佳成本效能比。

Anthropic 推出最新 Claude Sonnet,具備 Opus 級智能與優異性價比。是 OpenClaw 的最佳 API 選擇。模型在電腦操作接近人類水平。

Gemini 3.7 Flash 被描述為一次突襲式發布,主打接近旗艦模型的效能與大幅降低的價格。文章也指出,DeepMind 新任主管正重新塑造市場的成本效能競爭門檻。

Yann LeCun 讚揚中國開源模型以超過 10 倍性價比征服矽谷。此發展標誌開源 AI 進入「中國時間」。

OpenAI 表示 Codex 活躍使用者已突破 2,000 萬,第三方追蹤數據則顯示其近期增速超越 Claude Code。Claude Code 目前規模仍較大且深受開發者採用,但隨著 Anthropic 接近早期市場飽和,其高速成長已經放緩。
中國多項臨床試驗正利用腦機介面,協助脊髓損傷患者站立與行走,並讓失明患者恢復有限的視覺感知。試驗結果差異很大,凸顯這項技術的潛力,以及目前在訊號採集、解碼與復健方面的限制。

據報 Alibaba 正合併電商業務、整合雲端與晶片業務,並將 Qwen 拆分為獨立子公司。報導亦涵蓋 Unitree 計畫登陸科創板、Anthropic 據傳的年化營收,以及 Alibaba 持續投入 AI 對利潤與現金流造成的壓力。

California 與其他 28 個州指控 Meta 設計 Facebook 和 Instagram 使其具成癮性、違反兒童隱私法,並隱瞞相關做法。檢方將其涉嫌採取的策略概括為「吸引、留住、收集、隱瞞」。

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。

Cloudflare 推出 Agent Tracing,支援設定 Payload 截斷限制。不同支援的 Agent 框架在 Payload 預設記錄策略上有所差異,因此開發者在設定可觀測性時需要檢查各框架的個別設定。