
Ornith-1.5 推出三種開放模型尺寸
Ornith-1.5 推出 397B、35B 與 9B 三種參數規模的開放模型。這些模型具備自我改進的任務與腳手架生成能力,並在程式設計與推理基準測試中展現強勁表現。
Tag: #coding37 results

Ornith-1.5 推出 397B、35B 與 9B 三種參數規模的開放模型。這些模型具備自我改進的任務與腳手架生成能力,並在程式設計與推理基準測試中展現強勁表現。

中國 AI 公司正透過軟體最佳化來應對不斷增加的推理需求,但高階 Nvidia 處理器的取得仍受到限制。國產晶片能支援部分推理工作負載,但複雜的程式編寫任務仍有一部分依賴稀缺的 Nvidia 運算能力。

Google DeepMind CEO 提議建立 FINRA 式的 AI 監管機構。同時,Nvidia 公布強勁的第一季營收,OpenAI 的 Codex 正演變為企業知識平台,以與 Cursor 和 Copilot 競爭。

Elon Musk 宣布 Grok V9-Medium (1.5T) 基礎模型已完成訓練。該模型納入了大量的 Cursor 數據,預計在強化學習完成後於 2 至 3 週內正式發布。

雖然 ChatGPT 證明了 OpenAI 的用戶基礎,但 Codex 的重啟旨在證明該公司的長期商業價值。它被定位為企業級編碼解決方案的核心引擎。

Anthropic 推出 Claude Opus 4.7,相較 Opus 4.6,大幅強化軟體開發能力,難關編碼達「全權委託」水準。影像辨識解析度超前代3倍以上。指示忠實度及長時間任務穩定性亦獲提升。

OpenAI 推出 GPT-5.4,專為程式碼撰寫、資料分析及簡報優化,具備原生電腦使用功能。改善桌面導航、網路研究,比 GPT-5.2 少 18% 錯誤。在 ChatGPT Thinking 模式提供給 Pro/企業用戶;權杖價格上漲。

SpaceXAI 推出 Grok 4.6,主打長時間運行的代理程式、程式設計與知識工作。該模型在 Artificial Analysis Intelligence Index 獲得 61 分,追平 GPT-5.6 Sol Max,同時提供每百萬輸入 token 2 美元、每百萬輸出 token 6 美元起的 API 定價。
Linus Torvalds 發布聲明釐清 Linux 核心專案並非「反 AI」。他反駁了部分反對在核心開發流程中使用 AI 與 LLM 的開發者。
Nemotron Cascade 2 30B-A3B 在 HumanEval 達 97.6%,超越 Qwen3.5 中型模型,在 ClassEval 達 88%。它是基於 Nemotron 自家架構的混合模型。IQ4_XS 量化版在本機表現優異。