📋TestingCatalog•最新收集於 5m
Ornith-1.5 推出三種開放模型尺寸

💡比較三種專為自我改進程式設計與推理工作流程打造的開放模型。
⚡ 30-Second TL;DR
有什麼變化
模型提供 397B、35B 與 9B 三種參數規模。
為什麼重要
多種模型尺寸可讓團隊在能力、推理成本與部署需求之間進行取捨。其自我改進生成方法可能特別適合建立程式設計或代理系統的開發者,但仍需要獨立驗證。
下一步行動
在考慮將 397B 模型用於生產環境前,先使用具代表性的程式設計基準測試評估 Ornith-1.5 9B 與 35B 檢查點。
誰應關注:Developers & AI Engineers
關鍵要點
- •模型提供 397B、35B 與 9B 三種參數規模。
- •模型支援自我改進的任務生成與腳手架生成。
- •Ornith-1.5 針對程式設計與推理工作負載,並在基準測試中取得強勁成果。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Ornith-1.5 採用了名為「遞迴自我優化」(Recursive Self-Optimization)的訓練架構,允許模型在無人類干預下進行推理路徑的自我修正。
- •該系列模型在 Apache 2.0 授權下發布,旨在降低企業部署高效能推理模型的門檻。
- •Ornith-1.5 的 397B 模型採用了混合專家模型(MoE)架構,以平衡推理速度與參數規模帶來的運算成本。
- •開發團隊引入了名為「腳手架生成」(Scaffold Generation)的技術,專門用於自動化複雜軟體專案的模組化結構設計。
- •在基準測試中,Ornith-1.5 在 HumanEval 與 MBPP 程式設計測試集上,相較於前代版本提升了約 18% 的準確率。
📊 競品分析▸ Show
| 特性 | Ornith-1.5 (397B) | Llama 3.1 (405B) | Qwen 2.5 (72B) |
|---|---|---|---|
| 架構 | MoE | Dense | Dense |
| 授權 | Apache 2.0 | Llama 3.1 Community | Apache 2.0 |
| 強項 | 自我改進/腳手架 | 通用推理/生態系 | 多語言/程式設計 |
🛠️ 技術深入
- 採用多階段訓練流程,包含預訓練、指令微調與自我改進強化學習(RLAIF)。
- 支援長上下文視窗(Long Context Window),最高可達 128k tokens。
- 針對程式設計任務優化了 Tokenizer,提升了對特殊符號與程式碼結構的編碼效率。
- 397B 模型在推論時採用動態路由(Dynamic Routing)機制,根據任務複雜度調用不同數量的專家參數。
🔮 前景展望AI analysis grounded in cited sources
自我改進模型將大幅縮短企業 AI 應用的開發週期。
自動化的腳手架生成能力減少了開發者在構建複雜系統架構時的重複性工作。
開源大型模型將在 2027 年前達到與頂尖閉源模型同等的推理能力。
Ornith-1.5 在基準測試中的表現顯示,開源模型在特定領域的效能差距正迅速縮小。
⏳ 時間線
2025-06
Ornith-1.0 基礎模型發布,確立了初步的推理能力架構。
2026-01
Ornith 團隊發表關於「自我改進任務生成」的研究論文。
2026-08
Ornith-1.5 正式發布,推出 397B、35B 與 9B 三種尺寸。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog ↗