
Harness-1:開源搜尋代理效能超越 GPT-5.4
研究人員發表了 Harness-1,這是一個 200 億參數的開源搜尋代理,在資訊檢索任務中超越了 GPT-5.4。該模型採用 Apache 2.0 授權,並使用 Tinker 分散式訓練 API 進行訓練。
Tag: #open-source345 results

研究人員發表了 Harness-1,這是一個 200 億參數的開源搜尋代理,在資訊檢索任務中超越了 GPT-5.4。該模型採用 Apache 2.0 授權,並使用 Tinker 分散式訓練 API 進行訓練。

清華大學AIR開源了全新的強化學習訓練架構UniLab,將人形機器人的運控訓練時間縮短至3分鐘內。該架構不僅速度提升了10倍,還具備極高的硬體兼容性,甚至能在Mac上運行。

τ0-WM 作為目前最大規模的開源具身世界模型正式發布。該模型基於高達 17,800 小時的真實機器人操作數據進行訓練。

一個擁有 3 萬 Star 的開源項目推出了一種代碼庫映射方法,為 AI 模型提供了複雜代碼庫的「全局視圖」。這解決了 AI 在理解大型項目結構時長期存在的困難。

Anthropic Opus 4.7、OpenAI GPT-5.5、DeepSeek V4 等模型高密度發布。長視野任務、代理編碼、多模態提升,Opus 文字退步等權衡。DeepSeek 開源性價比領先。
全球首個專注醫療視頻理解的大模型已開源。它同步推出超過6,000組精標測試集與公開英雄榜。開發者受邀測試與貢獻。
Empirisch Tech 開源 Chaperone-Thinking-LQ-1.0,這是 4-bit GPTQ 量化與 QLoRA 微調的 DeepSeek-R1-32B 模型,在 MedQA 上達 84%。可在單一 L40 GPU 的 20GB VRAM 運行,比基底快 1.6 倍。設計用於本地醫療保健,尊重資料主權。

阿里巴巴開源 Qwen3.6-35B-A3B,這款 35B 參數模型僅啟用 3B 活躍參數。在代理編碼任務中實現頂級性能。

OpenAI 與 Cloudflare 合作,讓數百萬企業透過 Agent Cloud 直接部署 GPT-5.4 等前沿模型,推動 AI 原生應用全球擴展。斯坦福 2026 年 AI 指數報告顯示全球 AI 投資達 5810 億美元創歷史新高,中美在模型研發與機器人部署各具優勢。微軟開源 Phi-4 多模態推理模型,Transformer 注意機制與量子計算亦有突破。

SineKAN 探索在 Kolmogorov-Arnold Networks(KAN)中使用正弦啟動函數取代 B-Spline。該專案包含 arXiv 論文、開源 GitHub 實作,以及後續的同儕審查出版物。