
FirstResearch:科學發現代理的審計式問題構建框架
FirstResearch 引入了一種結構化的「研究問題證書」,使 LLM 生成的科學假設具備可檢查性和可審計性。該框架透過強制執行科學發現的明確推導約束,表現優於現有的基準代理。
直接匹配不多,已補上最新動態。
Tag: #first-principles4 results

FirstResearch 引入了一種結構化的「研究問題證書」,使 LLM 生成的科學假設具備可檢查性和可審計性。該框架透過強制執行科學發現的明確推導約束,表現優於現有的基準代理。
本文分析了馬斯克將宏大願景轉化為具體工程里程碑的獨特能力。他擅長識別航太、電動車與AI等產業中最困難的瓶頸,並透過系統性創新來解決這些問題。

管理層的雲谷交流與阿里的AI佈局構成潛在「互文」關係。二者皆指向對AI發展「第一性」的深層思考。這反映阿里對AI基礎的深刻洞見。

本文利用樹木質量主要來自大氣碳的生物學事實,隱喻 AI 安全領域中基礎知識的重要性。作者強調,僅擁有大量領域知識卻缺乏對底層原理的理解,在 AI 安全研究中可能存在風險。

量子位報導星海圖與產業夥伴共同討論具身智能從模型走向生產力的路徑。文章強調透過產業協作,推動具身智能真正落地到多個行業。

OpenAI 表示 Codex 活躍使用者已突破 2,000 萬,第三方追蹤數據則顯示其近期增速超越 Claude Code。Claude Code 目前規模仍較大且深受開發者採用,但隨著 Anthropic 接近早期市場飽和,其高速成長已經放緩。
中國多項臨床試驗正利用腦機介面,協助脊髓損傷患者站立與行走,並讓失明患者恢復有限的視覺感知。試驗結果差異很大,凸顯這項技術的潛力,以及目前在訊號採集、解碼與復健方面的限制。

據報 Alibaba 正合併電商業務、整合雲端與晶片業務,並將 Qwen 拆分為獨立子公司。報導亦涵蓋 Unitree 計畫登陸科創板、Anthropic 據傳的年化營收,以及 Alibaba 持續投入 AI 對利潤與現金流造成的壓力。

California 與其他 28 個州指控 Meta 設計 Facebook 和 Instagram 使其具成癮性、違反兒童隱私法,並隱瞞相關做法。檢方將其涉嫌採取的策略概括為「吸引、留住、收集、隱瞞」。

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。