
PETITE:導師-學生代理提升LLM編碼
PETITE 提出利用相同 LLM 的導師-學生多代理互動,提升編碼問題解決能力。學生代理生成並迭代程式碼,導師無需真值答案即提供結構化回饋。在 APPS 基準上,達到或超越 Self-Consistency 等 SOTA 方法,卻消耗更少 token。
直接匹配不多,已補上最新動態。
Tag: #peer-tutoring1 results

PETITE 提出利用相同 LLM 的導師-學生多代理互動,提升編碼問題解決能力。學生代理生成並迭代程式碼,導師無需真值答案即提供結構化回饋。在 APPS 基準上,達到或超越 Self-Consistency 等 SOTA 方法,卻消耗更少 token。

DelveRL 是一款專為訓練遊戲智能體打造的開源無盡回合制 Roguelike。它提供結構化 API、確定性模擬、程序化關卡、部分可觀測性與本機執行環境,內附的 recurrent PPO 基線模型可達到第 18 層的中位數成績。

中國 AI 與晶片公司正擴大股權計畫以留住工程師,其中 Cambricon 覆蓋 85.3% 的員工,AMEC 則超過 97%。這些異常廣泛的股權方案,反映半導體與 AI 人才市場的激烈競爭。

OpenAI 呼籲加州立法者強化 AI 安全法案 SB 53,而該公司先前曾反對這項法案。這項立場轉變顯示 OpenAI 對州層級 AI 監管的態度出現明顯變化。

一項新研究發現,領先的前沿 AI 實驗室幾乎沒有公開記錄遏制失控模型的程序。隨著先進系統展現出更多出乎預期且可能危險的行為,這種缺乏透明度的情況引發了外界疑慮。

Pony AI 2026 年上半年營收達 7,047 萬美元,幾乎年增一倍,Robotaxi 營收更暴增 534%。然而,公司淨虧損絕對額仍然擴大,毛利率低於 17%,其輕資產 L4 策略持續面臨商業化壓力。
中誠華隆推出 HL200 推理晶片及配套超節點智算叢集方案。該晶片最高可提供 4P FP4 算力,能效比達 5.12 TFLOPS/W,叢集規模則可擴展至 10,240 張卡。
一篇預印本指出,在 V1 比較中,評估影像解析度會大幅改變哪種 CNN 學習規則看起來最接近人腦。研究涵蓋六種影像解析度,發現未訓練模型在 V1 的表面優勢很大程度上是評估解析度造成的,而 backpropagation 在 LOC 仍保有優勢。

伽利略機器人在 WRC 發表「陸行具身系統」,旨在打通輪式與足式移動之間的底層技術壁壘。此次發表聚焦於將多種地面移動方式整合進具身機器人系統。

Magic Atom 在 WRC 2026 展示三大場景解決方案,呈現 Physical AI 如何在真實環境中運作。其核心概念是以一個智慧大腦驅動多種機器人形態。