
CADSmith:多代理CAD生成與幾何驗證
CADSmith 是一個多代理管道,從自然語言生成 CadQuery 程式碼,透過巢狀迴圈精煉:內迴圈修正執行錯誤,外迴圈使用 OpenCASCADE 度量與 VLM 視覺評估進行幾何驗證。它採用 API 文件的檢索增強生成,無需微調。基準測試顯示 100% 執行率,F1 分數提升至 0.9846、IoU 至 0.9629,Chamfer 距離降至 0.74。
Tag: #multi-agent248 results

CADSmith 是一個多代理管道,從自然語言生成 CadQuery 程式碼,透過巢狀迴圈精煉:內迴圈修正執行錯誤,外迴圈使用 OpenCASCADE 度量與 VLM 視覺評估進行幾何驗證。它採用 API 文件的檢索增強生成,無需微調。基準測試顯示 100% 執行率,F1 分數提升至 0.9846、IoU 至 0.9629,Chamfer 距離降至 0.74。
AIfred Intelligence 在審判多代理模式下,對9款模型(80B-235B)進行「狗 vs 貓」辯論基準測試。Qwen3-Next-80B-A3B 僅3B活躍參數,即匹配235B品質且速度快3倍。硬體使用4張GPU共120GB VRAM搭配llama.cpp。

京東開源其大語言模型 JoyAI-LLM Flash,並在最新《數智周報》中推出「龍蝦天團」。此發布支持智能體式 AI 進展,伴隨 OpenAI Sora 應用程式終止運營及阿里達摩院新型 CPU 等新聞。周報涵蓋 3 月 23-28 日關鍵發展。

成立僅九個月的 Isara 募得 9400 萬美元,估值 6.5 億美元,用於協調數千 AI 代理處理複雜任務的軟體。OpenAI 是投資者之一。由兩位 23 歲創辦人成立,尚未有產品。

AnalogAgent 是一個無需訓練的框架,整合基於 LLM 的多代理系統與自進化記憶,用於類比電路設計自動化。它協調程式碼生成器、設計最佳化器和知識策展人,從回饋中適應,無需專家輸入。以 Gemini 達 92% Pass@1,GPT-5 達 97.4%,Qwen-8B 等小型模型提升 48.8%。

AI-Supervisor 是一個多代理框架,用於端到端 AI 研究監督,透過知識圖譜維持持久的研究世界模型作為共享理解。它具備結構化缺口發現、自校正迴圈分析失敗與偏差,以及跨領域搜尋的自改善迴圈。代理使用共識機制自主更新模型。

前阿里巴巴Qwen訓練負責人林俊旸認為,AI正從推理式思考(o1風格)轉向透過行動與環境互動的智能體式思考。他批判Qwen的推理嘗試,並讚揚Anthropic的任務適應方法。未來重點:訓練完整智能體系統,環境建構成創業熱點。

阿里巴巴的 AI 編碼工具 Qoder 推出「專家模式」。此多代理系統部署專門 AI 工程師協作建構軟體。在複雜任務中較單代理系統提升 67% 效能。

GTO Wizard Benchmark 推出公共 API 和框架,用於評估 Heads-Up No-Limit Texas Hold'em 代理對抗超人級 GTO Wizard AI,後者以 19.4 bb/100 擊敗 Slumbot。它採用 AIVAT 實現 10 倍方差降低效率。基準測試顯示 LLM 進步,但所有模型遠低於基準線。

AgentComm-Bench 推出基準測試套件,用以評估合作式具身 AI 在延遲、封包遺失及頻寬崩潰等真實網路損害下的表現。它測試三類任務—感知、導航及區域搜尋—橫跨五種通訊策略,揭示導航任務高達 96% 效能下降。該套件提出冗餘訊息編碼以提升穩健性,並已公開發布。