AI 樣板程式碼將 ML 建置從數天縮短至數小時
一名 ML 開發者描述如何以共享函式庫和 AI 生成的樣板程式碼,取代容易失真的專案模板,用於設定解析、資料驗證與重複性腳手架。據稱這種方法將專案建置時間從約 3 天縮短至不到 1 天,但在欄位數量很多的資料結構上仍會產生幻覺,且遇到非標準需求時可能需要自訂邏輯。
Tag: #code-generation38 results
一名 ML 開發者描述如何以共享函式庫和 AI 生成的樣板程式碼,取代容易失真的專案模板,用於設定解析、資料驗證與重複性腳手架。據稱這種方法將專案建置時間從約 3 天縮短至不到 1 天,但在欄位數量很多的資料結構上仍會產生幻覺,且遇到非標準需求時可能需要自訂邏輯。

一項 llama.cpp 拉取請求提案加入自適應多 Token 預測,可在生成過程中動態選擇 MTP 深度。作者表示,該功能在難以預測的散文上略有退步,但在程式碼生成與回憶先前上下文內容時有顯著提升。

Anthropic 發布了 Claude Mythos 5,這是一款能處理大規模程式碼編寫任務的新模型。據稱該模型可在一天內處理 5000 萬行程式碼。
微調 Qwen2.5-Coder-14B-Instruct 名為 Steelman R5 14B,在自訂 Ada 編譯基準上勝過 Claude Opus 4.6(68.6% 對 42.1%)。在 HumanEval-Ada 上達成首個開放模型 pass@1 47.1%。可在 Hugging Face 和 Ollama 以 GGUF 量化取得。

北航研究團隊開源 Code2Bench,使用雙重擴展動態基準,對抗碼大語言模型的資料污染與測試嚴謹性不足。它產生新鮮題目與嚴苛測試,揭露超越記憶高分的真實泛化能力。論文獲 ICLR 2026 接收,榜單上線。

一名 Reddit 使用者表示,在本地執行的 Qwen3.8-27B 一次生成了 Super Mario 複製版遊戲。Q8 GGUF 版本在 Framework Desktop 上執行速度較慢,但被認為適合隔夜批次處理與背景程式設計工作。

GLM-5.3 正式發布,其程式設計能力據稱更接近 Fable 5。該模型還找出了潛伏約 40 年的程式錯誤,並被定位為頂尖的開源安全模型。

Zhipu AI 在首席科學家 Tang Jie 預告即將發布後不久推出 GLM-5.3。這款專注於程式設計與安全性的模型,在 SWE-Marathon 獲得 42.5 分、Terminal Bench 3.0 獲得 28.3 分,並在 CyberGym 獲得 84.5 分。

Microsoft 推出 MAI-Code-1.1-Flash,這款面向 GitHub Copilot 的升級程式設計模型具備更佳的基準測試表現,Token 生成速度提升 25%,完成相同任務所需的 Token 數量降低 25%。其價格降至初代模型的四分之一,並新增原生影像理解能力。
Figma 表示,隨著客戶加大對 AI 設計與開發工具的投入,公司再度實現加速成長。執行長 Dylan Field 討論了企業 AI 工作流程,以及 Figma 對 AI 代理與程式碼生成的積極投資。