
RLVR 技術提升企業 SaaS 工作流的工具使用準確度
本研究探討利用強化學習與可驗證獎勵 (RLVR) 來提升大型語言模型在 Jira 和 Confluence 等複雜企業 API 環境中的表現。透過在無需人工標註的情況下對工具調用軌跡進行訓練,該方法顯著減少了靜默失敗與工具調用幻覺。
Tag: #llm-fine-tuning6 results

本研究探討利用強化學習與可驗證獎勵 (RLVR) 來提升大型語言模型在 Jira 和 Confluence 等複雜企業 API 環境中的表現。透過在無需人工標註的情況下對工具調用軌跡進行訓練,該方法顯著減少了靜默失敗與工具調用幻覺。

OracleTSC 引入了獎勵門檻與不確定性正則化機制,以穩定用於交通號誌控制的強化學習。此方法使 LLaMA3-8B 等輕量模型能顯著提升交通效率並增強跨路口的泛化能力。
史丹佛研究人員開發基於 LLM 的代理工具,引導審查者提供更具建設性且禮貌的反饋。在 ICLR 2025 的 2 萬份審查意見測試中,24% 被修改,平均增加 80 字,68% 被專家評為更好。未影響評分或錄取率。

GoodPoint 彙整 19K 篇 ICLR 論文資料集,使用作者回應標註審稿意見,並以有效性和作者行動兩個維度定義回饋成效。它提出訓練配方,結合微調與偏好最佳化,使 Qwen3-8B 成功率提升 83.7%,在同尺寸 LLM 中創下 SOTA。專家人評研究證實對作者實用價值更高。

Azercell Telecom 與 AWS Generative AI Innovation Center 合作,開發專屬的亞塞拜然語大型語言模型。該專案克服了該語言形態複雜以及訓練數據稀缺的挑戰。

這篇 arXiv 研究評估輕量級 LLM 與傳統模型,用術後臨床筆記預測脊椎手術次日出院。TF-IDF 搭配 LGBM 取得最佳 F1 分數 (0.47)、召回率 (0.51) 及 AUC-ROC (0.80)。結果顯示,在不平衡臨床任務中,可解釋且資源高效模型優於輕量 LLM。