Tikkocampus:TikTok 轉 ML 資料集
Tikkocampus 將 TikTok 創作者時間軸轉換為帶時間戳、可搜尋的影片片段,用於 ML 實驗與 RAG 專案。它能輕鬆從 TikTok 影片建立資料集,並支援分析任務。開源程式碼庫可在 GitHub 取得。
Tag: #rag131 results
Tikkocampus 將 TikTok 創作者時間軸轉換為帶時間戳、可搜尋的影片片段,用於 ML 實驗與 RAG 專案。它能輕鬆從 TikTok 影片建立資料集,並支援分析任務。開源程式碼庫可在 GitHub 取得。
開發者為房地產資料建置生產級 GraphRAG,困於 LightRAG、ApeRAG、Cognee 與 Graphiti 的時間感知與去重問題。Graphiti 提供時間驗證但大規模代幣成本過高。尋求大規模解決方案或自訂管線。
MiroThinker H1透過驗證中心推理,效能提升17%、互動輪次減43%。Local Verifier於難題提升Pass@1達26分,步驟減至1/6。Global Verifier於計算預算下再添提升。

GSI Agent 是一個框架,利用監督微調、來自市政文件的檢索增強生成,以及基於代理的推理管道,提升大型語言模型在綠色雨水基礎設施任務的表現。它引入了適用於真實檢查情境的新 GSI 資料集。實驗顯示,在 GSI 任務上 BLEU-4 分數從 0.090 提升至 0.307,同時一般知識表現保持穩定。

Weaviate 在僅 36 小時內建置生產就緒的端到端法律 RAG 應用程式。此專案利用 Query Agent 和新發布的 Weaviate Agent Skills 函式庫。這展示了先進 RAG 解決方案的快速開發。

Google 宣布 Developer Knowledge API 及 MCP Server 的公開預覽。此 API 讓生成 AI 擷取並參考 Google Cloud、Android、Firebase 等官方文件。支援 Model Context Protocol 以無縫整合。

旅客越來越使用 ChatGPT、Gemini、豆包與 DeepSeek 來辨識並解說地標與博物館展品,導致基礎付費導覽需求下降。博物館則開始以策展與考古資料訓練垂直 AI 導覽員;真人導遊仍在行程安排、安全與察覺旅客未明說的需求方面具備優勢。

Synthetic Query Probing 不直接比較 embedding 向量,而是測量 synthetic questions 與內容區塊之間的相似度分數,以比較不同 embedding models。研究顯示,Titan 與 Ada 等模型的分數範圍可能不同且呈非線性關係,會影響檢索門檻設定與模型遷移。
本文調查一則由 AI 生成的故事,該故事聲稱索馬利蘭存在數十種私人發行貨幣且物價穩定,後來發現其混淆了索馬利亞、索馬利蘭與自媒體虛構敘事。文章警告,即使 AI 回答流暢且理論上具說服力,仍需獨立查證;而以 AI 生成內容訓練 AI 可能放大錯誤。

體育用品零售商 Himalaya 已在全日本 99 家門市部署名為「アイダ つなぐ」(Aida Tsunagu) 的「AI 副店長」。該 AI 學習了公司理念與特定的客戶服務知識,以協助門市營運。