
太空 AI 的四週上傳瓶頸
新興太空算力產業正面臨關鍵工程障礙:將一個 800MB 的 AI 模型上傳至低地球軌道衛星,可能需要將近四週。Space Byte 正開發以資料上行為核心的基礎設施,初期先聚焦太空資料儲存,再逐步進入軌道 AI 推論與訓練。
极客公园 · 35 天前

新興太空算力產業正面臨關鍵工程障礙:將一個 800MB 的 AI 模型上傳至低地球軌道衛星,可能需要將近四週。Space Byte 正開發以資料上行為核心的基礎設施,初期先聚焦太空資料儲存,再逐步進入軌道 AI 推論與訓練。
极客公园 · 35 天前

一項預先註冊的研究比較了 Sonnet 5 明確使用高推理努力與省略該參數時的表現。高推理努力請求平均每次多花費 0.01031 美元,但在 30 道 AIME 2026 題目上未偵測到準確率提升。
ArXiv AI · 35 天前

本文主張,個人 AI 的品質不單取決於更廣泛地存取使用者資料,也取決於系統如何選擇、壓縮及運用觀察資訊。研究提出「協作式觀察」概念:實用性、信任、同意與使用者控制共同決定未來的資料存取,並以 Organizm 六個月的單一受試者初步案例作為支持。
ArXiv AI · 35 天前

SkillEffect 是一個經過檢查的 lowering 執行環境,會在執行前將代理程式產生的工具程式轉換為經稽核且受記憶體限制的實作。其共用執行環境支援六類運算子,能在固定記憶體上限下提升完成率,並拒絕對抗性提案。
ArXiv AI · 35 天前

這項研究提出「記憶—訊號傳遞前沿」,描述受限代理應如何在保留歷史資訊與和其他代理溝通之間分配有限的資訊容量。初步指涉遊戲結果顯示,重複出現的目標可能促成更短的訊息,但隱藏循環規則所帶來的可預測性不一定會縮短訊息。
ArXiv AI · 35 天前

KnowSim 是一套評估框架,透過模擬具備明確且持續演變知識狀態的使用者,評估 LLM 助理是否能依照使用者理解程度調整資訊傳遞方式。在 705 次人機互動及 9 個 LLM 的評估中,其指標與人類判斷具有一致性,並顯示最佳模型會隨使用者知識程度而改變。
ArXiv AI · 35 天前

KernelArc 是一套面向異質工作負載、自主最佳化 GPU 核心的多代理框架。在 NVIDIA H100 與 B200 GPU 上,其實作於 2026 年 7 月 30 日的 SOL-ExecBench 快照中,於代表性的 L1、L2、Quantization 與 FlashInfer 任務排名第一。
ArXiv AI · 35 天前

FedPref 是一種聯邦偏好學習方法,可將自由格式的放射科報告轉換為結構化 JSON,同時不共享報告或標註資料。在六家模擬醫院的實驗中,相較於各據點獨立訓練,FedPref 將客戶端平均 F1 提升 2.49 分、最差據點 F1 提升 9.10 分,且資料較少的據點獲益最大。
ArXiv AI · 35 天前

研究人員提出 FAR,一套從研究文獻尋找未解決問題、嘗試解題,並推薦具潛力結果供專家審查的人機協作流程。在組合數學試驗中,系統將 5,245 篇論文縮小至 77 個供作者團隊評估的項目,並發現多項潛在數學成果。
ArXiv AI · 35 天前

DiSCO 是一種零樣本、黑箱式防禦方法,透過最佳化提示詞降低文字生成圖像模型產生有害內容的機率。它利用分佈導向的後綴擴展,以及安全與不安全圖像池的對比評分,在 I2P 基準測試中最多可降低 37.7% 的攻擊成功率。
ArXiv AI · 35 天前

GxP-Agent 使用符合監管流程的有向無環圖,將臨床試驗資料集生成拆分為 15 個專門化智能體任務,並加入驗證與重試機制。在 CDISC-Bench 上,搭配 Claude Sonnet 4.6 達到 100% 結構匹配,也大幅提升了較弱模型的表現。
ArXiv AI · 35 天前

研究人員提出 CASE,透過從 LLM 隱藏狀態擷取的線性正確性訊號來選擇答案。其新的可解碼性指標能預測此方法何時勝過多數投票,在中等難度問題上最高提升 19 個百分點。
ArXiv AI · 35 天前

Algolia 現已可透過 Vercel Marketplace 進行佈建與管理。此整合支援託管搜尋、AI 排名、推薦功能、透過爬蟲建立索引,以及自動設定環境變數。
Vercel News · 35 天前

一項針對572名IT工程師的調查分析顯示,影響工作與評價的不只是是否使用AI,還包括能將AI運用到什麼程度。AI應用技能的差距,可能不僅影響工作效率,也開始影響職涯發展。
ITmedia AI+ (日本) · 35 天前

Aegis 是一套執行期治理系統,將代理程式輸出視為行動提案,並在工具執行前透過可信的政策層進行評估與授權。在沙盒評測中,系統記錄到零次受治理的模擬工具應用,以及零次受治理的高風險副作用完成;但作者強調,這並不能證明代理程式具備普遍安全性。
ArXiv AI · 35 天前
文章認為,Workboddy、千問辦公與 TraeWork 等 AI 辦公智能體若要求消費者付費,成功機會不高,因為生產力提升主要由雇主受益。作者指出,這類產品必須提供可靠且高頻的流程自動化,或在底層模型能力、企業交付與生態入口方面建立優勢。
虎嗅 · 35 天前
韓國 AI 新創 Motif Technologies 執行長 Junghwan Lim 說明公司打造可與全球領先前沿模型競爭之模型的策略。公司在首爾 AI Summit & Expo 分享了相關發展目標。
Bloomberg Technology · 35 天前
AI 晶片新創 Rebellions 財務長 Sungkyue Shin 表示,公司正積極籌備首次公開募股。登上南韓主要證券交易所是公司的首要目標。
Bloomberg Technology · 35 天前
Qwen Code v0.21.13 完成了隔離式 DSW EAS 網路與 watchdog 冒煙測試,成功解決唯一的 SWE-bench Verified 案例,取得 100% 分數。Terminal-Bench 2.0 執行雖已完成,但發生基礎設施錯誤,因此結果無法計分。
Qwen (GitHub Releases: qwen-code) · 35 天前

Queensland 交通暨主要道路部門的高階主管正推動 AI 計畫。其應用案例管線持續推進,其中包括可能用於替求職者履歷排序的系統。
iTNews Australia · 35 天前

據報導,Tencent 正將多模態 AI 方向從內容生成轉向上下文理解與在真實世界中行動。這項轉變似乎更接近梁文鋒對推理與執行的重視,也與 Fei-Fei Li 偏向世界模型的研究路線有所區隔。
钛媒体 · 35 天前

文章指出,AI 系統可以拆解動作或解釋流程,卻未必能重現讓人類成功執行的直觀線索。從游泳技巧到企業軟體,這揭示了理論知識與具身、可立即掌握的示範之間的落差。
钛媒体 · 35 天前

一名獨立開發者提出受 emergent gravity 與資訊自組織啟發的實驗性嵌入方法。該專案類似 word2vec,據稱能有效處理 MNIST,並支援具有限制遺忘的增量訓練,但尚未經過正式評估或發表。
Reddit r/MachineLearning · 35 天前

文章報導 OpenAI 緊急暫停新模型訓練,並將此決定置於 AI 能力提升所帶來風險日增的背景下。文章未提供具體模型名稱、時間表或暫停訓練的技術原因。
Ifanr (爱范儿) · 35 天前
Robeco 表示,約一兆美元的 AI 相關資本支出可能推高債券發行量,因超大規模雲端業者需要為新基礎設施融資。供給增加可能讓固定收益市場持續波動。
Bloomberg Technology · 35 天前
AI 正在降低研究、寫作、程式設計、設計、分析與產品開發的組織成本,讓個人能取得過去分散於多個職位的能力。當執行成本下降後,判斷力、動機與持續行動將成為關鍵差異。
虎嗅 · 35 天前

Dongfeng 與 Huawei Qiankun 已為 Epicland X9 開放預售,起售價為人民幣 299,800 元。這款家庭旗艦車搭載 Huawei Qiankun 全棧智慧方案,包括 ADS 5 與 HarmonySpace 6。
Pandaily · 35 天前

文章以「找錢、生錢、管錢」三個主題回顧王興興的2016年。內容似乎將這一年定位為這位創業者商業歷程中的關鍵成長期。
钛媒体 · 35 天前
Qwen 社群經理據稱表示,新款中型開放權重模型可能於下週推出。該模型不會提供搶先體驗版本,規模尚未確認,但社群猜測參數量可能超過 100B。
Reddit r/LocalLLaMA · 35 天前
OpenAI 正在擴大其在日本的企業合作夥伴網絡。三家新加入的合作夥伴指出,許多低估自身 AI 導入能力的日本中小企業,仍蘊藏可觀的成長潛力。
ITmedia AI+ (日本) · 35 天前