
SiliconFlow 衝刺成為「Token 工廠」第一股
SiliconFlow 正將自己定位為「Token 工廠」模式的領導者,專注於高吞吐量、低成本的 LLM Token 生成。儘管營運持續虧損,但該公司的估值持續攀升,反映了投資者對基礎設施即服務(IaaS)模式的信心。
Tag: #llm-inference43 results

SiliconFlow 正將自己定位為「Token 工廠」模式的領導者,專注於高吞吐量、低成本的 LLM Token 生成。儘管營運持續虧損,但該公司的估值持續攀升,反映了投資者對基礎設施即服務(IaaS)模式的信心。

英特爾宣布終止其開源 AI 加速專案 BigDL。該專案將於 2026 年 6 月 30 日正式歸檔,標誌著英特爾開源 AI 生態系統的進一步收縮。

ParoQuant 提出配對旋轉量化技術,用於 LLM 高效推理,降低量化誤差。專案包含 GitHub 儲存庫、z-lab.ai 頁面及 HuggingFace 模型集合。目標提升推論速度與準確度。

智譜 AI 揭露模型擴展中的「降智」秘密。他們將其描述為大型模型擴展的不可避免痛點。主要責任歸咎於 Prefill 階段。
Reddit 討論新手 GPU 核心與 LLM 推論工程師應學舊 C++ CuTe/CUTLASS,還是優先 NVIDIA 的 CuTeDSL Python DSL。NVIDIA 推 CuTeDSL 效能相同、無模板、更快迭代,並整合 TorchInductor。FlashAttention-4、FlashInfer 和 SGLang 路線圖顯示轉變。

Cloudflare 開發自訂技術堆疊,在全球基礎設施上運行快速大型語言模型。此文探討實現高效能 AI 推理所需的工程權衡與技術最佳化。
最佳化 llama.cpp 設定讓 Qwen3.5-35B-A3B-UD-Q4_K_L 在 RTX 4060 Ti 16GB 於 64k 脈絡達 40-60 tok/s。分享 models.ini 預設及 llama-server 指令。實際速度即使背景應用執行仍維持。

Reddit 用戶針對如 GPT120b 的 LLM 推理,基準測試 NVIDIA RTX 6000 96GB 對單 AMD W7800 48GB。令牌/秒比率 (0.49) 與 VRAM 頻寬比率 (0.48) 高度吻合,證明速度主導。多 GPU 設定性能趨向平均,建議優先頻寬而非僅容量。

開源 GreenBoost 驅動程式旨在使用系統 RAM 與 NVMe 儲存擴充 NVIDIA GPU 的 VRAM 容量。專為在標準硬體上運行更大 LLM 而設計。
國家超算網際網路的OpenClaw服務已打通飛書與企業微信。用戶可依任務規模靈活選擇MinMax-M2.1、MinMax-M2.5、Qwen-235B等模型API,並在客戶端使用。提供高效低成本推理算力。