KOL Digest
Semianalysis · 2026.06.09 週二 · Substack

DeepSeekV4 1.6T Day 0 to Day 43 Performance Over Time - Huawei, GB300 NVL72, MI355X, B200

看原始內容 4 個主題 · 6 個標的/題材

Nvidia Blackwell (GB300/GB200) 效能領先與機架規模優勢

  • GB300 NVL72 在所有互動層級上展現出壓倒性優勢,主要歸功於機架級的 NVLink 域規模,能讓 MoE 通訊完全留在 NVLink 上。
$NVDA 看多 長期

Nvidia 的機架規模優勢在本質上是垂直整合的規模化紅利,使得 Blackwell 在處理 DeepSeek v4 這種超大規模模型時具有不可動搖的領先地位。機架級 NVLink 域讓 MoE 分發通訊無需跨越昂貴的網路織布,確立了長期的競爭護城河

伺服器 看多 中期

GB300 透過 Wide EP 技術將專家權重負載分攤到更多 GPU 上,實現了極高的推論吞吐量。機架級規模化是未來推論架構的核心趨勢,能顯著提升能源效率與投資回報率

AMD MI355X 效能翻倍與軟體生態挑戰

  • MI355X 在發布一個月內透過軟體優化實現了百倍效能提升,成功從「不可用」進化到部分指標超越 H200。
$AMD 中期

雖然硬體效能進步神速,但 AMD 的軟體生態(特別是 vLLM)仍落後於 CUDA。AMD 資源過度集中於 ATOM 引擎而非客戶廣泛使用的 vLLM,這導致其在實際生產環境中的競爭力仍受限於軟體成熟度

半導體 中性 短期

AMD 透過 AITER 與 Triton 核心優化展現了強大的工程修復能力,但在 DeepSeek v4 的原生支援速度上仍遜於 Nvidia。軟體棧的成熟速度是 AMD 能否挑戰 Nvidia 市佔率的關鍵變數

華為 Ascend 950DT 的 Day 0 支援與競爭力

  • 華為 Ascend 950DT 是除了 Nvidia 之外唯一能在 DeepSeek v4 發布當天提供完整優化支援的平台,其 CANN 堆疊展現出極強的國產化替代能力。
AI算力 看多 長期

Ascend 950 透過 AIC/AIV 獨立架構與專用通訊引擎,在特定推論情境下已具備與 H200 競爭的實力。華為在中國大模型生態中已建立起完整的軟硬體閉環,是 Nvidia 在中國市場面臨的最嚴峻對手

DeepSeek v4 架構創新帶來的推論效率突破

  • DeepSeek v4 採用的 CSA 與 HCA 架構將 KV 快取需求降低了 50 倍,這對百萬長文本推論的成本控制至關重要。
AI基建 看多 長期

MegaMoE 核心透過分組排程隱藏了通訊延遲,使推論效率理論上可提升近一倍。架構創新與軟體協同優化是降低推論成本的終極手段,DeepSeek 正在定義新的高效能推論範式