KOL Digest
Semianalysis · 2026.04.24 週五 · Substack

The Coding Assistant Breakdown: More Tokens Please

看原始內容 5 個主題 · 6 個標的/題材

GPT-5.5 進入前沿:Spud 預訓練首次公開

  • GPT-5.5 是 OpenAI 首個基於新預訓練「Spud」的公開版本,訓練量達 100k GB200 NVL72 叢集,但實際 pre-training 仍在 Hopper,叢集用於 post-training(RL)
  • API 定價 $5/M input、$30/M output,比 GPT-5.4 貴 2x,與 Opus 4.7 相當;另提供 2.5x 標準費率的 priority tier #價位
  • 另有 GPT-5.3-Codex-Spark(跑在 Cerebras、GPT-5.3 的蒸餾版)及 GPT-5.5 Pro(ChatGPT 與 API,主打科研長推理),為不同產品線 #比較
AI應用 看多 短期

GPT-5.5 首次讓 SemiAnalysis 工程師在 agentic coding 場景混用 Codex 與 Claude Code,OpenAI coding 模型重回前沿 #比較

Opus 4.7:小幅升級、Fast Mode 缺席、tokenizer 漲價

  • Opus 4.7 是 Opus 4.6 的 drop-in replacement,benchmark 分數提升,但工程師描述是「勉強接受」而非熱情擁抱
  • 最大痛點:Fast Mode 尚未上線;新 tokenizer 更細粒度計費,廠商坦承 token 用量最多增加 35%,等同漲價 35% #風險
  • 4.7 預設減少 tool call、增加 reasoning,SemiAnalysis 工程師傾向升高 reasoning effort 到 xhigh/max 才能取回足夠 context,導致節省 token 的宣稱存疑
  • Anthropic 於 4/23 發布 postmortem,揭露 3 月至 4 月間三個影響幾乎所有 Claude Code 用戶的 bug,時間橫跨數週才被發現 #風險
AI應用 中性 短期

Opus 4.7 功能改善(高解析度圖片、xhigh reasoning、task budgets)但缺 Fast Mode,整體採用意願低於預期 #比較

DeepSeek V4:1M context、開源、但仍落後閉源前沿

  • DeepSeek V4 包含 V4-Pro(1.6T total / 49B active)與 V4-Flash(284B total / 13B active),核心突破是 128k → 1M context 視窗
  • 技術創新:Compressed Sparse Attention(CSA)、Heavily Compressed Attention(HCA)、mHC,實現 1M token 設定下推論 FLOPs 降 73%、KV cache 降 90% #催化劑
  • 開源含模型權重、技術報告、DeepEP / DeepGEMM / FlashMLA 等工具庫更新;DeepGEMM 新 Mega-Kernel 聲稱支援 Huawei Ascend NPU(但公開程式碼僅含 SM90/SM100)
  • SemiAnalysis InferenceX 團隊當日零時差支援 H200(FP8):~150 tok/sec throughput per GPU,遠低於 V3 的 1.3k-2.3k tok/sec,仍有大量優化空間 #風險
  • SemiAnalysis 結論:DeepSeek V4 是出色工程成就,將成最低成本的閉源替代品,但能力仍非最前沿,不會蠶食 SemiAnalysis 自身工作流程
AI算力 中期

V4 KV cache 降低 90% 將衝擊 NAND Flash 需求;同時 parameter 數規模仍小於閉源前沿模型,算力耗用結構不同 #比較

半導體 中期

DeepSeek V4-Pro 參數量(1.6T)恰好可放進 8x H20 HGX(FP4),H20 仍有其市場定位 #比較

GPT-5.5 vs Opus 4.7:SemiAnalysis 工程師實測印象

  • GPT-5.5 在 Codex 環境中優勢明顯:拉入更多 granular context 再修改、PR review / bug hunting / 文件更強
  • Opus 4.7(Claude Code)仍勝在:理解使用者真實意圖、開放式綠地開發、前端 UI 複製等開放性任務
  • SemiAnalysis 已形成雙模型工作流:Claude 起頭規劃與 POC → Codex 解決 bug 與複雜推理任務 #比較
  • Codex CLI 功能仍落後 Claude Code:缺 1M context fast mode、remote control sandbox 跨裝置、圖片上傳等功能,阻礙全面切換 #風險
AI應用 短期

GPT-5.5 vs Opus 4.7:coding 場景已形成競爭態勢,SemiAnalysis 工程師同時使用兩者,而非過去的 Claude 獨佔 #比較

Benchmark 的結構性缺陷與 cost per task 才是真指標

  • SWE-bench 系列:任務自動從 GitHub PR 抓取、無人工驗證,存在 eval 偏向特定實作、答案污染等問題;SWE-bench Verified 縮減至 500 題,仍有 >50% 爭議 eval
  • OpenAI 在 GPT-5.5 發布中刻意略去 SWE-bench Pro 結果,翻到文末才發現被 Opus 4.7 壓制(Mythos 更以 77.8% 大幅領先)
  • HLE(Humanity's Last Exam):30% 化學/生物題答案與同行評審文獻衝突,但各大 lab 仍以 9 位數預算 hillclimb 此類 benchmark
  • 真正的北極星指標是 cost per task(而非 cost per token):Codex input/output ratio 80:1 vs Claude Code 100:1,Codex 消耗更少 input token,整體更便宜 #比較
  • SemiAnalysis 正收集數百萬美元規模的 agentic AI traces,分析不同 harness(Claude Code vs Codex vs Cursor)的 cost per task 差異 #催化劑
AI基建 中期

Harness(Claude Code / Codex / Cursor 等)決定了 prompt caching、input/output ratio 與 tool use pattern,是 cost per task 的關鍵變數,不可忽視