AgentX 1.0 發布:多輪長文本 Agentic 推論成為 AI 算力評測新基準
- —長文本與多輪 Agentic 工作負載已成為生產環境 AI 推論的主流,傳統單輪固定長度測試無法反映真實系統瓶頸
- —Agentic 推論本質是跨節點 KV Cache 傳輸、記憶體卸載與 Router 調度的系統級工程問題
GB300 與 B300 憑藉增加 50% 的 HBM 容量與 Dynamo / TRT-LLM 優化,在 DeepSeek V4 與 MiniMax M3 的 Agentic 推論表現出色。雖然在部分單點被 $AMD 特化引擎追上,但完整的軟體生態與 Context Parallelism 仍構築極高護城河。HBM 容量優勢搭配完善的推論生態系,使 NVIDIA 在多輪長文本推論成本效率上維持絕對領先
MI355X 搭配專有 ATOM 引擎在 DeepSeek V4 與 Kimi K3 表現亮眼,部分延遲區間性價比超越 $NVDA GB300。然而開源 vLLM 與 SGLang 的適配度依然嚴重落後,且客戶不願在生產環境採用專有 ATOM。硬體規格具備競爭力但開源軟體生態落後,需加速將 ATOM 優化上游化至 vLLM 才能轉化為商業訂單