原文標題:Boosting Agentic AI Throughput with Intel® Xeon® CPUs
Intel 10 月 6 日發布 Xeon 6 處理器的代理式 AI 工作負載效能測試,強調企業導入 AI Agent 時,不能只看模型每秒生成多少 token。Agent 會反覆存取資料、呼叫工具、驗證結果與保存狀態,因此 CPU、記憶體、儲存及 I/O 的協調效率,都可能左右整體任務完成速度。
為了降低不同模型決策路徑造成的誤差,Intel 採用 record-and-replay 方法,先記錄代表性 Agent 工作流程,再讓不同平台執行相同的工作軌跡。測試以 Terminal-Bench 2.0 為基礎,安排 24 路並行、持續 60 分鐘,並以完成任務數衡量系統吞吐量,而非單次推論延遲。
官方公布的醫療情境結果顯示,Xeon 6 平台完成任務的吞吐量為第五代 AMD EPYC 平台的 1.66 倍、Arm v9.2A 平台的 4.5 倍。金融情境則分別為 1.64 倍與 4.57 倍;製造業情境為 1.58 倍與 4.24 倍。這些數據涵蓋推理、資料安全處理及控制任務的整體流程。
不過,測試由 Intel 自行執行,使用指定雲端執行個體、相同的 Claude 任務軌跡與預先建立的工作映像,並未直接測量各平台的模型推論速度。官方也提醒,實際效能會隨配置、工作負載與部署環境改變,不能把這組結果直接推論為所有 Agent 應用的普遍差距。
發生了什麼事
Intel 以固定任務軌跡比較 Xeon 6、第五代 EPYC 與 Arm v9.2A 在三種產業 Agent 工作流程中的完成任務數,並公布醫療、金融及製造業的相對吞吐量結果。
為什麼重要
企業部署 Agent 會涉及資料存取、工具呼叫、權限驗證與多工排程,單看 GPU 或模型 token 速度不足以反映端到端系統效率,這次測試提供另一種評估方向。
影響哪些人
需要規劃 AI Agent 基礎設施的系統整合商、雲端平台工程師、企業 IT 團隊與伺服器採購人員,可參考其測試方法,但仍應以自身負載重新量測。
已確認與未確認
已確認 Intel 使用 24 路並行、60 分鐘及固定重播工作軌跡;比較結果屬 Intel 自行測試,未代表所有 CPU、模型與真實網路條件下的普遍效能。