2026年8月31日--AMD正式發布AMD ROCm™ 10,標誌著AMD軟體堆疊邁入10週年的重要里程碑,並同步宣布ROCm.AI正式全面上線(GA)。ROCm.AI於Advancing AI 2026年度大會中首次亮相,為一套AI原生軟體體驗,旨在提升AMD硬體上的開發效率與效能最佳化能力。
ROCm.AI匯聚三大核心開發體驗:AMD Skills、ROCm CLI以及AMD Hyperloom,將AMD專業技術與代理式工作流程整合於開發人員現有工具中,讓創新得以隨著AI演進的速度持續推進。
透過對核心(Kernels)、記憶體管理與排程進行AI驅動的最佳化,在相同硬體上,配置ROCm.AI的系統相較於ROCm™ 7,推論效能平均提升3.3倍,訓練效能平均提升2.4倍註1、2。
AMD平台上全新AI開發體驗
ROCm.AI涵蓋AI開發流程的三大環節,為開發人員提供支援:最佳化推論效能、運用AMD專業技術進行開發,以及執行AI工作負載。
透過AMD ROCm Hyperloom實現端對端推論最佳化
作為ROCm.AI的核心元件,ROCm Hyperloom是一套自主代理式系統,能夠對主機端程式碼(Host code)與GPU核心(Kernels)的端對端推論工作負載進行最佳化。
Hyperloom能對工作負載進行分析、識別瓶頸、探索最佳化方案、進行針對性的調整、執行效能基準測試,並驗證效能與正確性。
隨著ROCm 10的推出,Hyperloom擴大對AMD Instinct™ GPU的支援,並整合對vLLM與SGLang的支援。開發人員可對HIP、Triton及FlyDSL進行最佳化,系統將提供報告,詳細說明建議的程式碼變更方案,以及實測或預期的效能提升。
Hyperloom可透過獨立工作流程或AMD Skills兩種使用方式,為開發人員提供多元管道,將代理式最佳化能力整合於其開發流程中。
運用AMD專業技術進行開發
AMD Skills將經過整理的AMD專業知識與經過驗證的工作流程,整合至Claude Code、Cursor與Codex等受支援的AI程式編寫代理中,讓開發人員能在現有的工具中取得AMD專屬指引。隨著ROCm 10的推出,AMD Skills目錄進一步擴展至三大領域:
• 客戶端原生工作流程:適用於本地AI與應用程式整合。
• 跨堆疊工作流程:適用於診斷、路由、回放分析與最佳化。
• 伺服器原生工作流程:專為AMD Instinct GPU與AMD EPYC™處理器設計,涵蓋服務部署、效能分析與效能評估等。
在Advancing AI年度大會中預覽的AMD Skills,現已透過Claude Code、Codex與Cursor市集正式上線,亦可透過GitHub開放目錄取得。每項正式發布的AMD Skills在上線前都會通過結構與行為測試,以確保提供一致且可靠的工作流程。
以更簡化的工作流程執行
ROCm CLI為ROCm.AI的技術預覽(Technology Preview)元件,提供穩定且統一的命令列介面,用於在AMD硬體上設定、管理與執行AI工作負載。
開發人員可透過手動操作、AI程式編寫代理,或是持續整合(CI)環境中,使用相同的工作流程。透過單一介面,即可檢視系統、安裝與管理ROCm環境、部署模型服務、執行診斷、更新元件以及控制執行階段(runtime)。
ROCm CLI提供適用於Windows與Linux的預先編譯二進位檔(Prebuilt binary),無需預先安裝ROCm即可使用。它能提供託管式ROCm環境,可同時管理多個並存的Runtime,並支援Runtime的啟用與回復(rollback),同時整合模型服務與引擎管理功能。目前的轉接器已支援在部分AMD客戶端系統上使用Lemonade,以及透過vLLM在AMD Instinct GPU上進行部署。
CLI內建ROCm Console(原名為“dash”)可即時呈現系統狀態與工作負載活動。開發人員能監控ROCm執行階段的健康狀況、模型服務狀態、GPU使用率以及基準測試遙測數據。在支援的AMD Instinct系統上,更可查看高頻寬記憶體使用量、功耗以及每瓦每秒Token數等指標。
作為技術預覽版,ROCm CLI提供橫跨不同ROCm版本的無縫使用體驗,從ROCm 7.13軟體版本開始提供支援,並即將在ROCm 10中提供正式支援。
基於ROCm 10軟體堆疊進行建構
以上開發體驗建立於更廣泛的ROCm 10軟體堆疊之上,其中包含ROCm Core SDK,為在AMD平台建構與執行AI工作負載提供更具模組化的基礎。
ROCm 10同時帶來函式庫、編譯器、框架、工具、模型支援、效能及硬體平台等方面的更新。
欲深入了解ROCm Core SDK,包含函式庫、編譯器、工具、框架與模型支援、效能提升及平台更新的詳細內容,請參閱完整的ROCm 10技術深度解析文章。
註1: (MI350-81) 由AMD效能實驗室於2026年7月7日進行測試,比較搭載8張AMD Instinct MI355x GPU的系統在AMD ROCm 7.0軟體與AMD ROCm.ai 預覽版本(ROCm 7.2.2,採用核心最佳化、平行運算與排程等最佳化)下的推論效能,兩者皆運行GLM-5、Kimi-K2.5及DeepSeek-R1-0528模型,以每秒Token數(TPS)衡量。
文中所述的效能提升幅度,為上述三個測試模型的平均TPS綜合計算而得。
硬體配置
Supermicro AS -4126GS-NMR-LCC (board H14DSG-OD)
8x AMD Instinct MI355X. BIOS AMI v1.4a (2025-04-16), GPU firmware SMC 04.86.11.02, TA RAS 27.69.00.10, TA XGMI 32.00.00.20, RLC43, MEC36, SDMA12, Ubuntu 22.04.2 LTS, kernel 5.15.0-70-generic, amdgpu driver 6.16.6, HOST ROCm 7.1.0
軟體配置
ROCm 7.0:
GLM-5 ROCm Docker Image: rocm/sgl-dev:v0.5.8.post1-rocm700-mi35x-20260219
PYTorch Version 2.8.0, SGLang v0.5.8
Kimi ROCm Docker Image: vllm/vllm-openai-rocm:v0.16.0, vLLM version 0.16.0DeepSeek-R1 Docker Image: rocm/7.0:...sgl-dev-v0.5.2-rocm7.0-mi35x-20250915, SGLang version V0.5.13
ROCm.ai預覽版本(ROCm 7.2.2):
GLM-5 ROCm Docker Image: rocm/atom:rocm7.2.2_ubuntu24.04_py3.12_pytorch_release_2.10.0_atom0.1.2.post, ATOM v0.1.2.post
Kimi ROCm Docker Image: vllm/vllm-openai-rocm:v0.22.0, vLLM version V0.22.0
DeepSeek-R1 Docker Image: lmsysorg/sglang-rocm:v0.5.13-rocm720-mi35x-20260612, SGLang version V0.5.13
伺服器製造商可能採用不同配置,導致結果有所差異。效能可能因配置、軟體、vLLM版本,以及是否使用最新驅動程式與最佳化技術而有所不同。(MI350-81)
註2:(MI350-82)由AMD效能實驗室於2026年7月7日進行測試,比較配置8張AMD Instinct MI355x GPU 的系統在AMD ROCm 7.0軟體與 AMD ROCm.ai預覽版本(ROCm 7.2.2,採用核心最佳化、平行運算與排程等最佳化)下的訓練效能,兩者皆使用Megatron-LM執行DeepSeek-V2-Lite、DeepSeek-V3-16B及Qwen3-30B-A3B模型,以每秒Token數(TPS)衡量。
文章中所列出的效能提升幅度,是以測試的三個模型的平均TPS綜合計算而得。
硬體配置
Supermicro AS -4126GS-NMR-LCC (board H14DSG-OD)
8x AMD Instinct MI355. BIOS AMI v1.4a (2025-04-16), GPU firmware SMC 04.86.11.02, TA RAS 27.69.00.10, TA XGMI 32.00.00.20, RLC 43, MEC 36, SDMA 12, Ubuntu 22.04.2 LTS, kernel 5.15.0-70-generic, amdgpu driver 6.16.6, HOST ROCm 7.1.0
軟體配置
DeepSeek-V2-Lite,ROCm 7.2.1 + Primus v26.3
DeepSeek-V3-16B,ROCm 7.2.1 + Primus v26.3
Qwen3-30B-A3B,ROCm 7.2.1 + Primus v26.3
伺服器製造商可能採用不同配置,導致結果有所差異。效能可能因配置、軟體,以及是否使用最新驅動程式與最佳化技術而有所不同。(MI350-82)