AAI 2026:AMD 推出 ROCm.ai,加速 AMD 平台上的 AI 开发
全新 AI 原生开发体验支持开发者借助自然语言和主流 AI 编程助手,在 AMD 平台上完成 AI 工作负载的安装、部署、故障排查与性能优化。
核心亮点:
- AMD 在 Advancing AI 2026 大会上发布 ROCm.ai,这是一套面向 AMD 平台 AI 开发的 AI 原生软件体验。
- ROCm.ai 将 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力 整合为统一的开发者体验。
- 该平台支持开发者借助自然语言和 AI 编程助手完成 AI 工作负载的安装、部署、故障排查和性能优化。
- 通过对计算内核、内存管理、并行化和调度机制进行 AI 驱动优化,ROCm.ai 可进一步优化 ROCm 软件栈,并提升开发效率。
- 在相同硬件平台上,相较于ROCm 7,最新版 ROCm 借助 ROCm.ai 在测试中可实现平均 3.3 倍推理性能提升 和 2.4 倍训练性能提升。1,2
内容概要:
AMD 在 Advancing AI 2026 大会上发布 ROCm.ai,这是一套 AI 原生开发体验,将 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力 相结合,帮助开发者在 AMD 平台上构建、部署和优化 AI 工作负载。该平台将 AMD 专业知识集成至 Claude、Codex 和 Cursor 等主流 AI 编程助手中,并在相同硬件平台上,相较于 ROCm 7,最新版 ROCm 在测试中可实现平均 3.3 倍推理性能提升 和 2.4 倍训练性能提升。1,2
常见问题解答:
什么是 ROCm.ai?
ROCm.ai是AMD面向AI开发打造的AI 原生开发体验,帮助开发者在AMD平台上构建、部署和优化AI工作负载。
ROCm.ai 由哪些组件组成?
ROCm.ai将 ROCm CLI、AMD Skills以及包括Hyperloom 在内的AI 驱动软件优化能力整合为统一的软件体验。
AMD 为什么推出 ROCm.ai?
AMD 推出 ROCm.ai,旨在帮助开发者借助自然语言和 AI 编程助手,更快速地将开发构想转化为实际生产应用。
ROCm.ai 如何提升性能?
ROCm.ai 通过 AI 驱动的优化技术,对计算内核、内存管理、并行化和调度机制进行优化,从而提升 AI 推理和训练性能。
AMD 公布的性能提升数据是什么?
AMD 表示,与相同硬件平台上的 AMD ROCm™ 7 相比,最新版 ROCm借助ROCm.ai在测试中可实现平均3.3倍推理性能提升和2.4 倍训练性能提升。1,2
有哪些值得关注的新动态?AMD 正式发布 ROCm.ai,这是一套面向 AMD 平台的 AI 原生软件开发体验。ROCm.ai 将 AI 辅助开发、智能部署和 AI 驱动的软件优化整合为统一的软件体验,帮助开发者更快地将开发构想转化为生产部署。ROCm.ai 于 Advancing AI 2026 大会上正式亮相,其中包括 ROCm CLI:一款用于安装、验证、部署和管理 AI 工作负载的全新命令行工具;AMD Skills—将 AMD 官方技术知识集成至 Claude、Cursor 和 Codex 等主流 AI 编程助手;以及 Hyperloom:一款全新的开源 Agentic AI 系统,旨在自动完成端到端推理工作负载优化这一耗时的工程任务。通过统一的软件体验,ROCm.ai 帮助开发者在 AMD 平台上完成 AI 工作负载的安装、部署、故障排查和性能优化。
为什么这项进展值得关注?AI 开发正逐渐迈向 Agent 驱动模式,越来越多开发者开始借助自然语言和 AI 编程助手构建、部署和优化软件。ROCm.ai 将 AMD 的技术能力直接融入这些开发流程,为开发者提供针对 AMD 平台的专业指导,而非通用建议,帮助其更高效地构建和优化 AI 工作负载。AMD Skills 的推出进一步降低了开发者采用 ROCm 的门槛,并减少了配置环境过程中查阅文档所需的时间。ROCm.ai 同时利用 AI 持续优化 AMD ROCm™ 软件栈。通过对计算内核、内存管理和调度机制进行 AI 驱动优化,在相同硬件平台上,相较于 ROCm™ 7,最新版 ROCm 在测试中推理性能方面平均提升 3.3 倍,训练性能平均提升 2.4 倍。1,2
AMD 在其中发挥了怎样的作用?
“AMD 致力于帮助开发者以前所未有的效率开展开发工作。ROCm.ai 将 Agentic AI 开发体验引入 AMD 平台,这些 AI Agent 不仅能够回答问题,还能够分析性能、调试应用,并推动工作负载在 AMD 硬件上充分释放性能。这标志着 AMD AI 软件栈迈出了新的发展阶段,进一步缩短了开发构想到实际运行之间的距离,使开发者能够更快完成开发与迭代。无论是搭建开发环境、部署模型,还是进一步优化性能,ROCm.ai 都能够在开发者日常使用的 AI 编程助手中完成这些关键工作。”
— AMD AI软件副总裁 Anush Elangovan
ROCm.ai 是什么?ROCm.ai 是 AMD 面向 AI 开发打造的 AI 原生开发体验,旨在帮助开发者在 AMD 平台上更快完成 AI 应用的开发、部署与优化。它将 ROCm CLI、AMD Skills 以及 AI 驱动的软件优化能力 整合为统一的软件体验,简化了从安装、部署到调试和性能优化的整个 AI 开发流程。
• ROCm CLI 提供统一的命令行体验,可用于在 AMD 平台上安装、验证、部署、更新和排查 AI 工作负载。其具备硬件感知工作流程、自动化环境配置以及对安全隔离(Air-gapped)部署的支持,有助于简化软件安装流程,并实现跨环境的一致性部署。
• AMD Skills 将 AMD 官方技术知识集成至 Claude、Cursor 和 Codex 等主流 AI 编程助手。开发者无需依赖通用建议,即可获得针对 AMD AI 软件栈的安装、迁移、调试和性能优化指导。
• Hyperloom 可自动完成端到端 AI 推理工作负载优化,覆盖从性能分析、瓶颈诊断到计算内核优化和结果验证的完整流程,帮助开发者在数小时内完成过去通常需要数周专业工程投入才能完成的优化工作。
• 借助包括 Hyperloom 在内的 AI 驱动软件优化能力,ROCm.ai 可持续优化 ROCm 软件栈,包括并行化与任务调度、内存管理以及计算内核优化等多个方面。这些软件优化可进一步提升现有 AMD 硬件上的推理和训练性能,并持续改善开发效率及工作负载性能。
• ROCm.ai 将于 2026 年 8 月开始投入使用。
获取更多信息:Advancing AI 2026 (Press Kit)
免责声明:
除法律要求外,AMD 不承担、亦明确声明不承担任何更新本文中前瞻性声明的义务。
(MI350-81) AMD Performance Labs 于 2026 年 7 月 7 日进行了测试,用于测量系统推理性能,测试指标为每秒生成 Token 数(Tokens Per Second,TPS)。测试对比了搭载 AMD Instinct MI355X 8× GPU 平台并运行 AMD ROCm 7.0 软件的系统,与配置相近且运行 AMD ROCm.ai 预览版本的系统(ROCm 7.2.2,包含优化计算内核、并行化和调度等优化),测试模型包括 GLM-5、Kimi-K2.5 和 DeepSeek-R1-0528。
文中所述性能提升数据为所测试 3 个模型的综合平均 TPS 提升表现。
硬件配置
Supermicro AS-4126GS-NMR-LCC(主板 H14DSG-OD)
8× AMD Instinct MI355X。BIOS AMI v1.4a(2025-04-16),GPU 固件 SMC 04.86.11.02,TA RAS 27.69.00.10,TA XGMI 32.00.00.20,RLC43,MEC36,SDMA12,Ubuntu 22.04.2 LTS,内核 5.15.0-70-generic,amdgpu 驱动 6.16.6,主机端 ROCm 7.1.0。
软件配置
GLM-5 ROCm Docker 镜像:rocm/sgl-dev:v0.5.8.post1-rocm700-mi35x-20260219
PyTorch 版本 2.8.0,SGLang v0.5.8
Kimi ROCm Docker 镜像:vllm/vllm-openai-rocm:v0.16.0,vLLM 版本 0.16.0
DeepSeek-R1 Docker 镜像:rocm/7.0:…sgl-dev-v0.5.2-rocm7.0-mi35x-20250915, SGLang 版本 V0.5.13
对比
GLM-5 ROCm Docker 镜像:rocm/atom:rocm7.2.2_ubuntu24.04_py3.12_pytorch_release_2.10.0_atom0.1.2.post, ATOM v0.1.2.post
Kimi ROCm Docker 镜像:vllm/vllm-openai-rocm:v0.22.0,vLLM 版本 V0.22.0
DeepSeek-R1 Docker 镜像:lmsysorg/sglang-rocm:v0.5.13-rocm720-mi35x-20260612,SGLang 版本 V0.5.13
服务器厂商可能采用不同配置,因此测试结果可能有所差异。实际性能表现可能因配置、软件环境、vLLM 版本以及所使用的最新驱动程序和优化方案而有所不同。(MI350-81)
2 (MI350-82) AMD Performance Labs 于 2026 年 7 月 7 日进行了测试,用于测量训练性能,测试指标为每秒生成 Token 数(Tokens Per Second,TPS)。测试基于搭载 8× AMD Instinct MI355X GPU 平台的系统,使用 DeepSeek-V2-Lite、DeepSeek-V3-16B 和 Qwen3-30B-A3B 模型,通过 Megatron-LM 对 AMD ROCm 7.0 软件与 AMD ROCm.ai 预览版本(ROCm 7.2.2,包含优化计算内核、并行化和调度等优化)的训练性能进行对比。
文中所述性能提升数据为所测试 3 个模型的综合平均 TPS 提升表现。
硬件配置
Supermicro AS-4126GS-NMR-LCC(主板H14DSG-OD)
8× AMD Instinct MI355X。BIOS AMI v1.4a(2025-04-16),GPU 固件 SMC 04.86.11.02,TA RAS 27.69.00.10,TA XGMI 32.00.00.20,RLC 43,MEC 36,SDMA 12,Ubuntu 22.04.2 LTS,内核 5.15.0-70-generic,amdgpu 驱动 6.16.6,主机端 ROCm 7.1.0。
软件配置
DeepSeek-V2-Lite,ROCm 7.2.1 + Primus v26.3
DeepSeek-V3-16B,ROCm 7.2.1 + Primus v26.3
Qwen3-30B-A3B,ROCm 7.2.1 + Primus v26.3
服务器厂商可能采用不同配置,因此测试结果可能有所差异。实际性能表现可能因配置、软件环境以及所使用的最新驱动程序和优化方案而有所不同。(MI350-82)
本文由方向对了资讯网发布,不代表方向对了资讯网立场,转载联系作者并注明出处:https://www.zhenyes.com/industry/8388.html
