본문으로 건너뛰기
피드

AMD ROCm 7.0, CUDA 락인 정면 돌파 — 추론 3.5배·오픈소스 100%·개발자 10만 명 돌파

ai-ml 약 7분
vote
0
댓글
북마크

AMD가 ROCm 7.0과 개발자 생태계 공세로 엔비디아 CUDA 아성에 도전한다. 전작 대비 추론 3.5배, 훈련 3배 성능 향상을 주장하며 파이토치·vLLM 등 주요 프레임워크에서 코드 수정 없이 구동 가능하다는 호환성을 강조했다. 개발자 클라우드는 10개월 만에 주간 활성 사용자 3.2만 명을 확보했다.

  • 1

    ROCm 7.0이 ROCm 6 대비 추론 3.5배·훈련 3배 성능 향상 (MI300X 자체 측정)

  • 2

    HIP는 CUDA와 구문 호환, 기존 CUDA 코드를 거의 그대로 AMD GPU에서 실행 가능

  • 3

    AITER 커널로 MoE 연산 3배·MLA 디코딩 17배 향상, vLLM·SGLang에 이미 통합

  • 4

    MI355X가 SGLang DeepSeek R1 추론에서 엔비디아 B200 대비 1.3배 처리량 (AMD 테스트)

  • 5

    개발자 클라우드 주간 활성 사용자 3.2만 명·누적 GPU 사용 100만 시간, 아시아가 절반 이상

  • 6

    엔비디아 NIM 대응 상품 AIMs는 vLLM/SGLang 오픈소스 기반에 OpenAI 호환 API 제공

  • AMD가 ROCm 7.0과 개발자 생태계 전략으로 엔비디아 CUDA 아성에 정면 도전 — 핵심 무기는 '오픈소스 전면 개방 + 코드 수정 없는 호환성'
    • ROCm 7.0은 ROCm 6 대비 추론 성능 평균 3.5배, 훈련 성능 3배 향상 (MI300X 기준 AMD 자체 측정)
    • 주요 프레임워크(파이토치, JAX, vLLM, SGLang) 위에서 코드 수정 없이 AMD GPU 구동 가능
    • 개발자 클라우드 출범 10개월 만에 주간 활성 사용자 3.2만 명 확보, 누적 GPU 사용 시간 100만 시간 돌파

CUDA 락인을 깨는 HIP 전략

  • ROCm의 핵심 프로그래밍 인터페이스 HIP(Heterogeneous Compute Interface)은 CUDA와 구문 수준 호환
    • 엔비디아 환경에서 짠 AI 코드를 AMD 하드웨어에서 다시 안 짜도 되는 '번역기' 역할
    • CUDA 핵심 코드가 폐쇄형인 것과 달리 ROCm은 100% 오픈소스 유지
  • 업계 분석은 여전히 "ROCm이 CUDA 생태계를 따라잡는 단계"라는 시각이 주류
    • 다만 메모리 집약적/비용 민감 워크로드에서는 AMD가 현실적 대안으로 부상 중이라는 평가

추론 성능의 숨은 주역 — AITER

  • AITER(AI Tensor Engine for ROCm)는 고성능 커널 라이브러리로 ROCm 7.0 성능 향상의 실질적 동력
    • 행렬 연산 최대 2배, MoE 연산 최대 3배, MLA 디코딩 최대 17배 향상 (AMD 내부 테스트)
    • vLLM·SGLang에 이미 통합되어 별도 설정 없이 사용 가능
  • DeepSeek R1, GPT-OSS 등 MoE 구조 모델이 늘어나는 추세와 맞물려 AITER가 AMD GPU 추론 경쟁력의 핵심으로 부각

엔터프라이즈 패키지 — NIM에 대응하는 AIMs

  • AIMs(AMD Interface Microservice)는 파인튜닝된 모델을 담은 컨테이너
    • vLLM/SGLang 기반 추론 서빙 + OpenAI 호환 API 포함
    • 엔비디아 NIM과 유사하지만 ROCm 오픈소스 스택 위에 구축된 게 차별점
  • AMD 리소스 매니저(쿠버네티스·Slurm 오케스트레이션) + AMD AI 워크벤치(모델 배포·파인튜닝) 조합으로 엔터프라이즈 AI 스위트 구성
  • MI355X 플랫폼은 SGLang 기반 DeepSeek R1 추론에서 엔비디아 B200 대비 1.3배 처리량 달성 (AMD 자체 테스트)

개발자 생태계 공세

  • AMD 개발자 프로그램은 2025년 1월 출범 후 4개월 만에 등록 인원 10만 명 돌파
  • 개발자 클라우드는 MI300X GPU에 하드웨어 투자 없이 접근 가능, 사전 설치된 도커 컨테이너와 주피터 노트북 환경 제공
    • 아시아 지역이 전체 사용량의 절반 이상 차지
  • 100만 달러 규모 HIP 커널 해커톤으로 오픈소스 커널 대량 축적 — 라민 론 부사장은 "공개된 HIP 커널 수가 엔비디아 공개 CUDA 커널에 상응한다" 주장
    • 이 데이터가 GPT-OSS 등 LLM의 HIP 코드 생성 성능 개선에도 기여

데이터센터 너머 클라이언트 확장

  • ROCm 지원 범위가 라이젠 AI 300/400 시리즈 노트북, 라이젠 AI 맥스, 스레드리퍼+라데온 AI 워크스테이션까지 확대
  • 일본·프랑스·미국 로보틱 해커톤에서 '데이터센터 훈련 → 라이젠 AI 엣지 추론' 엔드투엔드 파이프라인 시연
  • 아시아 파트너십 핵심 — 삼성, 업스테이지, KT 클라우드, 네이버 등 한국 기업과 전략적 협업 진행 중
  • 4월 30일 샌프란시스코, 5월 19일 상하이 AMD 개발자 데이에서 추가 발표 예정

💡

> CUDA 종속 탈출을 고민하던 팀이라면 HIP가 현실적 해답에 가까워짐. 파이토치/vLLM 기반 코드면 수정 없이 돌아간다는 게 실제 현장에서 검증되는 중


기술 맥락

AMD가 노리는 건 '성능 1등'이 아니라 'CUDA 락인을 깨는 소프트웨어 이식성'이에요. AI 인프라 의사결정에서 하드웨어 스펙은 이미 AMD가 할 말이 많은데, 개발자들이 선뜻 갈아타지 못했던 이유가 수백만 개 커널 코드와 수십만 숙련 개발자가 만든 CUDA 소프트웨어 락인이었거든요. HIP는 이 락인을 해체하는 가장 중요한 도구예요. 기존 CUDA 커널을 거의 그대로 AMD GPU에서 돌릴 수 있게 해주는 번역 레이어니까요.

왜 지금 이 전략이 통할 여지가 생겼냐면, 최근 프론티어 모델들이 대부분 MoE 구조로 가고 있어서예요. MoE는 활성 전문가만 연산하는 구조라 메모리 대역폭이 병목이 되기 쉬운데, AMD MI300X 계열은 HBM 용량·대역폭에서 강점이 있거든요. AITER의 MoE 연산 최대 3배, MLA 디코딩 최대 17배 향상 같은 수치가 현실적 설득력을 갖는 이유가 여기 있어요.

엔비디아 NIM과 AMD AIMs의 대결 구도도 눈여겨볼 만해요. 둘 다 "모델+서빙+API를 컨테이너 하나로 패키징"하는 엔터프라이즈 배포 유닛인데, NIM은 폐쇄형 스택 위에, AIMs는 오픈소스 vLLM/SGLang 위에 올라가요. 벤더 락인을 두려워하는 엔터프라이즈라면 AIMs가 협상 카드가 되거든요. 한국 기업 중에도 삼성, 업스테이지, KT 클라우드, 네이버가 파트너로 언급된 걸 보면, 국내에서도 이 구도를 쓰는 플레이어가 늘고 있다는 신호예요.

AMD가 스펙 싸움 대신 '이식성'에 베팅한 전략이 본격적으로 먹히기 시작한 분위기. MoE 모델 확산으로 메모리 대역폭이 병목이 되면서 MI300X 계열의 HBM 강점이 현실적 설득력을 얻고 있다.

댓글

댓글

댓글을 불러오는 중...

ai-ml

알파벳, 클라우드 82% 성장했지만 AI 인프라 투자로 현금흐름 첫 적자

알파벳이 2분기 매출 1198억 달러를 기록하며 시장 전망을 넘겼고, 클라우드 매출은 82% 급증한 248억 달러까지 뛰었다. 하지만 AI 인프라에 분기 449억 달러를 투입하면서 잉여현금흐름은 2004년 상장 이후 처음으로 분기 적자를 냈다.

ai-ml

알파벳 클라우드 매출 82% 폭증했는데, 클라우드 ETF는 왜 빠졌나

알파벳의 2분기 클라우드 매출이 전년 대비 82% 늘며 월가 예상치를 크게 넘었지만, 클라우드 관련 ETF는 오히려 하락했다. 시장은 이제 클라우드 매출 성장률만 보는 게 아니라, 그 매출을 만들기 위해 데이터센터와 칩에 얼마나 많은 자본지출이 들어갔는지를 따지고 있다.

ai-ml

젠슨 황 “중국산 오픈소스 AI, 좋으면 써야 한다”

젠슨 황 엔비디아 CEO가 미국 정부의 중국산 오픈소스 AI 모델 규제 움직임에 반대했다. 딥시크, 알리바바, 문샷 AI 같은 중국 모델이 백도어라는 우려는 오해에 가깝고, 좋은 오픈소스 모델은 기업들이 활용할 수 있어야 한다는 주장이다.

ai-ml

업스테이지 ‘솔라 오픈 2’ 공개, 한국어·에이전트 성능으로 독파모 2라운드 승부

업스테이지가 오픈웨이트 LLM ‘솔라 오픈 2’를 공개했다. 2500억 매개변수 중 150억 개만 활성화하는 MoE 구조, 100만 토큰 컨텍스트, H200 2장 구동 가능성을 앞세워 한국어·에이전트·기업 도입성을 동시에 노린 모델이다.

ai-ml

아이벡스, 오픈소스 로봇·비전으로 볼트 검사 투입 자동화한다

아이벡스가 정보통신산업진흥원의 오픈소스 사업화 과제에 선정돼 케이피에프의 자분탐상 검사라인 자동화에 들어간다. 벌크 상태로 쏟아지는 볼트류를 AI 비전으로 인식하고, 6D 자세 추정과 로봇 제어로 집어서 검사장비에 넣는 흐름까지 구현하는 게 핵심이다.