Nvidia CMX/STX로 본 KV Cache 확장 생태계 총정리

ai-ml 2026-03-30 약 7분

 tags

#nvidia #kv-cache #llm-inference #storage #gtc-2026

vote

북마크

Nvidia가 GTC 2026에서 발표한 CMX 플랫폼과 STX 레퍼런스 아키텍처를 중심으로 KV Cache 확장 생태계를 상세히 분석. GPU HBM → CPU DRAM → 로컬 SSD → 네트워크 스토리지의 4-tier 계층 구조에 BlueField-4 DPU를 핵심으로 하는 새로운 G3.5 tier가 추가됨. 15개 이상의 스토리지 파트너와 8개 얼리 어답터가 참여하며 2026년 하반기 출시 예정.

1
KV Cache는 LLM inference의 attention mechanism에서 key-value pair를 저장해 재계산을 피하는 메커니즘
2
CMX는 NVMe 기반 스토리지로 KV cache를 확장하며, BlueField-4 DPU가 I/O plane을 담당
3
STX 레퍼런스 아키텍처: Vera Rubin + BF-4 + ConnectX-9 + Spectrum-X Ethernet
4
기존 대비 5배 전력 효율, 5배 tokens/second 향상 주장
5
15+ 스토리지 파트너 참여, 2026 하반기 출시 예정이나 현재 Rubin GPU 랙에만 적용

Nvidia CMX/STX: KV Cache 확장의 새로운 표준

KV Cache란 무엇인가
- LLM inference 시 이전 layer의 activation(key-value pair)을 저장하는 메커니즘
- 재계산을 피해 성능을 향상시킴 - transformer의 attention mechanism에 적용됨
- context가 커지면 GPU HBM을 초과하게 되고, eviction된 데이터를 재계산하면 latency 증가
- Agentic AI와 long-context 워크로드가 이 문제를 더 심화시킴
Nvidia의 4-tier KV Cache 계층 구조
- GPU HBM → CPU DRAM → 로컬 SSD → 네트워크 스토리지
- 새로운 G3.5 tier 도입: Ethernet-attached flash tier로 KV cache에 최적화
- G3.5는 in-Pod G3 tier와 off-Pod G4 tier 사이를 연결하는 역할
- 각 tier는 접근 시간이 길어지지만, 재계산 시간보다는 빠를 수 있음

CMX (Inference Context Memory Storage Platform)

CES 2026에서 ICMSP로 발표 → CMX로 리브랜딩
- NVMe 기반 스토리지로 GPU KV cache를 확장
- NVMe-resident KV cache를 context memory address space의 일부로 만듦
- inference 실행 간에도 persistent하게 유지됨
핵심 하드웨어: BlueField-4 DPU
- Grace CPU 탑재, 최대 800 Gbps throughput
- 하드웨어 가속 cache placement로 metadata overhead 제거
- NVMe-oF 및 object/RDMA 프로토콜 처리
- GPU 노드로부터의 secure, isolated access 보장
소프트웨어 스택
- Dynamo: 분산 inference 프레임워크, KV cache offloading 지원
- NIXL (Nvidia Inference Transfer Library): 저지연 전송
- vLLM, TensorRT-LLM 등과 통합
- DOCA 프레임워크로 마이크로서비스 가속
성능 주장: 기존 스토리지 대비 5배 전력 효율, 5배 높은 tokens/second

STX 모듈형 레퍼런스 아키텍처

GTC 2026에서 발표 - CMX 구현을 위한 하드웨어 레퍼런스 설계
- Vera Rubin accelerator + BF-4 + ConnectX-9 SuperNIC + Spectrum-X Ethernet
- 기존 CPU 아키텍처 대비 4배 에너지 효율
- 엔터프라이즈 AI 데이터 수집 속도 2배 향상
15개 이상의 스토리지 파트너가 참여
- VAST Data, WEKA, DDN, Dell, HPE, NetApp, Nutanix, Cloudian, MinIO 등
- 각 벤더가 BF-4 DPU에 자사 소프트웨어를 포팅해야 하는 과제가 있음
- disaggregated/scale-out 아키텍처를 가진 벤더(HPE Alletra, Everpure FlashBlade, NetApp AFX, VAST Data)가 유리
얼리 어답터: CoreWeave, Crusoe, IREN, Lambda, Mistral AI, Nebius, OCI, Vultr
STX 기반 플랫폼은 2026년 하반기 출시 예정

주요 벤더별 구현 현황

DDN: Infinia OS로 KV cache loading 최대 27배 빠르게, sub-ms latency, token당 비용 두 자릿수 감소 주장
VAST Data: CNode 소프트웨어가 BF-4 내부에서 실행, G3.5 JBOF에서 G2 DRAM으로 직접 전송 (G3 tier 경유 안 함)
WEKA: Augmented Memory Grid로 이미 KV cache 확장 제공 중, STX 통합 시 4-10배 tokens/second 향상 예상
MinIO: AIStor가 BF-4 DPU 내부에서 네이티브 실행 → 별도 스토리지 서버 불필요
대안적 접근: PEAK:AIO는 NVMe 대신 CXL memory 사용, Pliops는 ASIC 기반 PCIe 카드 방식

ℹ️참고

> CMX/STX는 현재 Nvidia Rubin GPU 랙에만 적용됨. 대규모 데이터센터 밖의 AI inference 시장에는 아직 해당되지 않으며, 대부분의 벤더가 실제 제품을 아직 출시하지 않은 상태임.

기술 맥락: KV Cache는 LLM inference에서 transformer의 attention layer가 생성하는 key-value pair를 저장하는 메커니즘으로, "Attention Is All You Need" (2017) 논문에서 기반 개념이 제시됨. GPU HBM 용량을 초과하는 context에 대해 계층적 스토리지로 확장하는 것이 핵심 과제이며, Nvidia는 이를 플랫폼 수준에서 표준화하려는 시도를 하고 있음. BF-4 DPU가 스토리지 I/O plane을 담당하면서 NVMe-oF와 RDMA 프로토콜을 처리하는 구조는 기존 스토리지 아키텍처와 근본적으로 다른 접근임. 다만 이 생태계는 아직 초기 단계이며 Rubin GPU 인프라에 종속적이라는 한계가 있음.

Nvidia가 KV Cache 확장을 플랫폼 수준에서 표준화하려는 시도는 LLM inference 인프라의 핵심 병목을 정조준하고 있음. 다만 Rubin 생태계에 종속적이고 대부분의 벤더가 아직 실제 제품을 출시하지 않아 실질적 검증은 시간이 필요함.

이전 기사 (P)

다음 기사 (N)

댓글을 불러오는 중...

ai-ml 2026-07-13

애플 새 음성 인식 API, 온디바이스 영어 전사에서 위스퍼 스몰까지 이겼다

애플의 새 음성 인식 API인 스피치애널라이저가 리브리스피치 벤치마크에서 기존 SFSpeechRecognizer는 물론 위스퍼 스몰보다도 낮은 단어 오류율을 기록했어. 깨끗한 음성에서는 2.12%, noisy 음성에서는 4.56%로, 기존 애플 API 대비 오류율을 3.5~4배 줄였고 위스퍼 스몰보다 약 3배 빠르게 돌았어. 다만 영어·애플 플랫폼·OS 26 조건의 결과라, 다국어와 크로스플랫폼에서는 여전히 위스퍼의 장점이 남아 있어.

ai-ml 2026-07-13

AI를 진짜 잘 쓰는 기업, 미국 증시에서 연 30% 프리미엄 받는다는 연구

예일대와 로체스터대 연구진이 기업의 실제 대형 언어 모델 사용 데이터를 분석했더니, AI 활용도가 높은 상위 20% 기업이 하위 20%보다 주당 평균 0.64% 높은 초과수익률을 냈다. 단순히 AI 기업이냐가 아니라, 업무에 AI를 얼마나 깊게 쓰는지가 시장 가치에 반영되고 있다는 얘기다.

ai-ml 2026-07-13

ZTE, AI 에이전트폰으로 스마트폰 재도전…진짜 승부처는 앱 생태계

ZTE가 바이트댄스의 더우바오를 탑재한 AI 에이전트 스마트폰으로 시장 재진입을 노린다. 핵심은 사용자가 명령하면 AI가 여러 앱을 직접 열고 조작하는 방식인데, 위챗·타오바오·알리페이 같은 플랫폼과 충돌하면서 생태계 문제가 가장 큰 변수로 떠올랐다.

ai-ml 2026-07-13

노벨상 학자들까지 “AI 경제 충격, 지금 제도 안 만들면 늦다”

노벨 경제학상 수상자 15명을 포함한 학자와 기술 업계 인사 약 200명이 AI가 향후 10년 안에 경제를 급격히 바꿀 수 있다며 정책 대응을 촉구했다. 이들은 산업혁명보다 큰 변화가 훨씬 짧은 시간에 올 수 있고, 대규모 일자리 대체와 생활 수준 향상이라는 양면성이 동시에 존재한다고 봤다.

ai-ml 2026-07-13

NHN, AI 데이터센터 매출 기대감에 목표주가 5만6000원으로 상향

한국투자증권이 NHN의 목표주가를 4만5000원에서 5만6000원으로 올리고 투자의견 매수를 유지했다. 핵심 근거는 양평 AI 데이터센터 가동, 공공·민간 GPU 클러스터 수주 확대, 클라우드 사업부 신규 매출 반영이다.

Nvidia CMX/STX로 본 KV Cache 확장 생태계 총정리

요약

핵심 포인트

분석

Nvidia CMX/STX: KV Cache 확장의 새로운 표준

CMX (Inference Context Memory Storage Platform)

STX 모듈형 레퍼런스 아키텍처

주요 벤더별 구현 현황

인사이트

댓글

댓글

Nvidia CMX/STX로 본 KV Cache 확장 생태계 총정리

요약

핵심 포인트

분석

Nvidia CMX/STX: KV Cache 확장의 새로운 표준

CMX (Inference Context Memory Storage Platform)

STX 모듈형 레퍼런스 아키텍처

주요 벤더별 구현 현황

인사이트

댓글

댓글

관련 기사