훈시 경제

생활에 필요한 경제 정보, 근거와 계산으로 살펴봅니다.

생활경제 · 2026년 10월 10일

AI 인프라 경쟁의 핵심이 데이터 이동 최소화로 바뀌는 이유

AI 인프라 경쟁의 핵심이 데이터 이동 최소화로 바뀌는 이유
AI로 만든 일반 설명용 장면입니다. 실제 사건·현장 사진이 아닙니다.

SK하이닉스 뉴스룸은 AI 생태계의 변화에 따라 시스템 설계의 패러다임이 '프로세서 중심'에서 '메모리 중심'으로 이동하고 있다고 분석했습니다. 이제 AI 성능은 단순히 더 빠른 GPU나 NPU를 확보하는 것을 넘어, 연산 장치와 메모리 사이에서 발생하는 불필요한 데이터 이동을 얼마나 효율적으로 줄이느냐에 의해 결정됩니다.

데이터 이동 비용이 왜 AI 성능의 병목이 되나요?

현재의 컴퓨팅 구조는 프로세서 중심입니다. 데이터는 처리 전후에 센서, 스토리지, 메모리를 거쳐 연산 장치까지 이동했다가 다시 돌아오는 과정을 반복합니다. 하지만 AI 워크로드가 고도화되면서 이 과정에서 발생하는 데이터 이동 비용이 시스템 효율을 저해하는 주요 요인이 되었습니다.

실제 연구에 따르면 D램에서 데이터를 한 번 읽어오는 데 드는 에너지는 단순 산술 연산보다 150배에서 2,000배까지 클 수 있습니다. 대형 머신러닝 모델의 경우 전체 시스템 에너지의 90% 이상이 연산이 아닌 메모리 접근과 데이터 이동에 소모되는 것으로 나타났습니다.

메모리 중심 컴퓨팅은 기존 방식과 무엇이 다른가요?

기존 구조가 데이터를 연산 장치로 가져와 처리하는 방식이라면, 메모리 중심 컴퓨팅은 데이터의 위치와 이동 비용을 설계 기준으로 삼아 메모리 배치와 연산 구조를 함께 최적화합니다. 핵심은 데이터를 더 빠르게 옮기는 것이 아니라, 가능한 한 덜 옮기도록 시스템을 구성하는 것입니다.

구체적인 구현 방식으로는 다음과 같은 접근들이 포함됩니다:

  1. 일부 데이터는 AI 가속기(GPU/NPU/TPU) 옆의 HBM에 배치
  2. 일부는 공유 메모리 풀에서 관리
  3. 특정 연산을 메모리 근처에서 먼저 수행

CXL과 NVLink 등 고속 인터커넥트가 어떤 역할을 하나요?

고속 인터커넥트는 장치 사이의 통로를 넓히고 워크로드에 따라 메모리와 연산 장치를 유연하게 묶어줍니다. CXL은 프로세서와 가속기, 메모리 장치 사이의 연결을 확장해 메모리 용량을 유연하게 늘리고 여러 장치가 메모리를 공유하거나 풀링할 수 있는 기반을 제공합니다.

반면 NVLink와 NVSwitch는 GPU 클러스터 내부의 고대역폭 연결을 담당합니다. 대규모 AI 모델이 여러 GPU와 노드에 걸쳐 실행될 때 발생하는 중간 데이터(모델 파라미터, KV 캐시 등)의 병목을 줄여 전체 처리 속도를 높입니다.

두 기술은 담당 영역이 다르지만, 데이터 이동 과정의 병목을 줄이고 시스템 자원을 효율적으로 쓰도록 한다는 공통된 목표를 가집니다. 이를 통해 AI 인프라는 데이터를 먼 곳으로 반복해서 보내는 구조에서 벗어나 데이터와 가까운 위치에서 처리가 수행되는 방향으로 나아갑니다.

근접 메모리 가속과 분리형 아키텍처는 어떻게 작동하나요?

근접 메모리 가속은 연산 기능을 데이터 가까이에 배치하여 중앙 연산 장치까지 오가야 하는 데이터 양을 줄이는 방식입니다. 예를 들어 '테서랙트' 설계는 여러 근접 메모리 가속기를 고속 인터커넥트로 연결해 병렬 그래프 처리에 적용했으며, 기존 프로세서 중심 설계 대비 약 10배 수준의 성능 개선과 유사한 에너지 절감을 보였습니다.

분리형 아키텍처는 CPU, AI 가속기, 메모리, 스토리지 등의 자원을 시스템 차원의 공유 풀로 구성합니다. 워크로드 성격에 따라 필요한 자원을 조합하는 방식이며, 큰 메모리 용량이 필요한 작업은 확장된 메모리 풀을 쓰고 대역폭 요구가 큰 작업은 메모리 인접 가속기에서 처리하는 식으로 유연하게 배치합니다.

메모리의 역할이 어떻게 변화하고 있나요?

AI 워크로드에서는 데이터 저장 및 공급 장치였던 메모리가 연산 위치와 시스템 효율을 함께 결정하는 설계 요소로 바뀌고 있습니다. 최근 연구에서는 D램 칩 내부에서 대규모 비트 연산이나 데이터 복사, 초기화 작업을 수행하는 'D램 내부 연산(processing-using-DRAM)' 가능성도 확인되었습니다.

자주 묻는 질문

메모리 중심 컴퓨팅이 기존 프로세서 중심 구조보다 어떤 방식으로 더 효율적인가요?

데이터를 중앙 연산 장치로 모두 보내는 대신, 데이터를 어디에 두고 어떤 경로로 처리할지 재설계하여 가능한 한 덜 옮기도록 시스템을 구성함으로써 성능과 전력 효율을 높입니다.

CXL과 NVLink/NVSwitch 기술은 어떤 차이가 있나요?

CXL은 메모리 확장과 공유를 지원하며 프로세서와 가속기 사이의 연결을 확장합니다. 반면 NVLink와 NVSwitch는 GPU 클러스터 내부에서 GPU 간 고대역폭 통신을 담당합니다.

AI 워크로드에서 데이터 이동이 왜 중요한 문제가 되나요?

LLM 추론 시 방대한 가중치와 문맥 데이터를 반복 참조해야 하며, D램에서 데이터를 읽어오는 에너지가 단순 연산보다 최대 2,000배까지 클 수 있기 때문입니다. 따라서 데이터 이동 최소화가 시스템 효율의 핵심 기준이 됩니다.

자료 게시일: 2026년 10월 02일 (한국 시간)

출처: [AI Ecosystem] 인프라 재설계: 구조가 성능을 결정한다 – SK hynix Newsroom