본문 바로가기
에셋매니저 에셋매니저

아크릴 소버린 AX 전략 분석: GPU를 더 사기 전에 가동률을 높여야 하는 이유

읽는 시간 약 11분

기업과 공공기관의 인공지능 투자가 확대되면서 고성능 GPU 확보 경쟁도 치열해지고 있다. 하지만 비싼 장비를 많이 보유하는 것만으로 AI 경쟁력이 완성되는 것은 아니다. 실제 작업에 투입되는 비율이 낮거나 네트워크 병목이 발생하면 대규모 투자를 하고도 기대한 성능을 얻기 어렵기 때문이다.

AI 전환 인프라 기업 아크릴은 2026년 8월 21일 서울 코엑스에서 열린 ‘OCP 코리아 테크 데이’에서 이러한 문제를 해결하기 위한 소버린 AX 전략을 공개했다.

아크릴이 제시한 핵심은 단순하다. 새로운 GPU를 추가로 구매하기 전에 현재 보유한 장비가 얼마나 효율적으로 사용되고 있는지부터 정확히 측정해야 한다는 것이다.

OCP 코리아 테크 데이는 어떤 행사인가

OCP는 ‘Open Compute Project’의 약자로 데이터센터에 사용되는 서버, 네트워크, 스토리지, 전력과 냉각설비 등에 관한 개방형 기술 생태계를 구축하는 프로젝트다.

특정 제조사의 폐쇄적인 기술에만 의존하지 않고 기업들이 데이터센터 관련 설계와 기술을 공유해 효율성과 호환성을 높이는 것이 주요 목적이다.

2026 OCP 코리아 테크 데이에서는 다음과 같은 AI 인프라 기술이 주요 주제로 다뤄졌다.

  • 대규모 GPU와 AI 가속기 운영
  • 초고속 네트워크 구조
  • AI 데이터센터 전력 및 냉각 기술
  • 개방형 서버·스토리지 설계
  • AI 클러스터 운영 최적화
  • 차세대 메모리와 반도체 패키징

아크릴은 행사에서 GPU, AI 모델과 운영 플랫폼을 하나의 개방형 구조로 연결하는 소버린 AX 전략을 발표했다.

소버린 AX란 무엇인가

소버린 AX는 기업이나 기관이 AI 서비스에 필요한 데이터와 인프라, 모델 및 운영체계에 대한 통제권을 확보하는 전략이다.

소버린 AI가 국가나 조직의 데이터·기술 주권을 강조하는 개념이라면, 소버린 AX는 이러한 통제권을 실제 산업과 업무 환경에 적용하는 실행체계에 가깝다.

아크릴이 제시한 소버린 AX는 크게 세 개 계층으로 구분할 수 있다.

구분주요 구성요소필요한 통제 능력
인프라GPU·NPU·서버·스토리지·네트워크자원 배분과 장비 운영
모델자체 모델·오픈소스 모델·외부 모델업무별 모델 선택과 교체
운영학습·배포·관제·보안·LLMOps전체 AI 서비스 관리

각 계층을 개방형 인터페이스로 연결하면 특정 GPU 제조사나 클라우드, 외부 AI 모델에 대한 의존도를 낮출 수 있다. 기업은 비용과 성능, 보안 수준에 따라 필요한 기술을 선택하거나 교체할 수 있다.

소버린 AX가 모든 기술을 직접 개발해야 한다는 의미는 아니다. 핵심은 여러 공급자의 기술을 사용하더라도 데이터와 운영 의사결정권을 기업이 유지하는 데 있다.

GPU 보유량보다 중요한 실가동률

아크릴은 행사 발표에서 국내 산업계의 평균 GPU 실가동률이 50~60% 수준으로 알려져 있다고 설명했다.

예를 들어 기업이 GPU 100개를 보유하고 있어도 평균 가동률이 55%라면 실제로 작업에 사용되는 연산 능력은 약 55개 수준에 그칠 수 있다. 같은 장비의 가동률을 80%로 높이면 추가 구매 없이도 실질적인 연산 능력이 55개에서 80개 수준으로 증가한다.

단순 계산하면 가용 연산 능력이 약 45% 늘어나는 효과다. 이는 이해를 돕기 위한 예시이며, 실제 효율 개선 폭은 작업 종류와 장비 구성에 따라 달라진다.

GPU 활용도가 낮아지는 원인은 장비 부족보다 운영 문제에서 발생하는 경우가 많다.

  • 여러 부서가 GPU를 독점하거나 유휴 상태로 두는 경우
  • 작업 대기열이 효율적으로 배정되지 않는 경우
  • GPU 사이의 데이터 전송이 지연되는 경우
  • 특정 네트워크 경로에 트래픽이 집중되는 경우
  • 작업 실패와 재실행이 반복되는 경우
  • 서로 다른 종류의 GPU를 통합 관리하지 못하는 경우

따라서 AI 데이터센터의 효율을 평가할 때는 장비 숫자뿐 아니라 자원 배분과 작업 스케줄링, 네트워크 및 장애관리 수준을 함께 확인해야 한다.

GPUBASE는 어떤 역할을 할까

아크릴이 소버린 AX 구현을 위해 제시한 핵심 솔루션은 ‘GPUBASE’다. GPU와 서버, 스토리지 및 네트워크를 통합적으로 관리하는 AI 컴퓨팅 운영 플랫폼이다.

GPUBASE의 주요 기능은 다음과 같다.

  1. 사용자와 작업별 GPU 자원 배분
  2. AI 학습·추론 작업의 대기열 관리
  3. MIG·MPS 기반 GPU 가상화와 공유
  4. 노드 사이의 네트워크 경로 최적화
  5. 장애 감지와 운영상태 통합관제
  6. GPU·NPU 등 이기종 가속기 환경 지원

AI 모델을 여러 대의 GPU에서 학습하면 장비 사이에서 대량의 데이터를 주고받아야 한다. 이때 특정 네트워크 경로에 데이터가 집중되거나 한 노드의 처리가 지연되면 다른 GPU까지 작업을 기다리게 된다.

GPUBASE는 작업 특성에 따라 자원을 배분하고 통신 경로를 조정해 이러한 대기시간을 줄이는 것을 목표로 한다.

아크릴이 제시한 성능 수치

아크릴은 자체 실증 결과를 기준으로 GPUBASE가 다음과 같은 성능을 기록했다고 밝혔다.

측정 항목회사 제시 결과
GPU 실효 가동률93%
네트워크 경로 활용률98%
K-Scale Evaluation GPU 규모총 1,272개
대규모 학습 처리 성능미적용 환경 대비 최대 24배
평가 환경글로벌 클라우드 3곳·GPU 7종

해당 결과는 아크릴이 자체적으로 수행한 실증과 평가에서 나온 수치다. 모든 데이터센터와 AI 작업에서 동일한 성능이 보장된다는 의미는 아니다.

성능을 객관적으로 비교하려면 사용된 GPU 종류, 모델 크기, 작업시간, 비교 대상 시스템, 네트워크 구성과 측정 기준이 함께 공개돼야 한다.

GPU 가동률 93%를 해석할 때 주의할 점

GPU 가동률은 측정 방법에 따라 의미가 달라질 수 있다. 단순히 GPU에 작업이 배정된 시간을 측정할 수도 있고, 실제 연산장치가 적극적으로 동작한 시간을 기준으로 계산할 수도 있다.

높은 가동률이 항상 높은 생산성을 의미하는 것도 아니다. 비효율적인 작업이 계속 실행되거나 네트워크 대기와 재처리가 반복돼도 일부 측정지표에서는 가동 중인 것으로 나타날 수 있다.

따라서 기업은 다음 지표를 함께 확인해야 한다.

  • 시간당 처리할 수 있는 학습·추론 작업량
  • 작업 제출 이후 실행까지 걸리는 대기시간
  • AI 모델 학습 완료까지 필요한 총시간
  • 장애와 작업 재실행 발생률
  • GPU 한 대당 전력소비량
  • 작업 한 건당 인프라 비용
  • 최대 부하에서의 서비스 응답속도
  • 실제 사용부서별 자원 이용률

GPU 가동률은 중요한 지표지만, 전체 투자 효율을 판단하는 유일한 기준은 아니다.

특정 벤더 종속을 낮추는 전략

대규모 AI 인프라는 GPU 제조사와 클라우드 사업자, 네트워크 장비 및 운영 소프트웨어가 복잡하게 연결된다. 특정 공급자의 기술에 지나치게 의존하면 가격 인상이나 서비스 정책 변경, 장비 수급 문제에 대응하기 어려울 수 있다.

아크릴은 GPUBASE를 엔비디아 GPU뿐 아니라 AMD GPU와 TPU, 국산 NPU 등 서로 다른 가속기에서도 사용할 수 있는 소프트웨어 중심의 플랫폼으로 확장하고 있다.

기업이 업무에 따라 서로 다른 가속기를 선택하고 운영체계는 동일하게 유지할 수 있다면 장비 교체에 필요한 비용과 시간을 줄일 수 있다. 다만 실제 멀티벤더 운영에서는 드라이버와 개발도구, 모델 호환성 및 기술지원 수준을 별도로 검증해야 한다.

기업이 AI 인프라 투자 전에 확인할 사항

AI 데이터센터를 구축하거나 GPU를 추가로 구매하려는 기업은 다음 질문부터 확인할 필요가 있다.

  1. 현재 보유한 GPU의 평균·최대 가동률은 얼마인가?
  2. 작업 대기시간이 길어지는 원인은 자원 부족인가, 운영 문제인가?
  3. 네트워크나 스토리지가 GPU 성능을 제한하고 있지 않은가?
  4. 부서별로 사용하지 않는 GPU가 분산돼 있지 않은가?
  5. 가상화를 적용했을 때 성능 저하와 비용 절감 폭은 얼마인가?
  6. 특정 제조사나 클라우드에 대한 의존도가 어느 정도인가?
  7. 신규 장비 구매와 운영 최적화 중 어느 쪽의 경제성이 높은가?

정확한 계측 없이 장비부터 증설하면 일시적으로 처리능력은 늘어날 수 있지만 기존의 운영 비효율도 함께 확대될 가능성이 있다.

아크릴 전략의 사업화 관전 포인트

아크릴의 전략이 시장에서 인정받으려면 자체 실증 결과가 실제 고객 환경에서도 반복적으로 재현돼야 한다.

기술적 성과뿐 아니라 다음과 같은 사업지표도 중요하다.

  • GPUBASE 유료 고객과 공급계약 증가
  • 데이터센터별 장기 운영 실적
  • GPU 사용비용과 전력비 절감 규모
  • 대규모 클러스터에서의 장애 대응 능력
  • 다양한 GPU·NPU와의 호환성
  • 공공·금융·의료 분야의 구축 사례
  • 유지보수와 반복 매출 구조

높은 가동률이 고객의 비용 절감과 처리시간 단축으로 연결되고, 그 결과가 추가 계약으로 이어져야 기술 경쟁력이 실제 사업가치로 전환됐다고 평가할 수 있다.

결론

아크릴이 OCP 코리아 테크 데이에서 제시한 소버린 AX 전략의 핵심은 GPU 확보 경쟁에서 GPU 운영 경쟁으로 관점을 전환하자는 것이다.

AI 인프라의 경쟁력은 보유한 장비 수만으로 결정되지 않는다. 자원을 얼마나 공정하게 배분하고, 네트워크 병목을 줄이며, 다양한 가속기와 AI 모델을 하나의 환경에서 운영할 수 있는지가 중요하다.

아크릴이 공개한 GPU 실효 가동률 93%와 네트워크 경로 활용률 98%는 주목할 만한 자체 실증 결과다. 다만 실제 도입 여부를 판단할 때는 동일한 조건의 외부 검증과 비용 절감 효과, 장기간의 운영 안정성을 함께 살펴봐야 한다.

결국 소버린 AX의 본질은 모든 기술을 독자적으로 소유하는 데 있지 않다. 필요한 기술을 자유롭게 선택하면서 데이터와 인프라, 모델 및 운영에 관한 최종 통제권을 기업과 기관이 확보하는 데 있다.

※ 본문에 포함된 GPUBASE 성능 수치는 아크릴이 공개한 자체 실증 결과이며, 실제 성능은 하드웨어 구성과 AI 작업 환경에 따라 달라질 수 있습니다.

assetmanage
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.