에너지경제 포토

김나현

knh@ekn.kr

김나현기자 기사모음




모레, GPU 달라도 한데 묶는다…‘토큰 팩토리 OS’ 공개

에너지경제신문   | 입력 2026.09.16 17:49

美 AI 인프라 서밋서 이기종 가속기 기술 공개
H100·MI300X 결합해 추론 처리량 1.67배↑

15일 오후(현지시간) 'AI 인프라 서밋 2026'에서 모레 조강원 대표가 주제 발표를 진행하고 있다.

▲15일 오후(현지시간) 'AI 인프라 서밋 2026'에서 모레 조강원 대표가 주제 발표를 진행하고 있다. 사진=모레


AI 인프라 솔루션 기업 모레가 엔비디아와 AMD 등 서로 다른 AI 가속기를 하나의 자원처럼 활용하는 '토큰 팩토리 OS'를 공개했다. 특정 GPU에 의존하지 않고 여러 가속기에 AI 추론 작업을 나눠 처리해 데이터센터의 연산 효율을 높이는 기술이다.


모레는 15~17일(현지시간) 미국 산타클라라 컨벤션센터에서 열리는 'AI 인프라 서밋 2026'에 참가해 토큰 팩토리 OS와 이기종(Heterogeneous) 가속기 기반 분산 추론 기술을 선보였다고 16일 밝혔다. 이기종 가속기는 엔비디아와 AMD처럼 제조사나 설계 방식이 서로 다른 AI 연산용 반도체를 뜻한다.


토큰 팩토리 OS는 데이터센터에 있는 여러 종류의 가속기를 하나의 자원 풀로 묶어 운용하는 AI 인프라 소프트웨어다. 특정 GPU나 추론 엔진에 종속되지 않고 AI 모델과 요청, 가속기의 연산 특성에 따라 추론 작업을 배분한다.




모레는 이를 구현하는 기술로 'MoAI Inference Framework'를 제시했다. 엔비디아와 AMD, 텐스토렌트 등 서로 다른 가속기를 하나의 클러스터처럼 구성하고 각 가속기의 특성에 맞춰 추론 작업을 분산하는 방식이다.


실제 엔비디아 H100과 AMD MI300X를 결합한 분산 추론 결과도 공개했다. 입력된 문맥을 처리하는 프리필(Prefill)은 H100이, 이를 바탕으로 답변을 생성하는 디코드(Decode)는 MI300X가 각각 맡도록 구성했다. 두 가속기 사이의 데이터 처리는 모레의 분산 추론 소프트웨어로 연계했다.


모레에 따르면, 이 방식은 동일 업체의 가속기로 구성한 시스템보다 처리량이 최대 1.67배 높았다. 하나의 가속기에서 전체 추론 과정을 처리하는 대신 작업별로 적합한 가속기에 연산을 나눠 처리 효율을 높였다는 설명이다.


모레가 이기종 가속기 운용에 나선 것은 AI 데이터센터에서 서로 다른 업체와 세대의 가속기를 함께 사용하는 환경이 확대되고 있어서다. 생성형 AI 확산으로 GPU 확보량이나 개별 GPU의 성능뿐 아니라 보유한 연산 자원을 얼마나 효율적으로 활용해 토큰을 처리하느냐가 중요해지고 있다는 게 회사 측 설명이다.


조강원 모레 대표는 “AI 데이터센터는 GPU를 제공하는 공간에서 토큰을 생산하고 판매하는 '토큰 팩토리'로 진화하고 있다"며 “중요한 것은 특정 GPU의 성능이 아니라 서로 다른 가속기를 얼마나 효율적으로 활용해 낮은 비용으로 토큰을 생산하느냐"라고 말했다.


모레는 이기종 가속기 통합 운용 기술을 데이터센터 단위로 확대할 계획이다. GPU와 NPU 등 다양한 가속기를 특정 하드웨어에 종속되지 않고 하나의 인프라처럼 운용할 수 있도록 토큰 팩토리 OS 개발을 이어간다는 방침이다.



배너