• SKT 에이닷 통화요약을 시작으로 에이닷 음성합성기능, AI 고객센터, 스캠뱅가드 등 SKT의 주요 AI 서비스 4개 핵심 기능에 국산 NPU 적용 확대
  • 첫 상용 적용 서비스 ‘에이닷 통화요약’, 반년 이상 안정 구동하며 검증된 인프라 성능 확인… 4개 서비스 하루 1,400만 건·40억 토큰 처리하며 글로벌 대규모 상용 AI에 견줄 운영 역량 입증
  • 국산 NPU로 대규모 통신·미디어·상담·보안 서비스 구동하는 실증 사례 제시… 소버린 AI, 담론 넘어 일상 속 대중 AI 서비스로 실현

2026년 9월 21일 – AI 반도체 기업 리벨리온(대표 박성현)은 자사의 NPU가 SK텔레콤(이하 SKT)의 상용 AI 서비스 4개의 핵심 기능에 확대 적용됐다고 밝혔다. 2025년 12월 ‘에이닷 통화요약’에 첫 상용 적용된 이후 반년여 만에 에이닷 음성합성기능(스트리밍 TTS[1]), AI 고객센터(이하 AICC), 스캠뱅가드’ 미끼문자 탐지 기능까지  적용 범위가 확대되며 국산 AI 반도체의 기술력을 입증했다.

양사는 지난해 6월 SKT 주요 AI 서비스에 국산 NPU를 적용하기 위한 테스트에 착수한다고 발표한 바 있다. 이후 같은 해 12월 에이닷 통화요약의 ‘관계추정 기능’에 리벨리온의 AI 반도체 ‘아톰맥스(ATOM-Max)’ 기반 서버가 처음으로 상용 적용됐고, 현재까지 반년 이상 국민 대상 서비스를 안정적으로 구동하고 있다.

특히 에이닷 통화요약의 안정적인 운영 실적을 바탕으로 리벨리온은 SKT 주요 서비스에 대한 적용 범위를 빠르게 넓혔다. 구체적으로는 올 6월부터 순차적으로 ▲에이닷 통화요약 ‘한 줄 요약 기능’ ▲에이닷 ‘음성합성기능(스트리밍 TTS)’ ▲AICC ‘상담 후처리 및 검색 시스템’ ▲스캠뱅가드 ‘미끼문자 탐지 기능’에 순차적으로 NPU를 도입했다. 현재 이들 총 4개 서비스에서 리벨리온 인프라가 감당하는 실시간 AI 트래픽은 하루 약 1,400만 건에 달한다. 이를 AI 모델이 텍스트를 처리하는 최소 단위인 토큰으로 환산하면 하루 40억 개를 넘는다. 이는 글로벌 기업들이 대규모 상용 AI 운영 사례에서 공개하고 있는 하루 수십억 개 단위의 토큰 처리량에 견줄 만한 규모다.

이번 확대는 국산 NPU가 실험실 데모 수준을 넘어 대규모 실시간 트래픽을 감당하는 ‘검증된 인프라’로 자리 잡았음을 보여준다. 특히 NPU의 저지연·고성능 연산 능력을 바탕으로, 텍스트 생성과 동시에 문장 단위로 즉시 음성을 합성하는 ‘에이닷 스트리밍 TTS’ 등 고난도 실시간 서비스를 안정적으로 구동하며 빠르고 자연스러운 대화 경험을 제공하고 있다. 또한 글로벌 표준 AI 개발·배포 환경을 완벽히 지원해 ‘스캠뱅가드’가 서비스 중단 없이 신종·변종 사기 문자 탐지 모델을 즉시 적용할 수 있도록 뒷받침한다.

리벨리온의 NPU를 적용함으로써, SKT는 AI 모델의 크기와 성능 특성에 따라 GPU와 NPU를 재배치해 전사 컴퓨팅 자원을 효율화하고 있다. 또한 NPU 수십 대, 카드 수백 장을 묶은 ‘NPU 팜(Farm)’을 구성하고 사내 여러 서비스가 동일한 NPU 자원을 공유하는 풀(Pool) 방식으로 인프라 운영 효율을 높였다.

리벨리온 박성현 대표는 “지난 1년은 국산 NPU가 ‘가능성’에서 ‘검증된 인프라’로 넘어온 시간이었다. 국민이 매일 쓰는 서비스 4개가 리벨리온 인프라 위에서 안정적으로 돌아가고 있다는 사실이 무엇보다 확실한 증거”라며 “앞으로도 대규모 상용 운영 실적을 바탕으로 국내외 AI 서비스의 저변을 넓혀 나가겠다”고 말했다.

SKT 박병관 Core플랫폼담당은 “AI 컴퓨팅 수요가 증가함에 따라 GPU뿐만 아니라 리벨리온의 NPU를 적극 도입하여 활용하고 있다. AI 서비스 태스크별 특성에 맞춰 GPU와 NPU를 선별적으로 활용 및 재배치해 전사 AI 자원 활용의 효율성을 높였다”며, “앞으로도 NPU팜을 확대하여 국산 NPU 반도체 활용 시너지를 극대화하고, 사내외 AI 컴퓨팅 수요에 기민하게 대응할 예정이다”라고 말했다. 리벨리온은 SKT의 AI 파운데이션 모델 ‘A.X K1’ 구동에 이어 이번 상용 서비스 확대까지 성공시키며 소버린 AI의 실질적 성과를 입증했다. 향후 검증된 대규모 트래픽 처리 역량과 효율성을 바탕으로 금융·통신·공공 등 다양한 산업으로 NPU 인프라 공급을 넓혀갈 계획이다.


[1] 스트리밍 TTS: LLM이 생성하는 응답을 문장 단위로 나눠 즉시 음성 합성·재생하는 방식. 답변 전체가 완성되기를 기다린 뒤 음성으로 변환하던 기존 방식 대비 응답 지연을 크게 줄인다.