🧠 Accelerator

커스텀 ASIC 개요

개요

커스텀 ASIC(Application-Specific Integrated Circuit)은 특정 워크로드에 최적화된 맞춤형 반도체 칩으로, GPU 등 범용 가속기 대비 높은 성능 효율과 낮은 지연 시간을 제공한다. AI 추론 분야에서는 Groq의 LPU(Language Processing Unit), Cerebras의 WSE(Wafer-Scale Engine), SambaNova의 RDU(Reconfigurable Dataflow Unit)가 대표적인 커스텀 ASIC으로 주목받고 있다.

이러한 커스텀 ASIC은 GPU의 SIMT(Single Instruction, Multiple Threads) 아키텍처에 의존하는 대신, 각각 독자적인 설계 철학으로 추론 워크로드의 메모리 병목과 연산 효율 문제를 해결한다. Groq는 정적 스케줄링과 결정론적 실행으로 극한의 지연 시간을 달성하고, Cerebras는 웨이퍼 스케일 통합으로 메모리 대역폭을 극대화하며, SambaNova는 데이터플로우 아키텍처로 연산과 메모리의 병렬화를 추구한다.

세 제품은 모두 "연산량을 더 많이 넣는 것"보다 "데이터 이동을 어떻게 줄일 것인가"에 초점을 둔다는 공통점이 있다. 차이는 병목을 제거하는 위치에 있다. Groq는 컴파일러가 시간축을 정리하고, Cerebras는 칩 크기를 극단적으로 키워 온칩 자원을 확대하며, SambaNova는 연산 그래프 자체를 데이터플로우 파이프라인으로 매핑해 활성화와 가중치 이동을 줄인다.

핵심 개념

커스텀 ASIC vs GPU

Custom ASIC vs GPU Comparison

GPU는 범용 병렬 처리에 최적화된 플랫폼으로, AI 훈련과 추론 모두에서 널리 사용된다. 그러나 GPU는 범용성을 위해 불필요한 오버헤드가 존재하며, 특히 추론 워크로드에서는 메모리 병목과 높은 레이턴시에 직면한다. 커스텀 ASIC은 특정 작업에만 특화되어 있어 GPU 대비 높은 토큰/와트 효율과 낮은 지연 시간을 달성한다.

특성 GPU 커스텀 ASIC
범용성 높음 (훈련+추론) 낮음 (특정 워크로드)
추론 지연 시간 상대적 높음 매우 낮음
에너지 효율 보통 높음
프로그래밍 용이성 높음 (CUDA) 낮음 (커스텀 SDK)
대규모 모델 지원 우수 모델별 차이
비용 높음 (범용) 워크로드에 따라

정적 스케줄링 vs 동적 스케줄링

커스텀 ASIC의 핵심 차별화 요소 중 하나는 정적 스케줄링이다. GPU는 동적 스케줄링을 통해 다양한 워크로드에 유연하게 대응하지만, 이는 불확실성과 오버헤드를 유발한다. Groq의 LPU는 컴파일 시점에 모든 연산을 미리 스케줄링하여 실행 중 결정론적 성능을 보장한다.

동적 스케줄링은 실행 시점에 리소스를 할당하므로 유연하지만, 캐시 미스, 메모리 간섭, 스케줄링 오버헤드 등으로 인해 지연 시간이 불안정하다. 반면 정적 스케줄링은 모든 메모리 접근과 연산 타이밍을 컴파일 시점에 결정하므로 매 실행마다 일관된 성능을 제공한다.

메모리 병목을 줄이는 방식의 차이

세 아키텍처는 모두 메모리 병목 완화를 목표로 하지만 접근 방식은 다르다. Groq는 온칩 메모리와 정적 스케줄링으로 실행 중 캐시 불확실성을 줄이고, Cerebras는 웨이퍼 전체를 하나의 거대한 연산/메모리 공간처럼 사용해 오프칩 왕복을 최소화하며, SambaNova는 PCU/PMU 스트리밍 파이프라인으로 연산과 데이터 준비를 겹쳐 실행한다.

접근 축 Groq LPU Cerebras WSE SambaNova RDU
병목 완화 위치 컴파일 시점 스케줄링 웨이퍼 스케일 온칩 통합 데이터플로우 파이프라인
주된 강점 일정한 지연 시간 매우 큰 온칩 자원 높은 데이터 이동 효율
적합한 운영 패턴 실시간 추론, 짧은 응답 SLA 초대형 모델 훈련/추론 에이전틱 추론, 다중 모델 전환
운영상 주의점 모델·컴파일 경로 제약 시스템 비용·배치 제약 SDK/런타임 적응 필요

동작 원리

Groq LPU 아키텍처

Groq LPU Architecture

Groq LPU는 2016년 설립 이래 추론 전용으로 설계된 단일 코어 아키텍처이다. 핵심 특징은 다음과 같다:

단일 코어 및 온칩 SRAM:
- 수백 MB의 SRAM을 가중치 저장소로 사용 (캐시가 아닌 저장소 역할)
- 캐시 미스로 인한 지연 시간 제거
- 텐서 병렬화를 통한 칩 간 효율적 확장

커스텀 컴파일러:
- 정적 스케줄링으로 모든 연산을 미리 배치
- 결정론적 실행으로 예측 가능한 성능 보장
- 데이터 도착 시간을 정확히 예측하여 네트워크 스케줄링 통합

칩 간 직접 연결:
- Plesiosynchronous 프로토콜을 사용한 직접 연결
- 캐시나 스위치에 의존하지 않는 데이터 전송
- 수백 개의 칩이 단일 코어처럼 동작

공기 냉각 설계:
- 복잡한 냉각 인프라 불필요
- 낮은 전력 소비와 운영 비용
- 환경 영향 최소화

Cerebras WSE 아키텍처

Cerebras WSE Architecture

Cerebras WSE는 웨이퍼 스케일 통합을 통해 세계 최대의 AI 프로세서를 구현한다. WSE-3의 주요 사양은 다음과 같다:

웨이퍼 스케일 통합:
- 다이 크기: 46,225 mm² (GPU 대비 58배)
- 트랜지스터: 4조 개
- AI 코어: 900,000개
- AI 성능: 125 PFLOPS

온칩 메모리 및 대역폭:
- GPU 대비 19배 더 많은 트랜지스터
- 28배 더 많은 연산 능력
- 메모리 병목 최소화를 위한 대용량 온칩 SRAM

실패 관대한(Fail-in-place) 아키텍처:
- 웨이퍼 전체를 하나의 칩으로 사용
- 결함이 있는 코어는 비활성화하고 우회
- 중복 컴퓨팅 코어와 라우팅으로 수율 문제 해결

배포 옵션:
- 클라우드: Cerebras Inference로 즉시 접근
- 전용: 프라이빗 클라우드 API/엔드포인트
- 온프레미스: 완전한 제어 환경

SambaNova RDU 아키텍처

SambaNova RDU Architecture

SambaNova RDU는 데이터플로우 아키텍처를 기반으로 한 재구성 가능한 AI 가속기이다. 핵심 특징은 다음과 같다:

데이터플로우 아키텍처:
- AI 연산 그래프의 자연스러운 데이터 흐름 활용
- 커널 간 호출 없이 어셈블리 라인 방식의 연산
- 메모리 병목 제거로 높은 토큰/와트 효율

프로그램 가능한 컴퓨팅 유닛(PCU) 그리드:
- PCU와 SRAM 프로그램 가능한 메모리 유닛(PMU)의 그리드 구조
- 하나의 연산자가 실행되는 동안 다음 연산자를 위한 데이터를 병렬로 가져옴
- 온칩 메모리와 컴퓨팅의 병렬화로 중간 활성화를 로컬에 유지

3계층 메모리 아키텍처:
- Tier 1 (온칩 SRAM): 활성화 및 가중치 스트리밍
- Tier 2 (HBM): 전체 모델과 KV 캐시 저장
- Tier 3 (DDR): 추가 메모리 용량

확장성:
- SN50 기준 최대 256개 RDU까지 확장
- 최대 10조 파라미터 모델 지원
- 모델 간 전환을 통한 에이전틱 워크로드 지원

비교 분석

특성 Groq LPU Cerebras WSE SambaNova RDU
설계 철학 정적 스케줄링, 결정론적 실행 웨이퍼 스케일 통합 데이터플로우 아키텍처
핵심 구조 단일 코어 + 온칩 SRAM 900K AI 코어 + 온칩 메모리 PCU/PMU 그리드
메모리 접근 컴파일 시점 결정 온칩 고대역폭 3계층 (SRAM/HBM/DDR)
확장 방식 칩 간 직접 연결 웨이퍼 내부 병렬 칩 간 AGCU 연결
냉각 방식 공기 냉각 공기/액체 냉각 공기 냉각
주요 강점 극한의 낮은 지연 시간 대규모 모델 처리 에이전틱 AI, 모델 전환
대표 제품 GroqChip, GroqRack CS-3, Cerebras Inference SN40, SN50, SambaRack
투자/평가 $750M 투자 (2025) 나스닥 상장 추진 Series E $350M (2026)

장단점

Groq LPU

장점:
- 결정론적 실행으로 일관된 성능
- 캐시 미스 없는 즉각적인 응답
- 공기 냉각으로 낮은 운영 비용
- OpenAI 호환 API로 쉬운 통합

단점:
- 단일 코어로 인한 대규모 모델 처리 제한
- 커스텀 컴파일러 학습 곡선
- GPU 대비 낮은 범용성
- 대규모 훈련 지원 불가

Cerebras WSE

장점:
- 세계 최대 AI 칩으로 대규모 모델 처리
- 온칩 메모리로 높은 대역폭
- 실패 관대한 아키텍처로 높은 수율
- 훈련과 추론 모두 지원

단점:
- 높은 제조 비용
- 특수 냉각 인프라 필요
- 프로그래밍 복잡성
- 제한된 생태계

SambaNova RDU

장점:
- 데이터플로우로 높은 에너지 효율
- 3계층 메모리로 유연한 모델 배포
- 에이전틱 AI에 최적화
- 모델 간 빠른 전환

단점:
- 상대적으로 짧은 시장 역사
- 커스텀 SDK 학습 필요
- GPU 생태계 대비 제한된 도구
- 대규모 훈련에서 GPU 대비 불리

관련 기술

참고 문헌 및 표준

관련 문서

관련 기술

  • 추론 최적화: 정적 스케줄링, 동적 배칭, 스페큘러티브 디코딩
  • 메모리 기술: HBM, 온칩 SRAM, 3계층 메모리
  • 시스템 아키텍처: 텐서 병렬화, 파이프라인 병렬화, 데이터플로우
  • 프로그래밍 모델: 커스텀 컴파일러, 데이터플로우 그래프, OpenAI 호환 API

핵심 정리

  1. 커스텀 ASIC은 특정 AI 추론 워크로드에 최적화되어 GPU 대비 높은 성능 효율을 제공한다.

  2. Groq LPU는 정적 스케줄링과 결정론적 실행으로 극한의 낮은 지연 시간을 달성하며, 공기 냉각으로 낮은 운영 비용을 실현한다.

  3. Cerebras WSE는 웨이퍼 스케일 통합으로 900,000개의 AI 코어를 하나의 칩에 통합하여 대규모 모델을 효율적으로 처리한다.

  4. SambaNova RDU는 데이터플로우 아키텍처와 3계층 메모리로 에이전틱 AI 워크로드에 최적화된 효율적인 추론을 제공한다.

  5. 각 커스텀 ASIC은 독자적인 설계 철학으로 GPU의 메모리 병목과 레이턴시 문제를 해결하며, AI 추론 인프라의 다양한 수요에 대응한다.