๐Ÿง  Accelerator

AMD GPU ์ƒ์„ธ

๊ฐœ์š”

AMD Instinct ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU๋Š” AI ํ›ˆ๋ จ๊ณผ ์ถ”๋ก , HPC ์›Œํฌ๋กœ๋“œ๋ฅผ ๊ฐ€์†ํ™”ํ•˜๋Š” ๋ฒ”์šฉ ๋ณ‘๋ ฌ ํ”„๋กœ์„ธ์„œ๋กœ, CDNA(Compute DNA) ์•„ํ‚คํ…์ฒ˜๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ๊ฐœ๋ฐœ๋˜์—ˆ๋‹ค. MI250X(CDNA2, 2021), MI300X(CDNA3, 2023)์€ ๊ฐ๊ฐ ์ถœ์‹œ ์‹œ์ ์˜ ์ตœ์ฒจ๋‹จ ๊ณต์ •๊ณผ ๋ฉ”๋ชจ๋ฆฌ ๊ธฐ์ˆ ์„ ์ ์šฉํ•˜์—ฌ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ ํ•™์Šต๊ณผ ์ถ”๋ก ์—์„œ ๊ฒฝ์Ÿ๋ ฅ ์žˆ๋Š” ์„ฑ๋Šฅ์„ ์ œ๊ณตํ•œ๋‹ค.

ํ˜„๋Œ€ ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(LLM)์€ ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜๊ฐ€ ์ˆ˜์ฒœ์–ต์—์„œ ์ˆ˜์กฐ ๊ฐœ๋กœ ์ฆ๊ฐ€ํ•˜๋ฉด์„œ, ๋‹จ์ผ GPU์˜ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰๊ณผ ๋Œ€์—ญํญ, ๊ทธ๋ฆฌ๊ณ  ํ…์„œ ์—ฐ์‚ฐ ์ฒ˜๋ฆฌ๋Ÿ‰์ด ๋™์‹œ์— ์ค‘์š”ํ•œ ๋ณ‘๋ชฉ์ด ๋˜์—ˆ๋‹ค. AMD๋Š” Matrix Core๋ฅผ ํ†ตํ•œ ํ–‰๋ ฌ ์—ฐ์‚ฐ ๊ฐ€์†, HBM ๋ฉ”๋ชจ๋ฆฌ ์„œ๋ธŒ์‹œ์Šคํ…œ ๊ณ ๋„ํ™”, Infinity Fabric ๊ณ ์† ์ธํ„ฐ์ปค๋„ฅํŠธ, ๊ทธ๋ฆฌ๊ณ  ROCm ์˜คํ”ˆ์†Œ์Šค ์†Œํ”„ํŠธ์›จ์–ด ์ƒํƒœ๊ณ„๋ฅผ ํ†ตํ•ด ์•„ํ‚คํ…์ฒ˜๋ฅผ ๋ฐœ์ „์‹œ์ผœ์™”๋‹ค.

ํ•ต์‹ฌ ๊ฐœ๋…

CDNA ์•„ํ‚คํ…์ฒ˜ ๋ฐœ์ „

AMD GPU Architecture Comparison

CDNA๋Š” AMD๊ฐ€ ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU๋ฅผ ์œ„ํ•ด ๊ฐœ๋ฐœํ•œ ์ „์šฉ ์•„ํ‚คํ…์ฒ˜๋กœ, ๊ฒŒ์ด๋ฐ์šฉ RDNA ์•„ํ‚คํ…์ฒ˜์™€ ๋ถ„๋ฆฌ๋˜์–ด AI/HPC ์›Œํฌ๋กœ๋“œ์— ์ตœ์ ํ™”๋˜์–ด ์žˆ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ ์ œ์กฐ ๊ณต์ • ์ถœ์‹œ ์—ฐ๋„ ํŠน์ง•
1์„ธ๋Œ€ CDNA TSMC 7nm 2020 ์ตœ์ดˆ Instinct ์ „์šฉ ์•„ํ‚คํ…์ฒ˜, MI100
2์„ธ๋Œ€ CDNA2 TSMC 6nm 2021 ๋งํฌ๋‹น 100GB/s, 2 GCD ํŒจํ‚ค์ง€
3์„ธ๋Œ€ CDNA3 TSMC 5nm/6nm 2023 ์นฉ๋ ›/3.5D ํŒจํ‚ค์ง€, 192GB HBM3, 5.3TB/s

CDNA2 ์•„ํ‚คํ…์ฒ˜ (MI250X):
- 220๊ฐœ Compute Units, 14,080 Stream Processors
- HBM2e 128GB, 3.2 TB/s ๋Œ€์—ญํญ
- Infinity Fabric 8๋งํฌ, ๋งํฌ๋‹น 100GB/s
- 2๊ฐœ์˜ GCD๋ฅผ ํ•œ ํŒจํ‚ค์ง€์— ์ง‘์ ํ•ด ์—ฐ์‚ฐ ๋ฐ€๋„ ํ™•์žฅ
- 6nm ๊ณต์ •์œผ๋กœ ์ „๋ ฅ ํšจ์œจ ๊ฐœ์„ 

CDNA3 ์•„ํ‚คํ…์ฒ˜ (MI300X):
- 304๊ฐœ Compute Units, 19,456 Stream Processors
- HBM3 192GB, 5.3 TB/s ๋Œ€์—ญํญ
- Infinity Cache 256MB ๋„์ž…
- 5nm/6nm ํ…Œํฌ๋†€๋กœ์ง€ ๋…ธ๋“œ ์ ์šฉ
- 1,530์–ต ํŠธ๋žœ์ง€์Šคํ„ฐ

CDNA ๊ณ„์—ด์€ RDNA์ฒ˜๋Ÿผ ๊ทธ๋ž˜ํ”ฝ ํŒŒ์ดํ”„๋ผ์ธ๊ณผ ๋ Œ๋”๋ง ๊ธฐ๋Šฅ์„ ์šฐ์„ ํ•˜์ง€ ์•Š๊ณ , ๋Œ€ํ˜• ํ–‰๋ ฌ ์—ฐ์‚ฐ๊ณผ ๋Œ€์—ญํญ ์ค‘์‹ฌ ์›Œํฌ๋กœ๋“œ์— ๋งž์ถฐ ์—ฐ์‚ฐ ์œ ๋‹›, HBM, ๋‹ค์ด ๊ฐ„ ํŒจ๋ธŒ๋ฆญ์„ ํ™•์žฅํ•ด ์™”๋‹ค. MI250X๋Š” ๋“€์–ผ GCD ํŒจํ‚ค์ง€, MI300X๋Š” ๋” ํฐ ์นฉ๋ › ์ง‘์ ๊ณผ HBM3 ์šฉ๋Ÿ‰ ํ™•์žฅ์„ ํ†ตํ•ด AI/HPC ์ค‘์‹ฌ ์„ค๊ณ„๋ฅผ ๊ฐ•ํ™”ํ–ˆ๋‹ค.

Matrix Core ์•„ํ‚คํ…์ฒ˜

Matrix Core๋Š” AMD GPU ๋‚ด๋ถ€์—์„œ ํ–‰๋ ฌ ๊ณฑ์…ˆ-๋ˆ„์ (Multiply-Accumulate, MMA) ์—ฐ์‚ฐ์„ ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€์—์„œ ๊ฐ€์†ํ™”ํ•˜๋Š” ํŠนํ™” ์œ ๋‹›์ด๋‹ค. NVIDIA Tensor Core์™€ ์œ ์‚ฌํ•œ ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•˜์ง€๋งŒ, AMD๋งŒ์˜ ๋…ํŠนํ•œ ๊ตฌํ˜„์„ ๊ฐ€์ง„๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ ์ง€์› ์ •๋ฐ€๋„ ํŠน์ง•
1์„ธ๋Œ€ CDNA FP16, INT8 ์ตœ์ดˆ Matrix Core ๋„์ž…
2์„ธ๋Œ€ CDNA2 FP16, BF16, INT8, INT4 BF16 ์ง€์› ํ™•๋Œ€
3์„ธ๋Œ€ CDNA3 FP16, BF16, FP8, INT8, FP64 FP8/FP64 Matrix Core ์ถ”๊ฐ€

MI300X Matrix Core ์„ฑ๋Šฅ:
- FP8: 2.61 PFLOPS (๊ตฌ์กฐ์  ํฌ์†Œ์„ฑ ์ ์šฉ ์‹œ 5.22 PFLOPS)
- FP16/BF16: 1.3 PFLOPS (๊ตฌ์กฐ์  ํฌ์†Œ์„ฑ ์ ์šฉ ์‹œ 2.61 PFLOPS)
- FP64 Matrix: 163.4 TFLOPS
- FP32 Matrix: 163.4 TFLOPS

HBM ๋ฉ”๋ชจ๋ฆฌ ์„œ๋ธŒ์‹œ์Šคํ…œ

AMD Instinct GPU๋Š” HBM(High Bandwidth Memory)์„ ์‚ฌ์šฉํ•˜์—ฌ ์—ฐ์‚ฐ ์œ ๋‹›์— ๋Œ€๋Ÿ‰์˜ ๋ฐ์ดํ„ฐ๋ฅผ ๋น ๋ฅด๊ฒŒ ๊ณต๊ธ‰ํ•œ๋‹ค. MI300X๋Š” 192GB HBM3๋ฅผ ํƒ‘์žฌํ•˜์—ฌ NVIDIA H100(80GB) ๋Œ€๋น„ 2.4๋ฐฐ์˜ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰์„ ์ œ๊ณตํ•œ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ HBM ์ข…๋ฅ˜ ์šฉ๋Ÿ‰ ๋Œ€์—ญํญ ๋ฒ„์Šค ํญ LLC
MI250X CDNA2 HBM2e 128GB 3.2 TB/s 8192-bit -
MI300X CDNA3 HBM3 192GB 5.3 TB/s 8192-bit 256MB

MI300X๋Š” 256MB Infinity Cache(LLC)๋ฅผ ๋„์ž…ํ•˜์—ฌ ์บ์‹œ ํžˆํŠธ์œจ์„ ๋†’์ด๊ณ  ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ ์‚ฌ์šฉ์„ ์ตœ์ ํ™”ํ•œ๋‹ค. ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ์˜ ๊ฐ€์ค‘์น˜์™€ ํ™œ์„ฑ๊ฐ’์ด ์บ์‹œ์— ๋จธ๋ฌผ ๊ฒฝ์šฐ ์‹ค์ œ ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ๋ณด๋‹ค ๋†’์€ ์œ ํšจ ๋Œ€์—ญํญ์„ ๋‹ฌ์„ฑํ•œ๋‹ค.

Infinity Fabric ์ธํ„ฐ์ปค๋„ฅํŠธ

Infinity Fabric์€ AMD์˜ ๊ณ ์† ๋‹ค์ด ๊ฐ„ ์ธํ„ฐ์ปค๋„ฅํŠธ ๊ธฐ์ˆ ๋กœ, CPU-GPU ๊ฐ„ ํ†ต์‹ ๊ณผ ๋‹ค์ค‘ GPU ๊ฐ„ ๋ฐ์ดํ„ฐ ๊ตํ™˜์„ ๋‹ด๋‹นํ•œ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ ๋งํฌ๋‹น ๋Œ€์—ญํญ ์ด ๋Œ€์—ญํญ (GPU๋‹น) ์ตœ๋Œ€ GPU ์—ฐ๊ฒฐ
IF Gen3 CDNA2 100 GB/s (์–‘๋ฐฉํ–ฅ) 800 GB/s 8 GPU
IF Gen4 CDNA3 128 GB/s (์–‘๋ฐฉํ–ฅ) 1,024 GB/s 8 GPU

Infinity Fabric์€ ๋‹จ์ˆœํ•œ GPU ๊ฐ„ ํ†ต์‹ ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ, CPU์™€ GPU ๊ฐ„์˜ ๋ฉ”๋ชจ๋ฆฌ ์ผ๊ด€์„ฑ๋„ ์œ ์ง€ํ•œ๋‹ค. MI300A APU๋Š” CPU์™€ GPU๊ฐ€ ๋™์ผํ•œ ๋ฉ”๋ชจ๋ฆฌ ๊ณต๊ฐ„์„ ๊ณต์œ ํ•˜์—ฌ, ๋ฉ”๋ชจ๋ฆฌ ๋ณต์‚ฌ ์—†์ด ์ง์ ‘ ์ ‘๊ทผ์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

๋น„๊ต/๋ถ„์„

AMD Instinct GPU ์„ธ๋Œ€ ๋น„๊ต

ํ•ญ๋ชฉ MI250X MI300X
์•„ํ‚คํ…์ฒ˜ CDNA2 CDNA3
์ œ์กฐ ๊ณต์ • TSMC 6nm TSMC 5nm/6nm
ํŠธ๋žœ์ง€์Šคํ„ฐ ์ˆ˜ 580์–ต 1,530์–ต
Compute Units 220 304
Stream Processors 14,080 19,456
๋ถ€์ŠคํŠธ ํด๋Ÿญ 1,700 MHz 2,100 MHz
๋ฉ”๋ชจ๋ฆฌ 128GB HBM2e 192GB HBM3
๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ 3.2 TB/s 5.3 TB/s
LLC (Infinity Cache) - 256MB
FP32 ์„ฑ๋Šฅ 47.9 TFLOPS 163.4 TFLOPS
FP64 ์„ฑ๋Šฅ 47.9 TFLOPS 81.7 TFLOPS
FP64 Matrix 95.7 TFLOPS 163.4 TFLOPS
FP16/BF16 383 TFLOPS 1.3 PFLOPS
FP8 - 2.61 PFLOPS
INT8 383 TOPS 2.6 POPS
Infinity Fabric 800 GB/s 1,024 GB/s
TDP 500W/560W 750W
ํผ ํŒฉํ„ฐ OAM OAM

NVIDIA GPU์™€์˜ ๋น„๊ต

ํ•ญ๋ชฉ MI250X MI300X H100 SXM5 H200 SXM5
๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰ 128GB 192GB 80GB 141GB
๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ 3.2 TB/s 5.3 TB/s 3.35 TB/s 4.8 TB/s
FP16/BF16 383 TFLOPS 1.3 PFLOPS 990 TFLOPS 990 TFLOPS
FP8 - 2.61 PFLOPS 1,980 TFLOPS 1,980 TFLOPS
FP64 47.9 TFLOPS 81.7 TFLOPS 34 TFLOPS 34 TFLOPS
TDP 560W 750W 700W 700W
์†Œํ”„ํŠธ์›จ์–ด ROCm ROCm CUDA CUDA

MI300X๋Š” NVIDIA H100/H200 ๋Œ€๋น„ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰๊ณผ ๋Œ€์—ญํญ์—์„œ ๋šœ๋ ทํ•œ ์šฐ์œ„๋ฅผ ๊ฐ€์ง„๋‹ค. ํŠนํžˆ 192GB HBM3๋Š” LLM ์ถ”๋ก  ์‹œ ๋” ํฐ ๋ชจ๋ธ์„ ๋‹จ์ผ GPU์— ์˜ฌ๋ฆด ์ˆ˜ ์žˆ๊ฒŒ ํ•˜์—ฌ, ๋ชจ๋ธ ๋ณ‘๋ ฌ ์ฒ˜๋ฆฌ์˜ ํ•„์š”์„ฑ์„ ์ค„์ธ๋‹ค. ๋ฐ˜๋ฉด CUDA ์ƒํƒœ๊ณ„ ๋Œ€๋น„ ROCm์˜ ์†Œํ”„ํŠธ์›จ์–ด ์„ฑ์ˆ™๋„์™€ ์šด์˜ ๊ฒฝํ—˜์€ ์—ฌ์ „ํžˆ ์ค‘์š”ํ•œ ๋น„๊ต ์ง€์ ์ด๋‹ค.

๋™์ž‘ ์›๋ฆฌ

GPU ์ปดํ“จํŒ… ํŒŒ์ดํ”„๋ผ์ธ

AMD GPU๋Š” SIMD ์‹คํ–‰ ์œ ๋‹› ์œ„์— Wavefront(64์Šค๋ ˆ๋“œ ๋ฌถ์Œ) ๊ธฐ๋ฐ˜ ์Šค์ผ€์ค„๋ง์„ ์˜ฌ๋ฆฐ ๊ตฌ์กฐ๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค. NVIDIA๊ฐ€ Warp 32๊ฐœ ๋‹จ์œ„๋ฅผ ์ค‘์‹ฌ์œผ๋กœ ์„ค๋ช…๋˜๋Š” ๊ฒƒ๊ณผ ๋‹ฌ๋ฆฌ, AMD๋Š” 64์Šค๋ ˆ๋“œ Wavefront๋ฅผ ๊ธฐ๋ณธ ์‹คํ–‰ ๋‹จ์œ„๋กœ ์‚ผ์•„ ๊ฐ Compute Unit์—์„œ ์—ฌ๋Ÿฌ Wavefront๋ฅผ ๊ต์ฐจ ์‹คํ–‰ํ•˜๋ฉฐ ๋ฉ”๋ชจ๋ฆฌ ์ง€์—ฐ ์‹œ๊ฐ„์„ ์ˆจ๊ธด๋‹ค.

MI300X Compute Unit ๊ตฌ์„ฑ:
- Stream Processors: 64๊ฐœ ( SIMD32 x 2 )
- Matrix Core: 4๊ฐœ
- ๊ณต์œ  ๋ฉ”๋ชจ๋ฆฌ/LDS: 64KB
- ์Šค์ผ€์ค„๋Ÿฌ: 4๊ฐœ Wavefront ์Šค์ผ€์ค„๋Ÿฌ
- ๋™์‹œ ํ™œ์„ฑ Wavefront: 32๊ฐœ

ํ•˜๋‚˜์˜ Compute Unit์€ ์—ฌ๋Ÿฌ Wavefront๋ฅผ ๋™์‹œ์— ์Šค์ผ€์ค„๋งํ•˜์—ฌ ๋ฉ”๋ชจ๋ฆฌ ์ง€์—ฐ ์‹œ๊ฐ„์„ ์ˆจ๊ธด๋‹ค. Wavefront ์Šค์ผ€์ค„๋Ÿฌ๋Š” ๋‹ค์Œ์— ์‹คํ–‰ํ•  Wavefront๋ฅผ ์„ ํƒํ•˜๊ณ , ํ”ผ์—ฐ์‚ฐ์ž๋ฅผ ์ฝ์–ด ์—ฐ์‚ฐ์„ ์ˆ˜ํ–‰ํ•˜๋ฉฐ, ๊ฒฐ๊ณผ๋ฅผ ๋‹ค์‹œ ๋ ˆ์ง€์Šคํ„ฐ๋‚˜ ๋ฉ”๋ชจ๋ฆฌ์— ๊ธฐ๋กํ•œ๋‹ค.

Infinity Fabric ๋™์ž‘

Infinity Fabric์€ ํ† ํด๋กœ์ง€ ๊ธฐ๋ฐ˜์˜ ํŒจ๋ธŒ๋ฆญ์œผ๋กœ, GPU ๋‹ค์ด ๊ฐ„, GPU-CPU ๊ฐ„, ๊ทธ๋ฆฌ๊ณ  ๋‹ค์ค‘ GPU ๊ฐ„ ํ†ต์‹ ์„ ๋‹ด๋‹นํ•œ๋‹ค. ๊ฐ GPU๋Š” 8๊ฐœ์˜ Infinity Fabric ๋งํฌ๋ฅผ ๊ฐ€์ง€๋ฉฐ, ์ด๋ฅผ ํ†ตํ•ด ๋‹จ์ผ ๋…ธ๋“œ ์•ˆ์—์„œ ์—ฌ๋Ÿฌ GPU๋ฅผ ์ €์ง€์—ฐ์œผ๋กœ ์—ฐ๊ฒฐํ•œ๋‹ค.

๋ฉ”๋ชจ๋ฆฌ ์ ‘๊ทผ ๊ฒฝ๋กœ:
1. GPU ๋ ˆ์ง€์Šคํ„ฐ โ†’ Matrix Core โ†’ ๊ณต์œ  ๋ฉ”๋ชจ๋ฆฌ/LDS
2. ๊ณต์œ  ๋ฉ”๋ชจ๋ฆฌ โ†’ L2 ์บ์‹œ โ†’ HBM ๋ฉ”๋ชจ๋ฆฌ
3. Infinity Fabric์„ ํ†ตํ•œ ์›๊ฒฉ GPU ๋ฉ”๋ชจ๋ฆฌ ์ ‘๊ทผ
4. CPU-GPU ๊ฐ„ ํ†ต์ผ๋œ ๋ฉ”๋ชจ๋ฆฌ ๊ณต๊ฐ„ ์ ‘๊ทผ (MI300A)

MI300A์ฒ˜๋Ÿผ CPU์™€ GPU๋ฅผ ํ•˜๋‚˜์˜ ํŒจํ‚ค์ง€ ์•ˆ์—์„œ ๊ฒฐํ•ฉํ•œ ์ œํ’ˆ์€ ํ†ตํ•ฉ ๋ฉ”๋ชจ๋ฆฌ ๊ณต๊ฐ„๊ณผ ์งง์€ ๋ฐ์ดํ„ฐ ๊ฒฝ๋กœ์˜ ์žฅ์ ์„ ์ œ๊ณตํ•˜์ง€๋งŒ, MI300X๋Š” ๋Œ€์šฉ๋Ÿ‰ HBM๊ณผ Infinity Fabric ํ™•์žฅ์„ฑ์„ ์šฐ์„ ํ•œ ๋ถ„๋ฆฌํ˜• ๊ฐ€์†๊ธฐ๋ผ๋Š” ์ ์ด ๋‹ค๋ฅด๋‹ค.

ROCm ์†Œํ”„ํŠธ์›จ์–ด ์Šคํƒ

ROCm(Radeon Open Compute)์€ AMD์˜ ์˜คํ”ˆ์†Œ์Šค GPU ์ปดํ“จํŒ… ํ”Œ๋žซํผ์œผ๋กœ, CUDA์™€ ๊ฒฝ์Ÿํ•˜๋Š” ์†Œํ”„ํŠธ์›จ์–ด ์ƒํƒœ๊ณ„๋ฅผ ๊ตฌ์ถ•ํ•˜๊ณ  ์žˆ๋‹ค.

์ฃผ์š” ๊ตฌ์„ฑ ์š”์†Œ:
- HIP (Heterogeneous-compute Interface for Portability): CUDA์™€ ์œ ์‚ฌํ•œ ํ”„๋กœ๊ทธ๋ž˜๋ฐ ๋ชจ๋ธ
- ROCm Math Library (rocBLAS, hipBLASLt, rocFFT): ์ˆ˜ํ•™ ์—ฐ์‚ฐ ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ
- MIOpen: ๋”ฅ ๋Ÿฌ๋‹ ํ”„๋ฆฌ๋ฏธํ‹ฐ๋ธŒ ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ
- RCCL: ๋‹ค์ค‘ GPU ํ†ต์‹  ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ
- MIGraphX / Composable Kernel: ์ถ”๋ก  ๊ทธ๋ž˜ํ”„ ์ตœ์ ํ™”์™€ ๊ณ ์„ฑ๋Šฅ ์ปค๋„ ๊ตฌ์„ฑ
- Tensile / ROCProfiler / AMD SMI: ์ปค๋„ ์ƒ์„ฑ, ํ”„๋กœํŒŒ์ผ๋ง, ์‹œ์Šคํ…œ ๊ด€์ธก ๋„๊ตฌ

CUDA ๋Œ€๋น„ ROCm ์žฅ๋‹จ์ :

ํ•ญ๋ชฉ ROCm CUDA
์˜คํ”ˆ์†Œ์Šค O X
๋น„์šฉ ๋ฌด๋ฃŒ ๋ฌด๋ฃŒ (vendor lock-in)
์ƒํƒœ๊ณ„ ์„ฑ์ˆ™๋„ ์ค‘๊ฐ„ ๋†’์Œ
ํ•˜๋“œ์›จ์–ด ์ง€์› AMD GPU NVIDIA GPU
ํ”„๋กœ๊ทธ๋ž˜๋ฐ ๋ชจ๋ธ HIP (CUDA ํ˜ธํ™˜) CUDA
์ฃผ์š” ํ”„๋ ˆ์ž„์›Œํฌ ์ง€์› PyTorch, TensorFlow PyTorch, TensorFlow, JAX

์žฅ๋‹จ์ 

์žฅ์ 

  • ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰ ์šฐ์œ„: MI300X 192GB HBM3๋Š” H100 80GB ๋Œ€๋น„ 2.4๋ฐฐ, H200 141GB ๋Œ€๋น„ 1.36๋ฐฐ์˜ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰ ์ œ๊ณต
  • ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ: 5.3 TB/s๋กœ ์—…๊ณ„ ์ตœ๊ณ  ์ˆ˜์ค€์˜ ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ
  • FP64 ์„ฑ๋Šฅ: HPC ์›Œํฌ๋กœ๋“œ์—์„œ ์šฐ์ˆ˜ํ•œ ์ด์ค‘ ์ •๋ฐ€๋„ ์„ฑ๋Šฅ (81.7 TFLOPS)
  • ์˜คํ”ˆ์†Œ์Šค ์ƒํƒœ๊ณ„: ROCm์„ ํ†ตํ•œ ํˆฌ๋ช…ํ•œ ์†Œํ”„ํŠธ์›จ์–ด ์Šคํƒ
  • APU ์˜ต์…˜: MI300A๋Š” CPU-GPU ํ†ตํ•ฉ ๋ฉ”๋ชจ๋ฆฌ๋กœ ํ”„๋กœ๊ทธ๋ž˜๋ฐ ์šฉ์ด์„ฑ ํ™•๋ณด
  • ๋Œ€์šฉ๋Ÿ‰ ๋‹จ์ผ ๊ฐ€์†๊ธฐ ๊ตฌ์„ฑ: 192GB HBM3๋กœ ๋ชจ๋ธ ์ƒค๋”ฉ ๋ถ€๋‹ด์„ ์ค„์ผ ์ˆ˜ ์žˆ์Œ

๋‹จ์ 

  • ์†Œํ”„ํŠธ์›จ์–ด ์„ฑ์ˆ™๋„: CUDA ๋Œ€๋น„ ROCm์˜ ์ƒํƒœ๊ณ„์™€ ๋„๊ตฌ ์ฒด์ธ์ด ์•„์ง ๋ถ€์กฑ
  • ๋„๊ตฌ ์ง€์›: NVIDIA NSight, cuDNN ๋“ฑ ๊ณ ๊ธ‰ ๋„๊ตฌ ๋Œ€๋น„ ์ œํ•œ์ 
  • ์ปค๋ฎค๋‹ˆํ‹ฐ: NVIDIA ๋Œ€๋น„ ์ƒ๋Œ€์ ์œผ๋กœ ์ž‘์€ ๊ฐœ๋ฐœ์ž ์ปค๋ฎค๋‹ˆํ‹ฐ
  • ํ˜ธํ™˜์„ฑ: CUDA ์ฝ”๋“œ์˜ HIP ํฌํŒ…์— ์‹œ๊ฐ„๊ณผ ๋น„์šฉ ์†Œ์š”
  • ์ „๋ ฅ ์†Œ๋น„: MI300X 750W๋กœ ๋ƒ‰๊ฐ ์ธํ”„๋ผ ๋น„์šฉ ์ฆ๊ฐ€

๊ด€๋ จ ๊ธฐ์ˆ 

์ฐธ๊ณ  ํ‘œ์ค€ ๋ฐ ์‚ฌ์–‘

  • AMD Instinct MI300X Datasheet (2023)
  • AMD Instinct MI250X Datasheet (2021)
  • AMD CDNA Architecture Whitepaper
  • JEDEC HBM3 ํ‘œ์ค€ (JESD235B)
  • AMD ROCm Documentation

๊ด€๋ จ ๋ฌธ์„œ

ํ•ต์‹ฌ ์ •๋ฆฌ

  1. AMD Instinct GPU๋Š” CDNA ์•„ํ‚คํ…์ฒ˜๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ AI/HPC ์›Œํฌ๋กœ๋“œ๋ฅผ ๊ฐ€์†ํ™”ํ•˜๋ฉฐ, MI250X(CDNA2)์™€ MI300X(CDNA3)์€ ๊ฐ๊ฐ 128GB HBM2e์™€ 192GB HBM3๋ฅผ ํƒ‘์žฌํ•˜์—ฌ ๋ฉ”๋ชจ๋ฆฌ ์ค‘์‹ฌ ์›Œํฌ๋กœ๋“œ์— ์ตœ์ ํ™”๋˜์–ด ์žˆ๋‹ค.
  2. MI300X๋Š” 192GB HBM3์™€ 5.3 TB/s ๋Œ€์—ญํญ์œผ๋กœ NVIDIA H100/H200 ๋Œ€๋น„ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰๊ณผ ๋Œ€์—ญํญ์—์„œ ์šฐ์œ„๋ฅผ ๊ฐ€์ง€๋ฉฐ, 256MB LLC/Infinity Cache๋ฅผ ํ†ตํ•ด ์œ ํšจ ๋Œ€์—ญํญ์„ ๋†’์ธ๋‹ค.
  3. Matrix Core๋Š” NVIDIA Tensor Core์™€ ์œ ์‚ฌํ•œ ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•˜๋ฉฐ, MI300X๋Š” FP8์—์„œ 2.61 PFLOPS, FP16/BF16์—์„œ 1.3 PFLOPS์˜ ์„ฑ๋Šฅ์„ ์ œ๊ณตํ•œ๋‹ค.
  4. Infinity Fabric์€ GPU ๊ฐ„, CPU-GPU ๊ฐ„ ๊ณ ์† ํ†ต์‹ ์„ ๋‹ด๋‹นํ•˜๋ฉฐ, MI300A APU๋Š” CPU์™€ GPU๊ฐ€ ๋™์ผํ•œ ๋ฉ”๋ชจ๋ฆฌ ๊ณต๊ฐ„์„ ๊ณต์œ ํ•˜์—ฌ ํ”„๋กœ๊ทธ๋ž˜๋ฐ ํšจ์œจ์„ฑ์„ ๋†’์ธ๋‹ค.
  5. ROCm ์˜คํ”ˆ์†Œ์Šค ์†Œํ”„ํŠธ์›จ์–ด ์ƒํƒœ๊ณ„๋Š” CUDA ๋Œ€๋น„ ํˆฌ๋ช…์„ฑ์„ ์ œ๊ณตํ•˜์ง€๋งŒ, ์ƒํƒœ๊ณ„ ์„ฑ์ˆ™๋„์™€ ๋„๊ตฌ ์ง€์›์—์„œ ์•„์ง ๊ณผ์ œ๊ฐ€ ๋‚จ์•„์žˆ๋‹ค.