๐Ÿง  Accelerator

NVIDIA GPU ์ƒ์„ธ

๊ฐœ์š”

NVIDIA ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU๋Š” AI ํ›ˆ๋ จ๊ณผ ์ถ”๋ก  ์›Œํฌ๋กœ๋“œ๋ฅผ ๊ฐ€์†ํ™”ํ•˜๋Š” ๋ฒ”์šฉ ๋ณ‘๋ ฌ ํ”„๋กœ์„ธ์„œ๋กœ, Volta ์•„ํ‚คํ…์ฒ˜๋ถ€ํ„ฐ ์ง€์†์ ์œผ๋กœ ์„ธ๋Œ€๋ฅผ ๊ฑฐ๋“ญํ•˜๋ฉฐ ๋”ฅ ๋Ÿฌ๋‹ ๊ฐ€์†๊ธฐ ์‹œ์žฅ์—์„œ ์ฃผ๋„์ ์ธ ์œ„์น˜๋ฅผ ์ฐจ์ง€ํ•˜๊ณ  ์žˆ๋‹ค. A100(Ampere, 2020), H100(Hopper, 2022), H200(Hopper+HBM3e, 2024)์€ ๊ฐ๊ฐ ํ…Œ์ดํ”„์•„์›ƒ ์‹œ์ ์˜ ์ตœ์ฒจ๋‹จ ๊ณต์ •๊ณผ ๋ฉ”๋ชจ๋ฆฌ ๊ธฐ์ˆ ์„ ์ ์šฉํ•˜์—ฌ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ ํ•™์Šต๊ณผ ์ถ”๋ก ์—์„œ ์—…๊ณ„ ์ตœ๊ณ  ์ˆ˜์ค€์˜ ์„ฑ๋Šฅ์„ ์ œ๊ณตํ•œ๋‹ค.

ํ˜„๋Œ€ ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(LLM)์€ ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜๊ฐ€ ์ˆ˜์ฒœ์–ต์—์„œ ์ˆ˜์กฐ ๊ฐœ๋กœ ์ฆ๊ฐ€ํ•˜๋ฉด์„œ, ๋‹จ์ผ GPU์˜ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰๊ณผ ๋Œ€์—ญํญ, ๊ทธ๋ฆฌ๊ณ  ํ…์„œ ์—ฐ์‚ฐ ์ฒ˜๋ฆฌ๋Ÿ‰์ด ๋™์‹œ์— ์ค‘์š”ํ•œ ๋ณ‘๋ชฉ์ด ๋˜์—ˆ๋‹ค. NVIDIA๋Š” Tensor Core๋ฅผ ํ†ตํ•œ ํ–‰๋ ฌ ์—ฐ์‚ฐ ๊ฐ€์†, HBM ๋ฉ”๋ชจ๋ฆฌ ์„œ๋ธŒ์‹œ์Šคํ…œ ๊ณ ๋„ํ™”, NVLink ๊ณ ์† ์ธํ„ฐ์ปค๋„ฅํŠธ, ๊ทธ๋ฆฌ๊ณ  MIG(Multi-Instance GPU)๋ฅผ ํ†ตํ•œ ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€ ๊ฐ€์ƒํ™” ๋“ฑ ์—ฌ๋Ÿฌ ์ถ•์—์„œ ์•„ํ‚คํ…์ฒ˜๋ฅผ ๋ฐœ์ „์‹œ์ผœ์™”๋‹ค.

ํ•ต์‹ฌ ๊ฐœ๋…

Tensor Core ์•„ํ‚คํ…์ฒ˜ ๋ฐœ์ „

NVIDIA GPU Tensor Core Comparison

Tensor Core๋Š” NVIDIA GPU ๋‚ด๋ถ€์—์„œ ํ–‰๋ ฌ ๊ณฑ์…ˆ-๋ˆ„์ (Multiply-Accumulate, MMA) ์—ฐ์‚ฐ์„ ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€์—์„œ ๊ฐ€์†ํ™”ํ•˜๋Š” ํŠนํ™” ์œ ๋‹›์ด๋‹ค. ์ผ๋ฐ˜ CUDA ์ฝ”์–ด๊ฐ€ ํ•œ ํด๋Ÿญ๋‹น ํ•˜๋‚˜์˜ FP32 ์—ฐ์‚ฐ์„ ์ฒ˜๋ฆฌํ•˜๋Š” ๊ฒƒ๊ณผ ๋‹ฌ๋ฆฌ, Tensor Core๋Š” ํ•œ ํด๋Ÿญ๋‹น ์ˆ˜๋ฐฑ~์ˆ˜์ฒœ ๊ฐœ์˜ ๊ณฑ์…ˆ-๋ˆ„์‚ฐ ์—ฐ์‚ฐ์„ ๋ณ‘๋ ฌ๋กœ ์ˆ˜ํ–‰ํ•œ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ ์ง€์› ์ •๋ฐ€๋„ ํŠน์ง•
1์„ธ๋Œ€ Volta FP16, INT8 ์ตœ์ดˆ Tensor Core ๋„์ž…, MFMA ์—ฐ์‚ฐ
2์„ธ๋Œ€ Turing FP16, INT8, INT4 RT Core์™€ ๊ณต์กด, ๋ ˆ์ด ํŠธ๋ ˆ์ด์‹ฑ ๊ฐ€์†
3์„ธ๋Œ€ Ampere FP16, BF16, TF32, FP64, INT8 TF32 ๋„์ž…, FP64 Tensor Core ์ตœ์ดˆ, ํฌ์†Œ์„ฑ ๊ฐ€์†
4์„ธ๋Œ€ Hopper FP16, BF16, FP8, TF32, FP64, INT8 Transformer Engine, FP8 ๋™์  ์ •๋ฐ€๋„ ์ „ํ™˜
5์„ธ๋Œ€ Blackwell FP4, FP6, FP8, FP16, BF16, TF32, FP64 FP4/FP6 ์‹ ๊ทœ ์ง€์›, 2๋ฐฐ MMA ์ฒ˜๋ฆฌ๋Ÿ‰

3์„ธ๋Œ€ Tensor Core (A100):
- TF32(TensorFloat-32): FP32์˜ ๋™์  ๋ฒ”์œ„์™€ FP16์˜ ์ •๋ฐ€๋„๋ฅผ ๊ฒฐํ•ฉํ•œ 19๋น„ํŠธ ํฌ๋งท
- FP64 Tensor Core ์ตœ์ดˆ ๋„์ž…: HPC ์›Œํฌ๋กœ๋“œ์—์„œ ์ด์ค‘ ์ •๋ฐ€๋„ ์—ฐ์‚ฐ ๊ฐ€์†
- ๊ตฌ์กฐ์  ํฌ์†Œ์„ฑ(Structured Sparsity) ์ง€์›: 2:4 ํฌ์†Œ ํŒจํ„ด์œผ๋กœ ์—ฐ์‚ฐ 2๋ฐฐ ๊ฐ€์†

4์„ธ๋Œ€ Tensor Core (H100):
- FP8 ์ง€์›: FP16 ๋Œ€๋น„ 2๋ฐฐ ์ฒ˜๋ฆฌ๋Ÿ‰, ์ ˆ๋ฐ˜์˜ ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰
- Transformer Engine: FP16โ†”FP8 ๋™์  ์ •๋ฐ€๋„ ์ „ํ™˜์œผ๋กœ ์ •๋ฐ€๋„ ์†์‹ค ์ตœ์†Œํ™”
- DPX ๋ช…๋ น์–ด: Smith-Waterman/Needleman-Wunsch ๋“ฑ ๋™์  ํ”„๋กœ๊ทธ๋ž˜๋ฐ ์•Œ๊ณ ๋ฆฌ์ฆ˜ ๊ฐ€์†

HBM ๋ฉ”๋ชจ๋ฆฌ ์„œ๋ธŒ์‹œ์Šคํ…œ

NVIDIA ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU๋Š” HBM(High Bandwidth Memory)์„ ์‚ฌ์šฉํ•˜์—ฌ ์—ฐ์‚ฐ ์œ ๋‹›์— ๋Œ€๋Ÿ‰์˜ ๋ฐ์ดํ„ฐ๋ฅผ ๋น ๋ฅด๊ฒŒ ๊ณต๊ธ‰ํ•œ๋‹ค. HBM์€ 3D ์Šคํƒ ๊ตฌ์กฐ๋กœ DRAM ๋‹ค์ด๋ฅผ ์ˆ˜์ง์œผ๋กœ ์ ์ธตํ•˜์—ฌ ํญ๋„“์€ ๋ฉ”๋ชจ๋ฆฌ ๋ฒ„์Šค ํญ์„ ๋‹ฌ์„ฑํ•œ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ HBM ์ข…๋ฅ˜ ์šฉ๋Ÿ‰ ๋Œ€์—ญํญ ๋ฒ„์Šค ํญ L2 ์บ์‹œ
A100 40GB Ampere HBM2 40GB 1.52 TB/s 5120-bit 40MB
A100 80GB Ampere HBM2e 80GB 2.0 TB/s 5120-bit 40MB
H100 SXM5 Hopper HBM3 80GB 3.35 TB/s 5120-bit 50MB
H200 Hopper HBM3e 141GB 4.8 TB/s 6144-bit 50MB

H200์€ H100๊ณผ ๋™์ผํ•œ Hopper ์ปดํ“จํŠธ ๋‹ค์ด๋ฅผ ์‚ฌ์šฉํ•˜๋ฉด์„œ HBM3e ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ํƒ‘์žฌํ•˜์—ฌ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰์„ 141GB๋กœ, ๋Œ€์—ญํญ์„ 4.8 TB/s๋กœ ํ™•๋Œ€ํ–ˆ๋‹ค. LLM ์ถ”๋ก  ์›Œํฌ๋กœ๋“œ์—์„œ ๋ชจ๋ธ ์ „์ฒด๋ฅผ GPU ๋ฉ”๋ชจ๋ฆฌ์— ์˜ฌ๋ฆด ์ˆ˜ ์žˆ๋Š” ์šฉ๋Ÿ‰์ด ์ค‘์š”ํ•˜๋ฏ€๋กœ, H200์€ ๋™์ผํ•œ ์•„ํ‚คํ…์ฒ˜์—์„œ๋„ ์ƒ๋‹นํ•œ ์ถ”๋ก  ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ์ œ๊ณตํ•œ๋‹ค.

MIG(Multi-Instance GPU)

MIG๋Š” ๋‹จ์ผ GPU๋ฅผ ์ตœ๋Œ€ 7๊ฐœ์˜ ๋…๋ฆฝ๋œ ์ธ์Šคํ„ด์Šค๋กœ ๋ถ„ํ• ํ•˜์—ฌ ๊ฐ๊ฐ์ด ๋ณ„๋„์˜ ๋ฉ”๋ชจ๋ฆฌ, ์บ์‹œ, ์—ฐ์‚ฐ ์œ ๋‹›์„ ๊ฐ€์ง€๊ฒŒ ํ•˜๋Š” ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€ ๊ฐ€์ƒํ™” ๊ธฐ์ˆ ์ด๋‹ค.

A100 MIG ๊ตฌ์„ฑ:

์ธ์Šคํ„ด์Šค ์ˆ˜ GPU ๋ฉ”๋ชจ๋ฆฌ ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ FP32 ์ฝ”์–ด Tensor Core
1 80GB 2.0 TB/s 6,912 432
2 ๊ฐ 40GB ๊ฐ 1.0 TB/s ๊ฐ 3,456 ๊ฐ 216
3 ๊ฐ 20GB ๊ฐ 670 GB/s ๊ฐ 2,304 ๊ฐ 144
4 ๊ฐ 20GB ๊ฐ 500 GB/s ๊ฐ 1,728 ๊ฐ 108
7 ๊ฐ 10GB ๊ฐ 250 GB/s ๊ฐ 988 ๊ฐ 52

MIG๋ฅผ ํ†ตํ•ด ํด๋ผ์šฐ๋“œ ์„œ๋น„์Šค ์ œ๊ณต์ž๋Š” ๋‹จ์ผ GPU์—์„œ ์—ฌ๋Ÿฌ ํ…Œ๋„ŒํŠธ์˜ ์›Œํฌ๋กœ๋“œ๋ฅผ ๊ฒฉ๋ฆฌ๋œ ํ™˜๊ฒฝ์—์„œ ๋™์‹œ์— ์‹คํ–‰ํ•  ์ˆ˜ ์žˆ๋‹ค. ๊ฐ ์ธ์Šคํ„ด์Šค๋Š” ์™„์ „ํ•œ ํ•˜๋“œ์›จ์–ด ๊ฒฉ๋ฆฌ๋ฅผ ๋ณด์žฅํ•˜๋ฉฐ, ๋‹ค๋ฅธ ์ธ์Šคํ„ด์Šค์˜ ์„ฑ๋Šฅ ๋ณ€๋™์— ์˜ํ–ฅ์„ ๋ฐ›์ง€ ์•Š๋Š”๋‹ค.

NVLink ์ธํ„ฐ์ปค๋„ฅํŠธ

NVLink๋Š” GPU ๊ฐ„ ๊ณ ์† ์ง์ ‘ ์—ฐ๊ฒฐ ์ธํ„ฐํŽ˜์ด์Šค๋กœ, ๋‹จ์ผ PCIe ๋ฒ„์Šค์˜ ๋Œ€์—ญํญ์„ ๋„˜์–ด ๋‹ค์ค‘ GPU ๊ฐ„ ๋ฐ์ดํ„ฐ ๊ตํ™˜์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•œ๋‹ค.

์„ธ๋Œ€ ์•„ํ‚คํ…์ฒ˜ ๋งํฌ ์ˆ˜ (GPU๋‹น) ์ด ๋Œ€์—ญํญ (GPU๋‹น, ์–‘๋ฐฉํ–ฅ) ๋Œ€ํ‘œ GPU ๋„๋ฉ”์ธ
NVLink 3.0 Ampere 12 600 GB/s 8 GPU
NVLink 4.0 Hopper 18 900 GB/s 8 GPU
NVLink 5.0 Blackwell 18 1800 GB/s 8/72 GPU

NVLink๋Š” ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ์˜ ๋ชจ๋ธ ๋ณ‘๋ ฌ ์ฒ˜๋ฆฌ(Model Parallelism)์—์„œ ํ•„์ˆ˜์ ์ธ ์—ญํ• ์„ ํ•œ๋‹ค. GPT-4, Llama 70B ๋“ฑ์˜ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ์€ ๋‹จ์ผ GPU ๋ฉ”๋ชจ๋ฆฌ์— ์™„์ „ํžˆ ๋กœ๋“œํ•  ์ˆ˜ ์—†์œผ๋ฏ€๋กœ, ๋ชจ๋ธ ๊ณ„์ธต์„ ์—ฌ๋Ÿฌ GPU์— ๋ถ„์‚ฐํ•˜๊ณ  NVLink๋ฅผ ํ†ตํ•ด ํ™œ์„ฑ๊ฐ’๊ณผ ๊ทธ๋ž˜๋””์–ธํŠธ๋ฅผ ๊ตํ™˜ํ•œ๋‹ค. H100๊ณผ H200์—์„œ ์ž์ฃผ ์ธ์šฉ๋˜๋Š” 900 GB/s ์ˆ˜์น˜๋Š” ๋งํฌ๋‹น ์ˆ˜์น˜๊ฐ€ ์•„๋‹ˆ๋ผ GPU๋‹น ์ด ์–‘๋ฐฉํ–ฅ ๋Œ€์—ญํญ์ด๋‹ค.

๋น„๊ต/๋ถ„์„

NVIDIA ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU ์„ธ๋Œ€ ๋น„๊ต

ํ•ญ๋ชฉ A100 80GB H100 SXM5 H200 SXM5
์•„ํ‚คํ…์ฒ˜ Ampere Hopper Hopper
์ œ์กฐ ๊ณต์ • TSMC N7 TSMC 4N TSMC 4N
ํŠธ๋žœ์ง€์Šคํ„ฐ ์ˆ˜ 542์–ต 800์–ต 800์–ต
๋‹ค์ด ํฌ๊ธฐ 826 mmยฒ 814 mmยฒ 814 mmยฒ
SM ์ˆ˜ 108 132 132
FP32 CUDA ์ฝ”์–ด 6,912 16,896 16,896
๋ถ€์ŠคํŠธ ํด๋Ÿญ 1,410 MHz 1,980 MHz 1,980 MHz
๋ฉ”๋ชจ๋ฆฌ 80GB HBM2e 80GB HBM3 141GB HBM3e
๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ 2.0 TB/s 3.35 TB/s 4.8 TB/s
L2 ์บ์‹œ 40MB 50MB 50MB
FP32 ์„ฑ๋Šฅ 19.5 TFLOPS 67 TFLOPS 67 TFLOPS
FP64 ์„ฑ๋Šฅ 9.7 TFLOPS 34 TFLOPS 34 TFLOPS
TF32 Tensor 156 TFLOPS 495 TFLOPS 495 TFLOPS
FP16 Tensor 312 TFLOPS 990 TFLOPS 990 TFLOPS
FP8 Tensor - 1,980 TFLOPS 1,980 TFLOPS
INT8 Tensor 624 TOPS 1,980 TOPS 1,980 TOPS
NVLink ๋Œ€์—ญํญ 600 GB/s 900 GB/s 900 GB/s
TDP 400W 700W 700W
MIG ์ง€์› ์ตœ๋Œ€ 7๊ฐœ ์ตœ๋Œ€ 7๊ฐœ ์ตœ๋Œ€ 7๊ฐœ
Transformer Engine X O O
FP8 ์ง€์› X O O

์„ธ๋Œ€๋ณ„ ์ฃผ์š” ๋ฐœ์ „ ํฌ์ธํŠธ

A100 โ†’ H100 (Ampere โ†’ Hopper):
1. FP32 ์ฝ”์–ด 2.4๋ฐฐ ์ฆ๊ฐ€ (6,912 โ†’ 16,896)
2. ๋ถ€์ŠคํŠธ ํด๋Ÿญ 40% ํ–ฅ์ƒ (1,410 โ†’ 1,980 MHz)
3. FP32 ์„ฑ๋Šฅ 3.4๋ฐฐ ํ–ฅ์ƒ (19.5 โ†’ 67 TFLOPS)
4. HBM3 ์ ์šฉ์œผ๋กœ ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ 67% ํ–ฅ์ƒ (2.0 โ†’ 3.35 TB/s)
5. Transformer Engine์œผ๋กœ FP8 ์—ฐ์‚ฐ ์ง€์›, ์ถ”๋ก  ์ฒ˜๋ฆฌ๋Ÿ‰ 2๋ฐฐ ํ–ฅ์ƒ
6. TMA(Tensor Memory Accelerator)๋กœ ๋น„๋™๊ธฐ ๋ฉ”๋ชจ๋ฆฌ ์ „์†ก ์ตœ์ ํ™”
7. Distributed Shared Memory๋กœ SM ๊ฐ„ ์ง์ ‘ ๋ฐ์ดํ„ฐ ๊ตํ™˜

H100 โ†’ H200 (HBM3 โ†’ HBM3e):
1. ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰ 76% ํ™•๋Œ€ (80GB โ†’ 141GB)
2. ๋ฉ”๋ชจ๋ฆฌ ๋Œ€์—ญํญ 43% ํ–ฅ์ƒ (3.35 โ†’ 4.8 TB/s)
3. ์ปดํ“จํŠธ ๋™์ผ: ๋™์ผํ•œ H100 ๋‹ค์ด ์‚ฌ์šฉ
4. LLM ์ถ”๋ก ์—์„œ ๋ชจ๋ธ ์ ์žฌ ์šฉ๋Ÿ‰ ์ฆ๊ฐ€๋กœ ์‹œ๊ฐ„๋‹น ํ† ํฐ ์ฒ˜๋ฆฌ๋Ÿ‰ ํ–ฅ์ƒ

๋™์ž‘ ์›๋ฆฌ

GPU ์ปดํ“จํŒ… ํŒŒ์ดํ”„๋ผ์ธ

NVIDIA GPU๋Š” SIMT(Single Instruction, Multiple Threads) ๋ชจ๋ธ์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๋™์ž‘ํ•œ๋‹ค. ์ˆ˜์ฒœ ๊ฐœ์˜ ์Šค๋ ˆ๋“œ๊ฐ€ ๋™์ผํ•œ ๋ช…๋ น์–ด๋ฅผ ๋ณ‘๋ ฌ๋กœ ์‹คํ–‰ํ•˜๋ฉฐ, ๊ฐ ์Šค๋ ˆ๋“œ๋Š” ๋…๋ฆฝ์ ์ธ ๋ ˆ์ง€์Šคํ„ฐ์™€ ํ”„๋กœ๊ทธ๋žจ ์นด์šดํ„ฐ๋ฅผ ๊ฐ€์ง„๋‹ค.

H100 SM(Streaming Multiprocessor) ๊ตฌ์„ฑ:
- FP32 CUDA ์ฝ”์–ด: 128๊ฐœ
- FP64 ์ฝ”์–ด: 64๊ฐœ
- Tensor Core: 4๊ฐœ (4์„ธ๋Œ€)
- ๊ณต์œ  ๋ฉ”๋ชจ๋ฆฌ/L1 ์บ์‹œ: 256KB (ํ†ตํ•ฉ)
- ์›Œํ”„ ์Šค์ผ€์ค„๋Ÿฌ: 4๊ฐœ
- ๋™์‹œ ํ™œ์„ฑ ์›Œํ”„: 64๊ฐœ

ํ•˜๋‚˜์˜ SM์€ ์—ฌ๋Ÿฌ Warp(32์Šค๋ ˆ๋“œ ๋ฌถ์Œ)๋ฅผ ๋™์‹œ์— ์Šค์ผ€์ค„๋งํ•˜์—ฌ ๋ฉ”๋ชจ๋ฆฌ ์ง€์—ฐ ์‹œ๊ฐ„์„ ์ˆจ๊ธด๋‹ค. Warp Scheduler๋Š” ๋‹ค์Œ์— ์‹คํ–‰ํ•  Warp๋ฅผ ์„ ํƒํ•˜๊ณ , Operand๋ฅผ ์ฝ์–ด ์—ฐ์‚ฐ์„ ์ˆ˜ํ–‰ํ•˜๋ฉฐ, ๊ฒฐ๊ณผ๋ฅผ ๋‹ค์‹œ ๋ฉ”๋ชจ๋ฆฌ์— ๊ธฐ๋กํ•œ๋‹ค.

Transformer Engine ๋™์ž‘:
Transformer Engine์€ Transformer ๋ชจ๋ธ์˜ ์–ดํ…์…˜ ๋ ˆ์ด์–ด์—์„œ FP16๊ณผ FP8 ์‚ฌ์ด๋ฅผ ๋™์ ์œผ๋กœ ์ „ํ™˜ํ•œ๋‹ค. ๋ ˆ์ด์–ด๋ณ„๋กœ ํ™œ์„ฑ๊ฐ’์˜ ๋ถ„ํฌ๋ฅผ ๋ถ„์„ํ•˜์—ฌ, ์ •๋ฐ€๋„ ์†์‹ค์ด ํ—ˆ์šฉ๋˜๋Š” ๋ฒ”์œ„ ๋‚ด์—์„œ FP8๋กœ ์—ฐ์‚ฐํ•˜์—ฌ ์ฒ˜๋ฆฌ๋Ÿ‰์„ 2๋ฐฐ๋กœ ๋†’์ธ๋‹ค. per-tensor ์Šค์ผ€์ผ๋ง๊ณผ per-channel ์Šค์ผ€์ผ๋ง์„ ๋ชจ๋‘ ์ง€์›ํ•˜์—ฌ FP8์˜ ์ข์€ ๋™์  ๋ฒ”์œ„๋ฅผ ๋ณด์™„ํ•œ๋‹ค.

MIG ํ•˜๋“œ์›จ์–ด ๊ฒฉ๋ฆฌ

MIG๋Š” GPU ๋‹ค์ด๋ฅผ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ๊ฒฉ๋ฆฌ๋œ ํŒŒํ‹ฐ์…˜์œผ๋กœ ๋ถ„ํ• ํ•œ๋‹ค. ๊ฐ ํŒŒํ‹ฐ์…˜์€ ๋…๋ฆฝ๋œ SM ๊ทธ๋ฃน, ๋ฉ”๋ชจ๋ฆฌ ์ปจํŠธ๋กค๋Ÿฌ, L2 ์บ์‹œ ํŒŒํ‹ฐ์…˜์„ ๊ฐ€์ง€๋ฉฐ, ๋‹ค๋ฅธ ํŒŒํ‹ฐ์…˜๊ณผ ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€์—์„œ ์™„์ „ํžˆ ๊ฒฉ๋ฆฌ๋œ๋‹ค.

๋ฉ”๋ชจ๋ฆฌ ์ปจํŠธ๋กค๋Ÿฌ๋Š” ํŒŒํ‹ฐ์…˜๋ณ„๋กœ ๋…๋ฆฝ๋œ ๋Œ€์—ญํญ ํ• ๋‹น์„ ๊ฐ€์ง€๋ฉฐ, NVLink ๋งํฌ๋„ ํŒŒํ‹ฐ์…˜์— ๋”ฐ๋ผ ๋ถ„๋ฐฐ๋œ๋‹ค. ์ด ๊ฒฉ๋ฆฌ๋Š” ๋ณด์•ˆ๊ณผ ์„ฑ๋Šฅ ๊ฒฉ๋ฆฌ๋ฅผ ๋™์‹œ์— ๋ณด์žฅํ•˜์—ฌ, ํ•œ ํ…Œ๋„ŒํŠธ์˜ ์›Œํฌ๋กœ๋“œ๊ฐ€ ๋‹ค๋ฅธ ํ…Œ๋„ŒํŠธ์˜ ์„ฑ๋Šฅ์— ์˜ํ–ฅ์„ ๋ฏธ์น˜์ง€ ์•Š๋Š”๋‹ค.

์žฅ๋‹จ์ 

์žฅ์ 

  • ํ’๋ถ€ํ•œ ์ƒํƒœ๊ณ„: CUDA, cuDNN, cuBLAS, TensorRT, NCCL ๋“ฑ ๊ฐ€์žฅ ์„ฑ์ˆ™ํ•œ GPU ์†Œํ”„ํŠธ์›จ์–ด ์Šคํƒ
  • ๋ฒ”์šฉ์„ฑ: AI ํ›ˆ๋ จ/์ถ”๋ก , HPC, ๊ทธ๋ž˜ํ”ฝ์Šค, ๋ฐ์ดํ„ฐ ๋ถ„์„ ๋“ฑ ๋‹ค์–‘ํ•œ ์›Œํฌ๋กœ๋“œ ์ง€์›
  • MIG ๊ฒฉ๋ฆฌ: ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€ ์›Œํฌ๋กœ๋“œ ๊ฒฉ๋ฆฌ๋กœ ํด๋ผ์šฐ๋“œ ๋ฉ€ํ‹ฐํ…Œ๋„Œ์‹œ ์ง€์›
  • NVLink ํ™•์žฅ์„ฑ: ๋‹ค์ค‘ GPU ๊ฐ„ ๊ณ ์† ํ†ต์‹ ์œผ๋กœ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ ๋ถ„์‚ฐ ์ฒ˜๋ฆฌ ๊ฐ€๋Šฅ
  • Tensor Core ๊ฐ€์†: ํ–‰๋ ฌ ์—ฐ์‚ฐ ํ•˜๋“œ์›จ์–ด ๊ฐ€์†์œผ๋กœ ๋†’์€ ์—ฐ์‚ฐ ํšจ์œจ
  • Transformer Engine: FP8 ๋™์  ์ •๋ฐ€๋„๋กœ Transformer ๋ชจ๋ธ ์ถ”๋ก  ์„ฑ๋Šฅ ๊ทน๋Œ€ํ™”

๋‹จ์ 

  • ์ „๋ ฅ ์†Œ๋น„: H100 SXM5 ๊ธฐ์ค€ 700W๋กœ ๋ƒ‰๊ฐ ์ธํ”„๋ผ ๋น„์šฉ ์ฆ๊ฐ€
  • ๊ฐ€๊ฒฉ: A100 ์•ฝ $10,000~$15,000, H100 ์•ฝ $25,000~$30,000 (์ถœ์‹œ ๊ธฐ์ค€)
  • ๊ณต๊ธ‰ ์ œ์•ฝ: AI ์ˆ˜์š” ํญ์ฆ์œผ๋กœ ์ธํ•œ ๊ณต๊ธ‰ ๋ถ€์กฑ, ๋ฆฌ๋“œ ํƒ€์ž„ ์žฅ๊ธฐํ™”
  • ์˜์กด์„ฑ: CUDA ์ข…์†์œผ๋กœ AMD ๋“ฑ ๋Œ€์ฒด ํ”Œ๋žซํผ ์ „ํ™˜ ๋น„์šฉ ๋ฐœ์ƒ
  • ์ˆ˜์ถœ ํ†ต์ œ: ๋ฏธ๊ตญ ์ˆ˜์ถœ ๊ทœ์ œ๋กœ ์ธํ•œ ํŠน์ • ์ง€์—ญ ํŒ๋งค ์ œํ•œ

๊ด€๋ จ ๊ธฐ์ˆ 

์ฐธ๊ณ  ํ‘œ์ค€ ๋ฐ ์‚ฌ์–‘

  • NVIDIA H100 Tensor Core GPU Architecture Whitepaper (2022)
  • NVIDIA A100 Tensor Core GPU Architecture Whitepaper (2020)
  • NVIDIA H200 GPU Architecture Overview (2024)
  • NVIDIA NVLink and NVLink Switch ๊ณต์‹ ์‚ฌ์–‘
  • JEDEC HBM3/HBM3e ํ‘œ์ค€ (JESD235B)

๊ด€๋ จ ๋ฌธ์„œ

ํ•ต์‹ฌ ์ •๋ฆฌ

  1. NVIDIA ๋ฐ์ดํ„ฐ์„ผํ„ฐ GPU๋Š” Tensor Core๋ฅผ ํ†ตํ•œ ํ–‰๋ ฌ ์—ฐ์‚ฐ ๊ฐ€์†, HBM ๊ณ ๋Œ€์—ญํญ ๋ฉ”๋ชจ๋ฆฌ, NVLink ๊ณ ์† ์ธํ„ฐ์ปค๋„ฅํŠธ์˜ ์„ธ ๊ฐ€์ง€ ์ถ•์„ ํ†ตํ•ด AI ์›Œํฌ๋กœ๋“œ๋ฅผ ๊ฐ€์†ํ™”ํ•œ๋‹ค.
  2. A100(Hopper ์ด์ „ ์„ธ๋Œ€)์€ 3์„ธ๋Œ€ Tensor Core, TF32, FP64 Tensor Core, MIG๋ฅผ ๋„์ž…ํ•˜์—ฌ AI ํ›ˆ๋ จ๊ณผ HPC๋ฅผ ํ†ตํ•ฉํ–ˆ๋‹ค.
  3. H100(Hopper)์€ 4์„ธ๋Œ€ Tensor Core์™€ Transformer Engine์„ ํ†ตํ•ด FP8 ์—ฐ์‚ฐ์„ ์ง€์›ํ•˜๊ณ , FP16 ๋Œ€๋น„ 2๋ฐฐ์˜ ์ถ”๋ก  ์ฒ˜๋ฆฌ๋Ÿ‰์„ ๋‹ฌ์„ฑํ–ˆ๋‹ค.
  4. H200์€ H100๊ณผ ๋™์ผํ•œ ์ปดํ“จํŠธ ๋‹ค์ด์— HBM3e๋ฅผ ์ ์šฉํ•˜์—ฌ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰์„ 141GB๋กœ, ๋Œ€์—ญํญ์„ 4.8 TB/s๋กœ ํ™•๋Œ€ํ–ˆ์œผ๋ฉฐ, LLM ์ถ”๋ก ์—์„œ ๋ชจ๋ธ ์ ์žฌ ์šฉ๋Ÿ‰ ์ฆ๊ฐ€๋กœ ์‹ค์งˆ์ ์ธ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ์ œ๊ณตํ•œ๋‹ค.
  5. MIG๋Š” ๋‹จ์ผ GPU๋ฅผ ์ตœ๋Œ€ 7๊ฐœ๋กœ ๋ถ„ํ• ํ•˜์—ฌ ํ•˜๋“œ์›จ์–ด ์ˆ˜์ค€ ๊ฒฉ๋ฆฌ์™€ ๋ฉ€ํ‹ฐํ…Œ๋„Œ์‹œ๋ฅผ ๋ณด์žฅํ•˜๋ฉฐ, NVLink๋Š” ๋‹ค์ค‘ GPU ๊ฐ„ ๊ณ ์† ํ†ต์‹ ์œผ๋กœ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ์˜ ๋ถ„์‚ฐ ์ฒ˜๋ฆฌ๋ฅผ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•œ๋‹ค.