NVIDIA GPU ์์ธ
๊ฐ์
NVIDIA ๋ฐ์ดํฐ์ผํฐ GPU๋ AI ํ๋ จ๊ณผ ์ถ๋ก ์ํฌ๋ก๋๋ฅผ ๊ฐ์ํํ๋ ๋ฒ์ฉ ๋ณ๋ ฌ ํ๋ก์ธ์๋ก, Volta ์ํคํ ์ฒ๋ถํฐ ์ง์์ ์ผ๋ก ์ธ๋๋ฅผ ๊ฑฐ๋ญํ๋ฉฐ ๋ฅ ๋ฌ๋ ๊ฐ์๊ธฐ ์์ฅ์์ ์ฃผ๋์ ์ธ ์์น๋ฅผ ์ฐจ์งํ๊ณ ์๋ค. A100(Ampere, 2020), H100(Hopper, 2022), H200(Hopper+HBM3e, 2024)์ ๊ฐ๊ฐ ํ ์ดํ์์ ์์ ์ ์ต์ฒจ๋จ ๊ณต์ ๊ณผ ๋ฉ๋ชจ๋ฆฌ ๊ธฐ์ ์ ์ ์ฉํ์ฌ ๋๊ท๋ชจ ๋ชจ๋ธ ํ์ต๊ณผ ์ถ๋ก ์์ ์ ๊ณ ์ต๊ณ ์์ค์ ์ฑ๋ฅ์ ์ ๊ณตํ๋ค.
ํ๋ ๋๊ท๋ชจ ์ธ์ด ๋ชจ๋ธ(LLM)์ ํ๋ผ๋ฏธํฐ ์๊ฐ ์์ฒ์ต์์ ์์กฐ ๊ฐ๋ก ์ฆ๊ฐํ๋ฉด์, ๋จ์ผ GPU์ ๋ฉ๋ชจ๋ฆฌ ์ฉ๋๊ณผ ๋์ญํญ, ๊ทธ๋ฆฌ๊ณ ํ ์ ์ฐ์ฐ ์ฒ๋ฆฌ๋์ด ๋์์ ์ค์ํ ๋ณ๋ชฉ์ด ๋์๋ค. NVIDIA๋ Tensor Core๋ฅผ ํตํ ํ๋ ฌ ์ฐ์ฐ ๊ฐ์, HBM ๋ฉ๋ชจ๋ฆฌ ์๋ธ์์คํ ๊ณ ๋ํ, NVLink ๊ณ ์ ์ธํฐ์ปค๋ฅํธ, ๊ทธ๋ฆฌ๊ณ MIG(Multi-Instance GPU)๋ฅผ ํตํ ํ๋์จ์ด ์์ค ๊ฐ์ํ ๋ฑ ์ฌ๋ฌ ์ถ์์ ์ํคํ ์ฒ๋ฅผ ๋ฐ์ ์์ผ์๋ค.
ํต์ฌ ๊ฐ๋
Tensor Core ์ํคํ ์ฒ ๋ฐ์
Tensor Core๋ NVIDIA GPU ๋ด๋ถ์์ ํ๋ ฌ ๊ณฑ์ -๋์ (Multiply-Accumulate, MMA) ์ฐ์ฐ์ ํ๋์จ์ด ์์ค์์ ๊ฐ์ํํ๋ ํนํ ์ ๋์ด๋ค. ์ผ๋ฐ CUDA ์ฝ์ด๊ฐ ํ ํด๋ญ๋น ํ๋์ FP32 ์ฐ์ฐ์ ์ฒ๋ฆฌํ๋ ๊ฒ๊ณผ ๋ฌ๋ฆฌ, Tensor Core๋ ํ ํด๋ญ๋น ์๋ฐฑ~์์ฒ ๊ฐ์ ๊ณฑ์ -๋์ฐ ์ฐ์ฐ์ ๋ณ๋ ฌ๋ก ์ํํ๋ค.
| ์ธ๋ | ์ํคํ ์ฒ | ์ง์ ์ ๋ฐ๋ | ํน์ง |
|---|---|---|---|
| 1์ธ๋ | Volta | FP16, INT8 | ์ต์ด Tensor Core ๋์ , MFMA ์ฐ์ฐ |
| 2์ธ๋ | Turing | FP16, INT8, INT4 | RT Core์ ๊ณต์กด, ๋ ์ด ํธ๋ ์ด์ฑ ๊ฐ์ |
| 3์ธ๋ | Ampere | FP16, BF16, TF32, FP64, INT8 | TF32 ๋์ , FP64 Tensor Core ์ต์ด, ํฌ์์ฑ ๊ฐ์ |
| 4์ธ๋ | Hopper | FP16, BF16, FP8, TF32, FP64, INT8 | Transformer Engine, FP8 ๋์ ์ ๋ฐ๋ ์ ํ |
| 5์ธ๋ | Blackwell | FP4, FP6, FP8, FP16, BF16, TF32, FP64 | FP4/FP6 ์ ๊ท ์ง์, 2๋ฐฐ MMA ์ฒ๋ฆฌ๋ |
3์ธ๋ Tensor Core (A100):
- TF32(TensorFloat-32): FP32์ ๋์ ๋ฒ์์ FP16์ ์ ๋ฐ๋๋ฅผ ๊ฒฐํฉํ 19๋นํธ ํฌ๋งท
- FP64 Tensor Core ์ต์ด ๋์
: HPC ์ํฌ๋ก๋์์ ์ด์ค ์ ๋ฐ๋ ์ฐ์ฐ ๊ฐ์
- ๊ตฌ์กฐ์ ํฌ์์ฑ(Structured Sparsity) ์ง์: 2:4 ํฌ์ ํจํด์ผ๋ก ์ฐ์ฐ 2๋ฐฐ ๊ฐ์
4์ธ๋ Tensor Core (H100):
- FP8 ์ง์: FP16 ๋๋น 2๋ฐฐ ์ฒ๋ฆฌ๋, ์ ๋ฐ์ ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋
- Transformer Engine: FP16โFP8 ๋์ ์ ๋ฐ๋ ์ ํ์ผ๋ก ์ ๋ฐ๋ ์์ค ์ต์ํ
- DPX ๋ช
๋ น์ด: Smith-Waterman/Needleman-Wunsch ๋ฑ ๋์ ํ๋ก๊ทธ๋๋ฐ ์๊ณ ๋ฆฌ์ฆ ๊ฐ์
HBM ๋ฉ๋ชจ๋ฆฌ ์๋ธ์์คํ
NVIDIA ๋ฐ์ดํฐ์ผํฐ GPU๋ HBM(High Bandwidth Memory)์ ์ฌ์ฉํ์ฌ ์ฐ์ฐ ์ ๋์ ๋๋์ ๋ฐ์ดํฐ๋ฅผ ๋น ๋ฅด๊ฒ ๊ณต๊ธํ๋ค. HBM์ 3D ์คํ ๊ตฌ์กฐ๋ก DRAM ๋ค์ด๋ฅผ ์์ง์ผ๋ก ์ ์ธตํ์ฌ ํญ๋์ ๋ฉ๋ชจ๋ฆฌ ๋ฒ์ค ํญ์ ๋ฌ์ฑํ๋ค.
| ์ธ๋ | ์ํคํ ์ฒ | HBM ์ข ๋ฅ | ์ฉ๋ | ๋์ญํญ | ๋ฒ์ค ํญ | L2 ์บ์ |
|---|---|---|---|---|---|---|
| A100 40GB | Ampere | HBM2 | 40GB | 1.52 TB/s | 5120-bit | 40MB |
| A100 80GB | Ampere | HBM2e | 80GB | 2.0 TB/s | 5120-bit | 40MB |
| H100 SXM5 | Hopper | HBM3 | 80GB | 3.35 TB/s | 5120-bit | 50MB |
| H200 | Hopper | HBM3e | 141GB | 4.8 TB/s | 6144-bit | 50MB |
H200์ H100๊ณผ ๋์ผํ Hopper ์ปดํจํธ ๋ค์ด๋ฅผ ์ฌ์ฉํ๋ฉด์ HBM3e ๋ฉ๋ชจ๋ฆฌ๋ฅผ ํ์ฌํ์ฌ ๋ฉ๋ชจ๋ฆฌ ์ฉ๋์ 141GB๋ก, ๋์ญํญ์ 4.8 TB/s๋ก ํ๋ํ๋ค. LLM ์ถ๋ก ์ํฌ๋ก๋์์ ๋ชจ๋ธ ์ ์ฒด๋ฅผ GPU ๋ฉ๋ชจ๋ฆฌ์ ์ฌ๋ฆด ์ ์๋ ์ฉ๋์ด ์ค์ํ๋ฏ๋ก, H200์ ๋์ผํ ์ํคํ ์ฒ์์๋ ์๋นํ ์ถ๋ก ์ฑ๋ฅ ํฅ์์ ์ ๊ณตํ๋ค.
MIG(Multi-Instance GPU)
MIG๋ ๋จ์ผ GPU๋ฅผ ์ต๋ 7๊ฐ์ ๋ ๋ฆฝ๋ ์ธ์คํด์ค๋ก ๋ถํ ํ์ฌ ๊ฐ๊ฐ์ด ๋ณ๋์ ๋ฉ๋ชจ๋ฆฌ, ์บ์, ์ฐ์ฐ ์ ๋์ ๊ฐ์ง๊ฒ ํ๋ ํ๋์จ์ด ์์ค ๊ฐ์ํ ๊ธฐ์ ์ด๋ค.
A100 MIG ๊ตฌ์ฑ:
| ์ธ์คํด์ค ์ | GPU ๋ฉ๋ชจ๋ฆฌ | ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ | FP32 ์ฝ์ด | Tensor Core |
|---|---|---|---|---|
| 1 | 80GB | 2.0 TB/s | 6,912 | 432 |
| 2 | ๊ฐ 40GB | ๊ฐ 1.0 TB/s | ๊ฐ 3,456 | ๊ฐ 216 |
| 3 | ๊ฐ 20GB | ๊ฐ 670 GB/s | ๊ฐ 2,304 | ๊ฐ 144 |
| 4 | ๊ฐ 20GB | ๊ฐ 500 GB/s | ๊ฐ 1,728 | ๊ฐ 108 |
| 7 | ๊ฐ 10GB | ๊ฐ 250 GB/s | ๊ฐ 988 | ๊ฐ 52 |
MIG๋ฅผ ํตํด ํด๋ผ์ฐ๋ ์๋น์ค ์ ๊ณต์๋ ๋จ์ผ GPU์์ ์ฌ๋ฌ ํ ๋ํธ์ ์ํฌ๋ก๋๋ฅผ ๊ฒฉ๋ฆฌ๋ ํ๊ฒฝ์์ ๋์์ ์คํํ ์ ์๋ค. ๊ฐ ์ธ์คํด์ค๋ ์์ ํ ํ๋์จ์ด ๊ฒฉ๋ฆฌ๋ฅผ ๋ณด์ฅํ๋ฉฐ, ๋ค๋ฅธ ์ธ์คํด์ค์ ์ฑ๋ฅ ๋ณ๋์ ์ํฅ์ ๋ฐ์ง ์๋๋ค.
NVLink ์ธํฐ์ปค๋ฅํธ
NVLink๋ GPU ๊ฐ ๊ณ ์ ์ง์ ์ฐ๊ฒฐ ์ธํฐํ์ด์ค๋ก, ๋จ์ผ PCIe ๋ฒ์ค์ ๋์ญํญ์ ๋์ด ๋ค์ค GPU ๊ฐ ๋ฐ์ดํฐ ๊ตํ์ ๊ฐ๋ฅํ๊ฒ ํ๋ค.
| ์ธ๋ | ์ํคํ ์ฒ | ๋งํฌ ์ (GPU๋น) | ์ด ๋์ญํญ (GPU๋น, ์๋ฐฉํฅ) | ๋ํ GPU ๋๋ฉ์ธ |
|---|---|---|---|---|
| NVLink 3.0 | Ampere | 12 | 600 GB/s | 8 GPU |
| NVLink 4.0 | Hopper | 18 | 900 GB/s | 8 GPU |
| NVLink 5.0 | Blackwell | 18 | 1800 GB/s | 8/72 GPU |
NVLink๋ ๋๊ท๋ชจ ๋ชจ๋ธ์ ๋ชจ๋ธ ๋ณ๋ ฌ ์ฒ๋ฆฌ(Model Parallelism)์์ ํ์์ ์ธ ์ญํ ์ ํ๋ค. GPT-4, Llama 70B ๋ฑ์ ๋๊ท๋ชจ ๋ชจ๋ธ์ ๋จ์ผ GPU ๋ฉ๋ชจ๋ฆฌ์ ์์ ํ ๋ก๋ํ ์ ์์ผ๋ฏ๋ก, ๋ชจ๋ธ ๊ณ์ธต์ ์ฌ๋ฌ GPU์ ๋ถ์ฐํ๊ณ NVLink๋ฅผ ํตํด ํ์ฑ๊ฐ๊ณผ ๊ทธ๋๋์ธํธ๋ฅผ ๊ตํํ๋ค. H100๊ณผ H200์์ ์์ฃผ ์ธ์ฉ๋๋ 900 GB/s ์์น๋ ๋งํฌ๋น ์์น๊ฐ ์๋๋ผ GPU๋น ์ด ์๋ฐฉํฅ ๋์ญํญ์ด๋ค.
๋น๊ต/๋ถ์
NVIDIA ๋ฐ์ดํฐ์ผํฐ GPU ์ธ๋ ๋น๊ต
| ํญ๋ชฉ | A100 80GB | H100 SXM5 | H200 SXM5 |
|---|---|---|---|
| ์ํคํ ์ฒ | Ampere | Hopper | Hopper |
| ์ ์กฐ ๊ณต์ | TSMC N7 | TSMC 4N | TSMC 4N |
| ํธ๋์ง์คํฐ ์ | 542์ต | 800์ต | 800์ต |
| ๋ค์ด ํฌ๊ธฐ | 826 mmยฒ | 814 mmยฒ | 814 mmยฒ |
| SM ์ | 108 | 132 | 132 |
| FP32 CUDA ์ฝ์ด | 6,912 | 16,896 | 16,896 |
| ๋ถ์คํธ ํด๋ญ | 1,410 MHz | 1,980 MHz | 1,980 MHz |
| ๋ฉ๋ชจ๋ฆฌ | 80GB HBM2e | 80GB HBM3 | 141GB HBM3e |
| ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ | 2.0 TB/s | 3.35 TB/s | 4.8 TB/s |
| L2 ์บ์ | 40MB | 50MB | 50MB |
| FP32 ์ฑ๋ฅ | 19.5 TFLOPS | 67 TFLOPS | 67 TFLOPS |
| FP64 ์ฑ๋ฅ | 9.7 TFLOPS | 34 TFLOPS | 34 TFLOPS |
| TF32 Tensor | 156 TFLOPS | 495 TFLOPS | 495 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 990 TFLOPS | 990 TFLOPS |
| FP8 Tensor | - | 1,980 TFLOPS | 1,980 TFLOPS |
| INT8 Tensor | 624 TOPS | 1,980 TOPS | 1,980 TOPS |
| NVLink ๋์ญํญ | 600 GB/s | 900 GB/s | 900 GB/s |
| TDP | 400W | 700W | 700W |
| MIG ์ง์ | ์ต๋ 7๊ฐ | ์ต๋ 7๊ฐ | ์ต๋ 7๊ฐ |
| Transformer Engine | X | O | O |
| FP8 ์ง์ | X | O | O |
์ธ๋๋ณ ์ฃผ์ ๋ฐ์ ํฌ์ธํธ
A100 โ H100 (Ampere โ Hopper):
1. FP32 ์ฝ์ด 2.4๋ฐฐ ์ฆ๊ฐ (6,912 โ 16,896)
2. ๋ถ์คํธ ํด๋ญ 40% ํฅ์ (1,410 โ 1,980 MHz)
3. FP32 ์ฑ๋ฅ 3.4๋ฐฐ ํฅ์ (19.5 โ 67 TFLOPS)
4. HBM3 ์ ์ฉ์ผ๋ก ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ 67% ํฅ์ (2.0 โ 3.35 TB/s)
5. Transformer Engine์ผ๋ก FP8 ์ฐ์ฐ ์ง์, ์ถ๋ก ์ฒ๋ฆฌ๋ 2๋ฐฐ ํฅ์
6. TMA(Tensor Memory Accelerator)๋ก ๋น๋๊ธฐ ๋ฉ๋ชจ๋ฆฌ ์ ์ก ์ต์ ํ
7. Distributed Shared Memory๋ก SM ๊ฐ ์ง์ ๋ฐ์ดํฐ ๊ตํ
H100 โ H200 (HBM3 โ HBM3e):
1. ๋ฉ๋ชจ๋ฆฌ ์ฉ๋ 76% ํ๋ (80GB โ 141GB)
2. ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ 43% ํฅ์ (3.35 โ 4.8 TB/s)
3. ์ปดํจํธ ๋์ผ: ๋์ผํ H100 ๋ค์ด ์ฌ์ฉ
4. LLM ์ถ๋ก ์์ ๋ชจ๋ธ ์ ์ฌ ์ฉ๋ ์ฆ๊ฐ๋ก ์๊ฐ๋น ํ ํฐ ์ฒ๋ฆฌ๋ ํฅ์
๋์ ์๋ฆฌ
GPU ์ปดํจํ ํ์ดํ๋ผ์ธ
NVIDIA GPU๋ SIMT(Single Instruction, Multiple Threads) ๋ชจ๋ธ์ ๊ธฐ๋ฐ์ผ๋ก ๋์ํ๋ค. ์์ฒ ๊ฐ์ ์ค๋ ๋๊ฐ ๋์ผํ ๋ช ๋ น์ด๋ฅผ ๋ณ๋ ฌ๋ก ์คํํ๋ฉฐ, ๊ฐ ์ค๋ ๋๋ ๋ ๋ฆฝ์ ์ธ ๋ ์ง์คํฐ์ ํ๋ก๊ทธ๋จ ์นด์ดํฐ๋ฅผ ๊ฐ์ง๋ค.
H100 SM(Streaming Multiprocessor) ๊ตฌ์ฑ:
- FP32 CUDA ์ฝ์ด: 128๊ฐ
- FP64 ์ฝ์ด: 64๊ฐ
- Tensor Core: 4๊ฐ (4์ธ๋)
- ๊ณต์ ๋ฉ๋ชจ๋ฆฌ/L1 ์บ์: 256KB (ํตํฉ)
- ์ํ ์ค์ผ์ค๋ฌ: 4๊ฐ
- ๋์ ํ์ฑ ์ํ: 64๊ฐ
ํ๋์ SM์ ์ฌ๋ฌ Warp(32์ค๋ ๋ ๋ฌถ์)๋ฅผ ๋์์ ์ค์ผ์ค๋งํ์ฌ ๋ฉ๋ชจ๋ฆฌ ์ง์ฐ ์๊ฐ์ ์จ๊ธด๋ค. Warp Scheduler๋ ๋ค์์ ์คํํ Warp๋ฅผ ์ ํํ๊ณ , Operand๋ฅผ ์ฝ์ด ์ฐ์ฐ์ ์ํํ๋ฉฐ, ๊ฒฐ๊ณผ๋ฅผ ๋ค์ ๋ฉ๋ชจ๋ฆฌ์ ๊ธฐ๋กํ๋ค.
Transformer Engine ๋์:
Transformer Engine์ Transformer ๋ชจ๋ธ์ ์ดํ
์
๋ ์ด์ด์์ FP16๊ณผ FP8 ์ฌ์ด๋ฅผ ๋์ ์ผ๋ก ์ ํํ๋ค. ๋ ์ด์ด๋ณ๋ก ํ์ฑ๊ฐ์ ๋ถํฌ๋ฅผ ๋ถ์ํ์ฌ, ์ ๋ฐ๋ ์์ค์ด ํ์ฉ๋๋ ๋ฒ์ ๋ด์์ FP8๋ก ์ฐ์ฐํ์ฌ ์ฒ๋ฆฌ๋์ 2๋ฐฐ๋ก ๋์ธ๋ค. per-tensor ์ค์ผ์ผ๋ง๊ณผ per-channel ์ค์ผ์ผ๋ง์ ๋ชจ๋ ์ง์ํ์ฌ FP8์ ์ข์ ๋์ ๋ฒ์๋ฅผ ๋ณด์ํ๋ค.
MIG ํ๋์จ์ด ๊ฒฉ๋ฆฌ
MIG๋ GPU ๋ค์ด๋ฅผ ๋ฌผ๋ฆฌ์ ์ผ๋ก ๊ฒฉ๋ฆฌ๋ ํํฐ์ ์ผ๋ก ๋ถํ ํ๋ค. ๊ฐ ํํฐ์ ์ ๋ ๋ฆฝ๋ SM ๊ทธ๋ฃน, ๋ฉ๋ชจ๋ฆฌ ์ปจํธ๋กค๋ฌ, L2 ์บ์ ํํฐ์ ์ ๊ฐ์ง๋ฉฐ, ๋ค๋ฅธ ํํฐ์ ๊ณผ ํ๋์จ์ด ์์ค์์ ์์ ํ ๊ฒฉ๋ฆฌ๋๋ค.
๋ฉ๋ชจ๋ฆฌ ์ปจํธ๋กค๋ฌ๋ ํํฐ์ ๋ณ๋ก ๋ ๋ฆฝ๋ ๋์ญํญ ํ ๋น์ ๊ฐ์ง๋ฉฐ, NVLink ๋งํฌ๋ ํํฐ์ ์ ๋ฐ๋ผ ๋ถ๋ฐฐ๋๋ค. ์ด ๊ฒฉ๋ฆฌ๋ ๋ณด์๊ณผ ์ฑ๋ฅ ๊ฒฉ๋ฆฌ๋ฅผ ๋์์ ๋ณด์ฅํ์ฌ, ํ ํ ๋ํธ์ ์ํฌ๋ก๋๊ฐ ๋ค๋ฅธ ํ ๋ํธ์ ์ฑ๋ฅ์ ์ํฅ์ ๋ฏธ์น์ง ์๋๋ค.
์ฅ๋จ์
์ฅ์
- ํ๋ถํ ์ํ๊ณ: CUDA, cuDNN, cuBLAS, TensorRT, NCCL ๋ฑ ๊ฐ์ฅ ์ฑ์ํ GPU ์ํํธ์จ์ด ์คํ
- ๋ฒ์ฉ์ฑ: AI ํ๋ จ/์ถ๋ก , HPC, ๊ทธ๋ํฝ์ค, ๋ฐ์ดํฐ ๋ถ์ ๋ฑ ๋ค์ํ ์ํฌ๋ก๋ ์ง์
- MIG ๊ฒฉ๋ฆฌ: ํ๋์จ์ด ์์ค ์ํฌ๋ก๋ ๊ฒฉ๋ฆฌ๋ก ํด๋ผ์ฐ๋ ๋ฉํฐํ ๋์ ์ง์
- NVLink ํ์ฅ์ฑ: ๋ค์ค GPU ๊ฐ ๊ณ ์ ํต์ ์ผ๋ก ๋๊ท๋ชจ ๋ชจ๋ธ ๋ถ์ฐ ์ฒ๋ฆฌ ๊ฐ๋ฅ
- Tensor Core ๊ฐ์: ํ๋ ฌ ์ฐ์ฐ ํ๋์จ์ด ๊ฐ์์ผ๋ก ๋์ ์ฐ์ฐ ํจ์จ
- Transformer Engine: FP8 ๋์ ์ ๋ฐ๋๋ก Transformer ๋ชจ๋ธ ์ถ๋ก ์ฑ๋ฅ ๊ทน๋ํ
๋จ์
- ์ ๋ ฅ ์๋น: H100 SXM5 ๊ธฐ์ค 700W๋ก ๋๊ฐ ์ธํ๋ผ ๋น์ฉ ์ฆ๊ฐ
- ๊ฐ๊ฒฉ: A100 ์ฝ $10,000~$15,000, H100 ์ฝ $25,000~$30,000 (์ถ์ ๊ธฐ์ค)
- ๊ณต๊ธ ์ ์ฝ: AI ์์ ํญ์ฆ์ผ๋ก ์ธํ ๊ณต๊ธ ๋ถ์กฑ, ๋ฆฌ๋ ํ์ ์ฅ๊ธฐํ
- ์์กด์ฑ: CUDA ์ข ์์ผ๋ก AMD ๋ฑ ๋์ฒด ํ๋ซํผ ์ ํ ๋น์ฉ ๋ฐ์
- ์์ถ ํต์ : ๋ฏธ๊ตญ ์์ถ ๊ท์ ๋ก ์ธํ ํน์ ์ง์ญ ํ๋งค ์ ํ
๊ด๋ จ ๊ธฐ์
์ฐธ๊ณ ํ์ค ๋ฐ ์ฌ์
- NVIDIA H100 Tensor Core GPU Architecture Whitepaper (2022)
- NVIDIA A100 Tensor Core GPU Architecture Whitepaper (2020)
- NVIDIA H200 GPU Architecture Overview (2024)
- NVIDIA NVLink and NVLink Switch ๊ณต์ ์ฌ์
- JEDEC HBM3/HBM3e ํ์ค (JESD235B)
๊ด๋ จ ๋ฌธ์
- AI ๊ฐ์๊ธฐ ๊ฐ์
- ํผํฉ ์ ๋ฐ๋ ํ๋์จ์ด
- ํ ์ ์ฝ์ด ์ํคํ ์ฒ
- GPU ๋ฉ๋ชจ๋ฆฌ ์ํคํ ์ฒ ๊ธฐ์ด
- CUDA ๋ฉ๋ชจ๋ฆฌ ๊ด๋ฆฌ
- HBM Generation Comparison
- ๋ฉํฐ GPU ํต์
ํต์ฌ ์ ๋ฆฌ
- NVIDIA ๋ฐ์ดํฐ์ผํฐ GPU๋ Tensor Core๋ฅผ ํตํ ํ๋ ฌ ์ฐ์ฐ ๊ฐ์, HBM ๊ณ ๋์ญํญ ๋ฉ๋ชจ๋ฆฌ, NVLink ๊ณ ์ ์ธํฐ์ปค๋ฅํธ์ ์ธ ๊ฐ์ง ์ถ์ ํตํด AI ์ํฌ๋ก๋๋ฅผ ๊ฐ์ํํ๋ค.
- A100(Hopper ์ด์ ์ธ๋)์ 3์ธ๋ Tensor Core, TF32, FP64 Tensor Core, MIG๋ฅผ ๋์ ํ์ฌ AI ํ๋ จ๊ณผ HPC๋ฅผ ํตํฉํ๋ค.
- H100(Hopper)์ 4์ธ๋ Tensor Core์ Transformer Engine์ ํตํด FP8 ์ฐ์ฐ์ ์ง์ํ๊ณ , FP16 ๋๋น 2๋ฐฐ์ ์ถ๋ก ์ฒ๋ฆฌ๋์ ๋ฌ์ฑํ๋ค.
- H200์ H100๊ณผ ๋์ผํ ์ปดํจํธ ๋ค์ด์ HBM3e๋ฅผ ์ ์ฉํ์ฌ ๋ฉ๋ชจ๋ฆฌ ์ฉ๋์ 141GB๋ก, ๋์ญํญ์ 4.8 TB/s๋ก ํ๋ํ์ผ๋ฉฐ, LLM ์ถ๋ก ์์ ๋ชจ๋ธ ์ ์ฌ ์ฉ๋ ์ฆ๊ฐ๋ก ์ค์ง์ ์ธ ์ฑ๋ฅ ํฅ์์ ์ ๊ณตํ๋ค.
- MIG๋ ๋จ์ผ GPU๋ฅผ ์ต๋ 7๊ฐ๋ก ๋ถํ ํ์ฌ ํ๋์จ์ด ์์ค ๊ฒฉ๋ฆฌ์ ๋ฉํฐํ ๋์๋ฅผ ๋ณด์ฅํ๋ฉฐ, NVLink๋ ๋ค์ค GPU ๊ฐ ๊ณ ์ ํต์ ์ผ๋ก ๋๊ท๋ชจ ๋ชจ๋ธ์ ๋ถ์ฐ ์ฒ๋ฆฌ๋ฅผ ๊ฐ๋ฅํ๊ฒ ํ๋ค.