LLM ์์ํ
LLM ์์ํ ์ฌ์ธต ๋ถ์
๊ฐ์ค์น ์์ํ ยท GPTQ ยท AWQ ยท GGUF ยท ํ๋ จ ํ ์์ํ ยท ํ์ฑ๊ฐ ์ธ์ ยท ํผํฉ ์ ๋ฐ๋ ยท ์จ๋๋ฐ์ด์ค LLM
๋๊ท๋ชจ ์ธ์ด ๋ชจ๋ธ(LLM)์ ์ถ๋ก ๋น์ฉ์ ๋ชจ๋ธ ํฌ๊ธฐ์ ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ ์๊ตฌ๋์ ์ง์ ๋น๋กํฉ๋๋ค. 70B ํ๋ผ๋ฏธํฐ ๋ชจ๋ธ์ FP16 ๊ธฐ์ค ์ฝ 140GB์ ๊ฐ์ค์น ๋ฉ๋ชจ๋ฆฌ๋ฅผ ์๊ตฌํ๋ฏ๋ก ๋จ์ผ GPU์ ์ฌ๋ฆฌ๊ธฐ ์ด๋ ต๊ณ , ํ ํฐ ์์ฑ ๋จ๊ณ์์๋ ๋ฉ๋ชจ๋ฆฌ ์ด๋์ด ๋ณ๋ชฉ์ด ๋๊ธฐ ์ฝ์ต๋๋ค. ์์ํ(Quantization)๋ ๊ฐ์ค์น, ํ์ฑ๊ฐ, KV cache์ ๋นํธํญ์ ๋ฎ์ถฐ ๋ชจ๋ธ ํฌ๊ธฐ์ ๋ฉ๋ชจ๋ฆฌ ํธ๋ํฝ์ ์ค์ด๋ ๋ํ์ ์ธ ์์ถ ๊ธฐ๋ฒ์ ๋๋ค.
LLM ๋ฐฐํฌ์์๋ ์ถ๊ฐ ์ฌํ์ต ๋น์ฉ์ด ๋ฎ์ ํ๋ จ ํ ์์ํ(Post-Training Quantization, PTQ)๊ฐ ๊ฐ์ฅ ๋๋ฆฌ ์ฐ์ ๋๋ค. GPTQ๋ ๊ทผ์ฌ 2์ฐจ ์ ๋ณด๋ฅผ ์ฌ์ฉํด ๊ฐ์ค์น ์์ค์ ์ค์ด๊ณ , AWQ๋ ํ์ฑ๊ฐ ํต๊ณ๋ฅผ ์ด์ฉํด ์ค์ํ ์ฑ๋์ ๋ณดํธํฉ๋๋ค. GGUF๋ ์์ํ ์๊ณ ๋ฆฌ์ฆ ์์ฒด๋ผ๊ธฐ๋ณด๋ค llama.cpp ๊ณ์ด ๋ฐํ์์ด ๋น ๋ฅด๊ฒ ๋ก๋ํ ์ ์๋๋ก ์์ํ๋ ํ ์์ ๋ฉํ๋ฐ์ดํฐ๋ฅผ ๋ด๋ ๋ฐฐํฌ ํฌ๋งท์ด๋ฉฐ, Q4_K_M, Q5_K_M ๊ฐ์ ์ฌ๋ฌ ์ธ์ฝ๋ฉ์ ํจ๊ป ์ด์ฉํ๋ ๋ฐ ์ฐ์ ๋๋ค.
ํต์ฌ ๊ฐ๋
์์ํ ๊ธฐ์ด
์์ํ๋ ๋ถ๋์์์ ๊ฐ์ ์ ์ ๊ฐ์ผ๋ก ๋ณํํ๋ ๊ณผ์ ์ ๋๋ค. ํต์ฌ์ ์ค์ผ์ผ(scale)๊ณผ ์ ๋ก ํฌ์ธํธ(zero-point)์ ๋๋ค:
- ์ค์ผ์ผ(s): ์ค์ ๋ฒ์๋ฅผ ์ ์ ๋ฒ์๋ก ๋งคํํ๋ ๋น์จ
- ์ ๋ก ํฌ์ธํธ(z): ์ค์ 0์ ๋์ํ๋ ์ ์ ๊ฐ
- ์์ํ:
q = round(x / s + z) - ์ญ์์ํ:
x_hat = s * (q - z)
๋นํธํญ๋ณ ๋ฉ๋ชจ๋ฆฌ ์ ๊ฐ
| ๋นํธํญ | FP16 ๋๋น ์์ถ๋ฅ | ์ ํ๋ ์ํฅ | ๋ํ ๊ธฐ๋ฒ |
|---|---|---|---|
| FP16 | ๊ธฐ์ค | ๊ธฐ์ค | ์๋ณธ ๋ฐฐํฌ ํ์ |
| INT8 | 2๋ฐฐ | ๊ฒฝ๋ฏธํ ์ ํ | LLM.int8, SmoothQuant, TensorRT-LLM |
| INT4 | 4๋ฐฐ | ๊ฒฝ๋ฏธํจ~์ค๊ฐ | GPTQ, AWQ, NF4 |
| INT3 | 5.3๋ฐฐ | ์ค๊ฐ ์ ํ | GGUF Q3_K ๊ณ์ด |
| INT2 | 8๋ฐฐ | ํฐ ์ ํ | ์ฐ๊ตฌ/์คํ์ ๊ธฐ๋ฒ |
๊ฐ์ค์น ์ ์ฉ, ํ์ฑ๊ฐ, KV cache ์์ํ
LLM ์์ํ๋ ๋ชจ๋ ๊ฐ์ ๋ณ๋ชฉ์ ๋ค๋ฃจ์ง ์์ต๋๋ค. ๊ฐ์ฅ ๋ณดํธ์ ์ธ ๋ฐฉ์์ ๊ฐ์ค์น ์ ์ฉ ์์ํ(weight-only quantization)๋ก, ๋ชจ๋ธ ํ๋ผ๋ฏธํฐ๋ฅผ 4๋นํธ๋ 8๋นํธ๋ก ์ค์ฌ VRAM ์ฌ์ฉ๋์ ํฌ๊ฒ ๋ฎ์ถฅ๋๋ค. GPTQ์ AWQ๊ฐ ์ฌ๊ธฐ์ ์ํ๋ฉฐ, ์ถ๋ก ์ ํ์ฑ๊ฐ์ FP16/BF16์ผ๋ก ์ ์งํ๋ ๊ฒฝ์ฐ๊ฐ ๋ง์ต๋๋ค.
๋ฐ๋๋ก W8A8 ๊ณ์ด ์์ํ๋ ๊ฐ์ค์น์ ํ์ฑ๊ฐ์ ํจ๊ป ๋ฎ์ถฐ ์ฐ์ฐ๋๊น์ง ์ค์ด๋ ค๋ ์ ๊ทผ์ ๋๋ค. ํ์ฑ๊ฐ์๋ ์ด์์น(outlier)๊ฐ ์์ฃผ ๋ํ๋๋ฏ๋ก calibration๊ณผ ์ค์ผ์ผ ์ ํ์ด ํจ์ฌ ๋ฏผ๊ฐํฉ๋๋ค. ๊ธด ์ปจํ ์คํธ ์ถ๋ก ์์๋ KV cache ์์ํ๋ ์ค์ํฉ๋๋ค. ๊ฐ์ค์น๋ณด๋ค cache๊ฐ ๋ ํฐ ๋น์ค์ ์ฐจ์งํ๋ ๋ฐฐ์น๋ ์ฅ๋ฌธ ์ถ๋ก ์์๋ KV cache๋ฅผ INT8 ๋๋ ๋ ๋ฎ์ ๋นํธํญ์ผ๋ก ์์ถํด ์ธ์ ์์ฉ๋์ ๋์ ๋๋ค.
ํ๋ จ ํ ์์ํ (PTQ)
PTQ๋ ์ด๋ฏธ ํ๋ จ๋ ๋ชจ๋ธ์ ๊ฐ์ค์น ๋๋ ํ์ฑ๊ฐ ๋ฒ์๋ฅผ ์๋์ calibration ๋ฐ์ดํฐ๋ก ์ถ์ ํ ๋ค, ์ฌํ์ต ์์ด ๋นํธํญ๋ง ๋ฎ์ถ๋ ๋ฐฉ๋ฒ์ ๋๋ค. LLM์์๋ ์ ์ฒด ์ฌํ์ต ๋น์ฉ์ด ํฌ๊ธฐ ๋๋ฌธ์ PTQ๊ฐ ์ค๋ฌด ๊ธฐ๋ณธ๊ฐ์ ๊ฐ๊น์ต๋๋ค. ๋ณดํต per-tensor๋ณด๋ค per-channel ๋๋ group-wise ์ค์ผ์ผ์ด ๋ ์ข์ ์ ํ๋๋ฅผ ์ ๊ณตํฉ๋๋ค.
๋น๊ต/๋ถ์
์ฃผ์ ์์ํ ๊ธฐ๋ฒ ๋น๊ต
| ๊ธฐ๋ฒ | ์๋ฆฌ | calibration ๋ฐ์ดํฐ | ์๋ | ์ ํ๋ | ํ๋์จ์ด ์ง์ |
|---|---|---|---|---|---|
| GPTQ | ๊ทผ์ฌ 2์ฐจ ์ ๋ณด ๊ธฐ๋ฐ ์ผํ์ฑ ๊ฐ์ค์น ์ ์ฉ PTQ | ํ์ (์๋) | ๋น ๋ฆ | ๋์ | ๋ฒ์ฉ CUDA/ROCm |
| AWQ | ํ์ฑ๊ฐ ๊ธฐ๋ฐ ์ค์ ์ฑ๋ ๋ณดํธ | ํ์ (์๋) | ๋น ๋ฆ | ๋งค์ฐ ๋์ | CUDA, ์ฃ์ง GPU |
| GGUF | ์์ํ๋ ํ ์์ ๋ฉํ๋ฐ์ดํฐ๋ฅผ ๋ด๋ ๋ฐฐํฌ ํฌ๋งท | ์ ํ์ | ๋งค์ฐ ๋น ๋ฆ | ์ธ์ฝ๋ฉ์ ๋ฐ๋ผ ๋ค๋ฆ | CPU/GPU |
| FP8 | 8๋นํธ ๋ถ๋์์์ ํผํฉ ์ ๋ฐ๋ | ๋ณดํต ๋ถํ์ | ๋น ๋ฆ | ๋งค์ฐ ๋์ | Hopper/Ada ๋ฑ ์ ์ฉ ํ๋์จ์ด |
| BitsAndBytes/NF4 | 4๋นํธ ๋ธ๋ก ์์ํ์ ์คํ ์ปค๋ | ๋ถํ์ ๋๋ ์ ํ์ | ๋ณดํต | ์ค๊ฐ~๋์ | CUDA |
GPTQ vs AWQ ์์ธ ๋น๊ต
| ํญ๋ชฉ | GPTQ | AWQ |
|---|---|---|
| ๋ฐฉ๋ฒ๋ก | Optimal Brain Surgeon ๊ณ์ด์ ๊ทผ์ฌ 2์ฐจ ์ต์ ํ | ํ์ฑ๊ฐ ๋ถํฌ ๊ธฐ๋ฐ ์ค์ผ์ผ๋ง |
| calibration | 128๊ฐ ์ํ | 128๊ฐ ์ํ |
| ์์ํ ์๊ฐ | ~4 GPU์๊ฐ (175B) | ~1 GPU์๊ฐ (7B) |
| ์ ํ๋ | 4๋นํธ์์ ๊ฑฐ์ ๋ฌด์์ค | 4๋นํธ์์ ๊ฑฐ์ ๋ฌด์์ค |
| ์ด์ | ๋ฎ์ ๋นํธํญ๊น์ง ๊ณต๊ฒฉ์ ์ผ๋ก ์์ถ ๊ฐ๋ฅ | ์ฌ๊ตฌ์ฑ ์์ด ์ผ๋ฐํ ์ ์ง, ์ปค๋ ์นํ์ |
| ๊ตฌํ | transformers, auto-gptq | transformers, autoawq |
๋์ ์๋ฆฌ
GPTQ (Accurate Post-Training Quantization)
GPTQ๋ Optimal Brain Surgeon ๊ณ์ด์ ๊ทผ์ฌ 2์ฐจ ์ ๋ณด๋ฅผ ํ์ฉํ๋ ํ๋ จ ํ ์์ํ ๊ธฐ๋ฒ์ ๋๋ค. ํต์ฌ์ ๊ฐ ๋ ์ด์ด์ ๊ฐ์ค์น๋ฅผ ํ ๋ฒ์ PTQ ์ ์ฐจ๋ก ์์ฐจ ์์ํํ๋ฉด์, ์์ ์๊ธด ์ค์ฐจ๋ฅผ ๋ค์ชฝ ๊ฐ์ค์น์ ๋ฐ์ํด ๋์ ์์ค์ ์ค์ด๋ ๋ฐ ์์ต๋๋ค:
- Hessian ๊ทผ์ฌ ์์ง: calibration ๋ฐ์ดํฐ๋ฅผ ์ฌ์ฉํด ๋ ์ด์ด๋ณ 2์ฐจ ์ ๋ณด๋ฅผ ๊ทผ์ฌ
- ์ด ๋๋ ๋ธ๋ก ๋จ์ ์์ํ: ๊ฐ์ค์น๋ฅผ group-wise ๋๋ column-wise๋ก ๋ฎ์ ๋นํธํญ์ ๋งคํ
- ์ค์ฐจ ์ ํ ๋ณด์ : ์ด๋ฏธ ์์ํํ ์ด์ ์ค์ฐจ๋ฅผ ๋จ์ ์ด์ ๋ฐ์ํด ํ์ ์์ค์ ๋ณด์
- ๋ ์ด์ด ์์ฐจ ์ฒ๋ฆฌ: ํฐ ๋ชจ๋ธ๋ ๋ ์ด์ด ๋จ์๋ก ๋ฉ๋ชจ๋ฆฌ๋ฅผ ํต์ ํ๋ฉฐ ์ผํ์ฑ ์ ์ฐจ๋ก ์ฒ๋ฆฌ
GPTQ์ ์ฅ์ ์ 175B๊ธ ๋ชจ๋ธ๋ ๋ ผ๋ฌธ ๊ธฐ์ค ์ฝ 4 GPU์๊ฐ ๋ด์ ์์ํํ ์ ์๋ค๋ ์ ์ ๋๋ค. ํนํ 3~4๋นํธ ๊ตฌ๊ฐ์์ ์ ํ๋ ์์ค์ ์๊ฒ ์ ์งํ๋ฉฐ, ๋ฉ๋ชจ๋ฆฌ ์ ๊ฐ ๋๋น ํ์ง์ด ์ข์ต๋๋ค. ๋ค๋ง ๋ฎ์ ๋นํธํญ์ผ๋ก ๊ฐ์๋ก ์ปค๋ ๊ตฌํ๊ณผ group size ์ ํ์ ๋ฐ๋ฅธ ์ฑ๋ฅ ํธ์ฐจ๊ฐ ์ปค์ง๋๋ค.
AWQ (Activation-aware Weight Quantization)
AWQ๋ ํ์ฑ๊ฐ ๋ถํฌ๋ฅผ ๋ถ์ํ์ฌ ์ค์ํ ๊ฐ์ค์น ์ฑ๋์ ๋ณดํธํ๋ ๊ฐ์ค์น ์ ์ฉ PTQ ๊ธฐ๋ฒ์ ๋๋ค:
- ํ์ฑํ ๋ถ์: calibration ๋ฐ์ดํฐ๋ก ํ์ฑํ ๋ถํฌ๋ฅผ ์์ง
- ์ค์ ์ฑ๋ ์๋ณ: ํ์ฑ๊ฐ์ ํฐ ์ํฅ์ ๋ฐ๋ salient ์ฑ๋(์ฝ 1%)์ ์๋ณ
- ์ค์ผ์ผ ํ์: ์ฑ๋๋ณ ์ค์ผ์ผ์ ์กฐ์ ํด ์ค์ํ ์ฑ๋์ ์์ํ ์ค์ฐจ๋ฅผ ๊ฐ์
- ์์ํ: ์ค์ผ์ผ๋ง๋ ๊ฐ์ค์น๋ฅผ ์์ํ
AWQ์ ํต์ฌ ๋ฐ๊ฒฌ์ "๋ชจ๋ ๊ฐ์ค์น๊ฐ ๋์ผํ๊ฒ ์ค์ํ์ง ์๋ค"๋ ์ ์ ๋๋ค. ์ค์ํ ์์ ์ฑ๋๋ง ๋ณดํธํด๋ ์ค์ฐจ๋ฅผ ํฌ๊ฒ ์ค์ผ ์ ์์ผ๋ฉฐ, ์ฌ๊ตฌ์ฑ ์ต์ ํ๋ ์ญ์ ํ ์์ด๋ instruction-tuned ๋ชจ๋ธ๊ณผ ๋ฉํฐ๋ชจ๋ฌ ๋ชจ๋ธ๊น์ง ๋น๊ต์ ์์ ์ ์ผ๋ก ์ผ๋ฐํ๋ฉ๋๋ค.
GGUF (GPT-Generated Unified Format)
GGUF๋ llama.cpp ๊ณ์ด ๋ฐํ์์ด ์ฌ์ฉํ๋ ๋ฐฐํฌ ํฌ๋งท์ผ๋ก, ๋ค์ํ ์์ํ ์ธ์ฝ๋ฉ๊ณผ ๋ฉํ๋ฐ์ดํฐ๋ฅผ ํจ๊ป ์ ์ฅํฉ๋๋ค:
- Q4_0: ๋จ์ 4๋นํธ ์ธ์ฝ๋ฉ, ํฌ๊ธฐ ์ฐ์
- Q4_K_M: K-quant ๊ณ์ด 4๋นํธ, ํ์ง๊ณผ ํฌ๊ธฐ ๊ท ํ
- Q5_K_M: 5๋นํธ K-quant, ์ ํ๋ ์ฐ์
- Q8_0: 8๋นํธ ์ธ์ฝ๋ฉ, ์ ํ๋ ์์ค์ด ์์
- IQ4_XS: importance-aware ๊ณ์ด 4๋นํธ ์ธ์ฝ๋ฉ
GGUF์ ์ฅ์ ์ ๋จ์ผ ํ์ผ ๋ฐฐํฌ, ๋ฉํ๋ฐ์ดํฐ ํฌํจ, mmap ์นํ์ฑ์
๋๋ค. ํนํ CPU ์ถ๋ก ์์๋ AVX2, AVX-512, NEON ๊ฐ์ SIMD ๊ฒฝ๋ก์ ๊ฒฐํฉํด ๋น ๋ฅธ ์ญ์์ํ๋ฅผ ์ํํ ์ ์๊ณ , ์ผ๋ถ GPU ๋ฐฑ์๋์์๋ ๊ฐ์ ํฌ๋งท์ ๊ณต์ ํ ์ ์์ต๋๋ค.
์ฅ๋จ์
์ฅ์
- ๋ฉ๋ชจ๋ฆฌ ์ ๊ฐ: 4๋นํธ ์์ํ๋ก ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ 75% ์ ๊ฐ
- ์ถ๋ก ์๋ ํฅ์: ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ ์ ๊ฐ์ผ๋ก ๋์ฝ๋ฉ ์๋ ์ฆ๊ฐ
- ์ ๊ทผ์ฑ ํฅ์: ๋จ์ผ GPU๋ ๊ณ ์ฉ๋ ์ฃ์ง ๋๋ฐ์ด์ค์์๋ ๋ํ ๋ชจ๋ธ ์คํ ๊ฐ๋ฅ
- ๋น์ฉ ์ ๊ฐ: GPU ์์ ๊ฐ์๋ก ์ธํ๋ผ ๋น์ฉ ์ ๊ฐ
๋จ์
- ์ ํ๋ ์ ํ: ๋นํธํญ์ด ๋ฎ์์ง์๋ก ์ ํ๋ ํ๋ฝ
- ์ค๋ฒํค๋: ์์ํ/์ญ์์ํ ์ฐ์ฐ ๋น์ฉ
- ํ๋์จ์ด ์์กด: ํน์ ์์ํ๋ ํน์ ํ๋์จ์ด์์๋ง ์ถฉ๋ถํ ๊ฐ์
- ์ ์ฉ ์ ํ: ์ผ๋ถ ๊ธฐ๋ฒ์ ํน์ ๋ชจ๋ธ ๊ตฌ์กฐ๋ ์ปค๋ ๊ตฌํ์ ๋ ์ ๋ง์
๋นํธํญ๋ณ ์ค์ฉ์ ํธ๋ ์ด๋์คํ
| ๋นํธํญ | FP16 ๋๋น ๋ฉ๋ชจ๋ฆฌ | ์๋ | ์ ํ๋ | ์ฌ์ฉ ์ฌ๋ก |
|---|---|---|---|---|
| 8๋นํธ | 2๋ฐฐ ์ ๊ฐ | ์ฝ๊ฐ ๋น ๋ฆ | ๊ฑฐ์ ๋ฌด์์ค | ํ๋ก๋์ ์ถ๋ก , W8A8 |
| 4๋นํธ | 4๋ฐฐ ์ ๊ฐ | 2~3๋ฐฐ ๋น ๋ฆ | ๊ฒฝ๋ฏธํ ์ ํ | ๋๋ ๋ฐฐํฌ, ์ฃ์ง ์ถ๋ก |
| 3๋นํธ | 5.3๋ฐฐ ์ ๊ฐ | 3~4๋ฐฐ ๋น ๋ฆ | ์ค๊ฐ ์ ํ | ๋ฉ๋ชจ๋ฆฌ ์ ์ฝ ํ๊ฒฝ |
| 2๋นํธ | 8๋ฐฐ ์ ๊ฐ | ์ปค๋์ ๋ฐ๋ผ ๋ค๋ฆ | ์๋นํ ์ ํ | ์คํ/์ฐ๊ตฌ |
์ค๋ฌด์์๋ 4๋นํธ๊ฐ ๊ฐ์ฅ ๋์ ํธํ์ฑ์ ๋ณด์ ๋๋ค. 8๋นํธ๋ ์ ํ๋ ๋ณด์กด์ด ์ฌ์ ์ด์ ์ํ์ด ๋ฎ๊ณ , 3๋นํธ ์ดํ๋ถํฐ๋ ๋ชจ๋ธ๋ง๋ค ํ์ง ํธ์ฐจ๊ฐ ๊ธ๊ฒฉํ ์ปค์ง๋๋ค. ๋ฐ๋ผ์ ๋์ผํ ๋นํธํญ์ด๋ผ๋ ๊ทธ๋ฃน ํฌ๊ธฐ, ํ์ฑ๊ฐ ์ค์ผ์ผ๋ง, ์คํ ์ปค๋, KV cache ์ ์ฑ ๊น์ง ํจ๊ป ๋ด์ผ ์ค์ ์ฑ๋ฅ์ ์์ธกํ ์ ์์ต๋๋ค.
๊ด๋ จ ๊ธฐ์
์ฐธ๊ณ ๋ฌธํ
- GPTQ: Frantar et al., "GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers", ICLR 2023
- AWQ: Lin et al., "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration", MLSys 2024
- GGUF: ggerganov, "GGML/GGUF Format Specification", llama.cpp documentation
- SmoothQuant: Xiao et al., "SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models", ICML 2023
- BitsAndBytes: Dettmers et al., "LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale", NeurIPS 2022
๊ด๋ จ ๋ฌธ์
- LLM Basics
- PagedAttention Analysis
- KV Cache Quantization Analysis
- vAttention Analysis
- LLM Inference Scheduler Analysis
๊ด๋ จ ๊ธฐ์
- ๋ชจ๋ธ ์์ถ: ํ๋ฃจ๋(Pruning), ์ง์ ์ฆ๋ฅ(Knowledge Distillation)
- ์ถ๋ก ๊ฐ์: ์ปค๋ ์ตํฉ, ๋ฐฐ์น ์ฒ๋ฆฌ, ๋์ ๋ฐฐ์น, paged KV cache
- ํ๋์จ์ด ์ง์: NVIDIA Tensor Cores, AMD Matrix Cores, Intel AMX
- ํ๋ ์์ํฌ: vLLM, TensorRT-LLM, llama.cpp, Ollama
ํต์ฌ ์ ๋ฆฌ
-
์์ํ๋ LLM ๋ฐฐํฌ์ ํต์ฌ ๊ธฐ์ : ๋ฉ๋ชจ๋ฆฌ ์ฉ๋๊ณผ ๋์ญํญ ๋ณ๋ชฉ์ ๋์์ ์ค์ด๊ธฐ ๋๋ฌธ์ ๋จ์ผ GPU, edge device, ๋๊ท๋ชจ ์๋น ๋ชจ๋์์ ์ค์ํฉ๋๋ค.
-
GPTQ vs AWQ: GPTQ๋ ๊ทผ์ฌ 2์ฐจ ์ ๋ณด๋ก ์์ค์ ์ง์ ์ค์ด๊ณ , AWQ๋ ํ์ฑ๊ฐ ๊ธฐ๋ฐ์ผ๋ก ์ค์ํ ์ฑ๋์ ๋ณดํธํด ์ค์ฉ ๋ฐฐํฌ์ ๊ฐํฉ๋๋ค.
-
GGUF๋ ๋ฐฐํฌ ํฌ๋งท: GGUF ์์ฒด๊ฐ ์๊ณ ๋ฆฌ์ฆ์ ์๋์ง๋ง, ์์ํ๋ ํ ์์ ๋ฉํ๋ฐ์ดํฐ๋ฅผ ๋จ์ผ ํ์ผ๋ก ๋ฌถ์ด ๋ก์ปฌ ์ถ๋ก ๋ฐฐํฌ๋ฅผ ๋จ์ํํฉ๋๋ค.
-
๋นํธํญ ์ ํ์ ํธ๋ ์ด๋์คํ: FP16 ๋๋น 4๋นํธ๋ ์์ถ๋ฅ ๊ณผ ์ ํ๋์ ๊ท ํ์ด ์ข์ ๊ฐ์ฅ ๋๋ฆฌ ์ฐ์ด๊ณ , 8๋นํธ๋ ์ด์ ์์ ์ฑ์ด ๋์ผ๋ฉฐ, 3๋นํธ ์ดํ๋ ๋ชจ๋ธ๋ณ ๊ฒ์ฆ์ด ํ์์ ๋๋ค.
-
๋ฐฐํฌ ์ฑ๋ฅ์ ํฌ๋งท๋ณด๋ค ์ปค๋์ด ์ข์ฐํฉ๋๋ค: ๊ฐ์ 4๋นํธ๋ผ๋ ์คํ ์ปค๋, ๊ทธ๋ฃน ํฌ๊ธฐ, ํ์ฑ๊ฐ ์ฒ๋ฆฌ, KV cache ์ ์ฑ ์ ๋ฐ๋ผ ์ค์ ์๋์ ํ์ง์ด ๋ฌ๋ผ์ง๋๋ค.
์ต์ข ์ ๋ฐ์ดํธ: 2026-07-02