Ryotta's Basic 203개 문서 · 708개 이미지
반도체 메모리 · 시스템 아키텍처 · LLM 추론 최적화 기술을 분석한 기술 문서 저장소입니다.
카테고리 맵
AI Optimization
Square Tiling 기초
Square Tiling은 행렬 곱셈(Matrix Multiplication) 연산을 효율적으로 수행하기 위한 기본적인 최적화 기법이다. 큰 행렬을 작은 정사각형 타일(Tile)로 분할하여 캐시 메모리와 레지스...
메모리 레이아웃 최적화
메모리 레이아웃 최적화는 텐서 데이터가 메모리에 배치되는 순서를 조정하여 하드웨어의 캐시, SIMD/SIMT 유닛, 텐서 코어 등과 효율적으로 매칭하는 기법이다. 동일한 4차원 텐서도 NHWC, NCHW, NC...
메모리 접근 패턴
메모리 접근 패턴(memory access pattern)은 프로그램이 메모리 주소를 읽고 쓰는 방식을 나타낸다. 접근 패턴은 캐시 성능, SIMD/SIMT 유닛 활용도, 메모리 대역폭 사용량에 직접적인 영향을...
데이터 병렬화
데이터 병렬화(Data Parallelism)는 하나의 모델 복제본을 여러 device 또는 process에 배치하고, 각 worker가 서로 다른 mini-batch를 동시에 처리하는 분산 학습 기법이다. 각...
Register/Shared Memory Tiling
Register/Shared Memory Tiling은 GPU에서 GEMM(Generic Matrix Multiply) 연산을 극한 성능으로 수행하기 위한 메모리 계층 기반 타일링 기법이다. Square Til...
Output/Weight Stationary
Output Stationary과 Weight Stationary는 시스토릭 어레이(Systolic Array)에서 행렬 곱셈(GEMM) 연산 시 데이터를 어떤 하드웨어 요소에 고정시킬 것인지를 결정하는 두 가...
Hierarchical Tiling
Hierarchical Tiling은 GEMM(General Matrix Multiply) 연산에서 메모리 계층 구조에 맞춰 행렬을 여러 단계로 분할하는 기법이다. 단순 Square Tiling이 단일 캐시 레...
뱅크 충돌 방지
뱅크 충돌(Bank Conflict)은 GPU 공유 메모리(Shared Memory)에서 동일한 뱅크에 있는 여러 주소에 대한 동시 접근이 발생할 때 발생하는 성능 병목 현상이다. NVIDIA GPU의 공유 메...
양자화 최적화
양자화(Quantization)는 신경망의 가중치와 활성값을 고정밀도 부동소수점(FP32/FP16) 대신 저비트 정수(INT8, INT4, INT2)로 표현하여 모델 크기를 줄이고 추론 속도를 향상시키는 모델 ...
희소성 최적화
희소성 최적화(Sparsity Optimization)는 신경망의 가중치나 활성값 중 중요하지 않은 값을 제로화하여 모델의 메모리 사용량을 줄이고 연산 속도를 향상시키는 기법이다. 딥러닝 모델의 파라미터 수가 ...
파이프라인 병렬화
파이프라인 병렬화(Pipeline Parallelism, PP)는 순차적인 신경망의 연속된 레이어를 여러 device의 stage로 나누고, 서로 다른 micro-batch가 서로 다른 stage를 동시에 통과...
근사 연산
근사 연산(Approximate Computing)은 모든 계산 결과를 비트 단위로 정확하게 만들기보다, 애플리케이션이 허용하는 품질 손실 범위 안에서 에너지, 지연 시간, 메모리 트래픽을 줄이는 설계 패러다임...
AI Software
AI 소프트웨어 스택 개요
AI 소프트웨어 스택(AI Software Stack)은 머신러닝 모델을 하드웨어 가속기에서 효율적으로 실행하기 위한 계층형 소프트웨어 시스템을 총칭한다. 최상위의 프레임워크(TensorFlow, PyTorch...
CUDA 소프트웨어 스택
CUDA(Compute Unified Device Architecture)는 NVIDIA가 개발한 병렬 컴퓨팅 플랫폼으로, GPU를 범용 계산(GPGPU)에 활용할 수 있는 소프트웨어 스택을 제공합니다. 200...
ExecuTorch Backend 상세
ExecuTorch는 PyTorch가 개발한 온디바이스 AI 추론 프레임워크로, 스마트폰부터 마이크로컨트롤러까지 다양한 엣지 디바이스에서 AI 모델을 효율적으로 실행하기 위한 통합 솔루션이다. Meta의 Ins...
ExecuTorch Compiler 상세
ExecuTorch 컴파일러는 PyTorch 모델을 엣지 디바이스에서 효율적으로 실행할 수 있는 .pte 파일로 변환하는 정적(AOT) 컴파일 시스템이다. 기존 Backend 문서가 백엔드 시스템과 딜리게이트 ...
llama.cpp Backend 상세
llama.cpp는 Andrej Karpathy가 2023년 3월에 시작한 C/C++ 기반 LLM 추론 엔진으로, 현재 GitHub에서 120K 이상의 스타를 보유한 가장 대중적인 로컬 LLM 추론 프레임워크이...
CUDA 상세
CUDA(Compute Unified Device Architecture)는 NVIDIA가 2007년에 도입한 병렬 컴퓨팅 플랫폼이자 프로그래밍 모델로, GPU의 범용 연산 자원을 C/C++ 기반 코드와 전용 ...
ROCm 상세
ROCm(Radeon Open Compute)은 AMD가 2016년에 도입한 오픈소스 GPU 컴퓨팅 플랫폼으로, AMD Instinct 데이터센터 GPU와 Radeon GPU에서 HPC(High Performa...
TPU 소프트웨어 스택
TPU 소프트웨어 스택은 Google이 개발한 TPU 하드웨어를 활용하기 위한 종합적인 소프트웨어 생태계로, JAX를 핵심으로 하는 유연하고 확장 가능한 프로그래밍 모델을 제공한다. 이 스택은 기계 학습 워크로...
TVM 상세
Apache TVM(Tensor Virtual Machine)은 다양한 하드웨어 가속기에서 고성능 머신러닝 실행을 가능하게 하는 오픈소스 딥 러닝 컴파일러 스택이다. 2017년에 소개된 이후 Apache 소프트...
XLA 상세
XLA(Accelerated Linear Algebra)는 Google이 개발한 오픈소스 머신러닝 컴파일러 프레임워크로, TensorFlow 및 JAX 모델을 다양한 하드웨어 가속기에서 효율적으로 실행하기 위해...
AI 컴파일러 기술
AI 컴파일러의 핵심 기술은 그래프 최적화(Graph Optimization), 커널 융합(Kernel Fusion), 자동 튜닝(Auto-Tuning)으로 대별된다. 그래프 최적화는 연산 그래프의 구조적 특성...
ROCm 소프트웨어 스택
ROCm(Radeon Open Compute) 소프트웨어 스택은 AMD Instinct 데이터센터 GPU와 Radeon GPU에서 HPC(High Performance Computing) 및 AI 워크로드를 가...
llama.cpp Compiler 상세
> llama.cpp는 C/C++로 구현된 경량 LLM 추론 엔진으로, 다양한 하드웨어에서 최적화된 추론을 제공합니다.
Accelerator
텐서 코어 아키텍처
텐서 코어(Tensor Core)는 딥 러닝 및 과학 계산에서 행렬 곱셈-누적(Matrix Multiply-Accumulate, MMA) 연산을 가속화하기 위해 설계된 특수 하드웨어 유닛이다. NVIDIA가 2...
AI 가속기 개요
AI 가속기(AI Accelerator)는 인공지능 및 머신러닝 워크로드를 특화된 하드웨어로 가속화하는 프로세서를 총칭한다. 범용 프로세서(CPU)가 von Neumann 구조에서 메모리 병목과 낮은 병렬성에 ...
혼합 정밀도 하드웨어 (Mixed Precision Hardware)
혼합 정밀도 하드웨어는 단일 연산에서 다양한 비트 폭의 부동소수점 형식을 혼합 사용하여 메모리 효율성과 연산 처리량을 극대화하는 기술입니다. FP32, FP16, BF16, FP8, FP4 등 다양한 정밀도 형...
추론 vs 훈련 가속기
AI 모델의 수명 주기는 크게 훈련(Training)과 추론(Inference) 두 단계로 나뉜다. 훈련은 대규모 데이터셋으로 모델 파라미터를 학습하는 과정으로, 막대한 병렬 연산과 메모리 대역폭이 요구된다. ...
엣지 AI 가속기
엣지 AI 가속기(Edge AI Accelerator)는 엔드 디바이스 또는 네트워크 엣지에서 추론(Inference) 워크로드를 가속화하는 전용 하드웨어를 총칭한다. 클라우드 데이터센터에서 실행되는 전통적인 ...
AI 컴파일러 개요
AI 컴파일러(AI Compiler)는 머신러닝 모델을 하드웨어 가속기에서 효율적으로 실행하기 위해 고도로 최적화된 실행 코드를 생성하는 소프트웨어 시스템이다. 전통적인 컴파일러가 소스 코드를 기계어로 변환하는...
TPU 상세
TPU(Tensor Processing Unit)는 Google이 자체 설계한 신경망 학습 전용 ASIC(Application-Specific Integrated Circuit)으로, 2015년부터 Google...
NPU 상세
NPU(Neural Processing Unit)는 모바일, 엣지, 임베디드 기기에서 추론(Inference) 워크로드를 가속화하도록 설계된 전용 프로세서이다. GPU가 범용 병렬 처리 능력으로 AI 훈련/추론...
NVIDIA GPU 상세
NVIDIA 데이터센터 GPU는 AI 훈련과 추론 워크로드를 가속화하는 범용 병렬 프로세서로, Volta 아키텍처부터 지속적으로 세대를 거듭하며 딥 러닝 가속기 시장에서 주도적인 위치를 차지하고 있다. A100...
AMD GPU 상세
AMD Instinct 데이터센터 GPU는 AI 훈련과 추론, HPC 워크로드를 가속화하는 범용 병렬 프로세서로, CDNA(Compute DNA) 아키텍처를 기반으로 개발되었다. MI250X(CDNA2, 202...
커스텀 ASIC 개요
커스텀 ASIC(Application-Specific Integrated Circuit)은 특정 워크로드에 최적화된 맞춤형 반도체 칩으로, GPU 등 범용 가속기 대비 높은 성능 효율과 낮은 지연 시간을 제공한...
희소 연산 하드웨어
희소 연산 하드웨어(Sparsity Hardware)는 딥 러닝 모델의 가중치나 활성값에서 0이 아닌 값만 골라 연산을 수행하는 하드웨어 가속 기술이다. 대규모 언어 모델(LLM)의 파라미터 수가 수백억에서 수...
Arch
CPU 마이크로아키텍처 기초
CPU 마이크로아키텍처(Microarchitecture)는 명령어 세트 아키텍처(ISA)가 실제 프로세서 하드웨어에서 어떻게 구현되는지를 나타내는 컴퓨터 공학의 핵심 분야이다. ISA는 프로그래머나 컴파일러가 ...
분기 예측 (Branch Prediction)
분기 예측(Branch Prediction)은 현대 마이크로아키텍처에서 파이프라인 효율을 극대화하기 위한 핵심 기술이다. 조건 분기 명령어(conditional branch)의 결과가 결정되기 전에 분기의 방향...
Out-of-Order 실행 (Out-of-Order Execution)
Out-of-Order 실행(Out-of-Order Execution, OoO)은 프로세서 아키텍처에서 명령어를 프로그램 순서와 다른 순서로 동적으로 실행하여 성능을 향상시키는 기술이다. 이 기술은 명령어 수준...
슈퍼스칼라/와이드 이슈 (Superscalar/Wide-Issue)
슈퍼스칼라 프로세서(Superscalar Processor)는 단일 프로세서 코어 내에서 명령어 수준 병렬성(Instruction-Level Parallelism, ILP)을 활용하여 클럭당 복수의 명령어를 동...
벡터/SIMD 아키텍처 (Vector/SIMD Architecture)
벡터 처리(Vector Processing)와 SIMD(Single Instruction, Multiple Data)는 하나의 명령어로 여러 데이터 요소를 동시에 연산하는 병렬 처리 기법이다. SIMD 아키텍처...
스레드 멀티플렉싱 (SMT/Hyper-Threading)
동시 멀티스레딩(Simultaneous Multithreading, SMT)은 슈퍼스칼라 CPU의 전반적인 효율성을 개선하기 위한 하드웨어 기술이다. 이 기술은 하나의 물리적 코어에서 여러 개의 독립적인 스레드...
명령어 세트 아키텍처 (ISA)
명령어 세트 아키텍처(Instruction Set Architecture, ISA)는 프로세서가 프로그래머나 컴파일러에게 노출하는 프로그래밍 인터페이스를 정의하는 추상 모델이다. ISA는 소프트웨어와 하드웨어 ...
파이프라인 스톨
파이프라인 스톨(Pipeline Stall) 또는 버블(Bubble)은 명령어 파이프라인에서 다음 명령어가 다음 클럭 주기에 바로 실행될 수 없는 상황을 의미한다. 파이프라인은 여러 명령어가 동시에 처리되도록 ...
인터럽트/예외 처리
인터럽트(Interrupt)와 예외(Exception)는 프로세서가 현재 실행 중인 코드를 중단하고 특수 처리 루틴으로 전환하게 만드는 하드웨어/소프트웨어 메커니즘이다. 인터럽트는 외부 디바이스(키보드, 디스크...
카운터/모니터링 (PMU, Performance Counters, PEBS)
프로세서 모니터링 유닛(PMU)의 핵심 구성인 성능 모니터링 카운터(Performance Monitoring Counters, PMC)는 현대 마이크로프로세서에 내장된 특수 레지스터로, CPU의 다양한 하드웨어...
캐시 일관성 프로토콜 (Cache Coherence Protocol)
캐시 일관성(Cache Coherence)은 다중 프로세서 시스템에서 여러 프로세서의 캐시 메모리에 동일한 메모리 주소에 대한 복사본이 존재할 때, 각 캐시의 데이터가 일관성을 유지하도록 보장하는 메커니즘이다....
메모리 일관성 모델 (Memory Consistency Model)
메모리 일관성 모델(Memory Consistency Model)은 다중 프로세서/스레드 환경에서 메모리 연산의 순서와 가시성을 정의하는 규칙으로, 프로그래머와 하드웨어 간의 계약(contract) 역할을 한다...
메모리 의존성 판별 (Memory Disambiguation)
메모리 의존성 판별(Memory Disambiguation)은 고성능 비순차 실행(out-of-order execution) 마이크로프로세서에서 로드와 스토어를 프로그램 순서와 다르게 실행할 때 사용하는 하드웨...
가상화 하드웨어
하드웨어 가상화(Hardware Virtualization)는 CPU와 메모리 관리 하드웨어에 직접적인 지원을 추가하여, 하나의 물리적 시스템에서 여러 개의 독립된 가상 시스템(VM)을 효율적으로 실행할 수 있...
멀티코어/이기종 아키텍처
멀티코어 아키텍처는 하나의 칩에 여러 개의 처리 코어를 집적하여 병렬 처리 성능을 높는 기술이다. 초기의 동일 코어 구성(SMP, Symmetric Multiprocessing)에서 출발하여, 연산 능력과 전력...
Intel/AMD 마이크로아키텍처 비교
현대 x86 프로세서 시장은 Intel과 AMD 양사가 지배하고 있으며, 각각 독자적인 마이크로아키텍처 진화 경로를 걸어왔다. Intel은 Alder Lake(12세대)부터 하이브리드 아키텍처(P-코어 + E-...
프리페치 기법
프리페치(Prefetching)는 데이터나 명령어가 실제로 필요하기 전에 미리 가져오는 기술로, 메모리 접근 지연 시간을 줄여 프로세서 성능을 향상시킨다. 현대 프로세서에서 메모리 접근 속도는 프로세서 처리 속...
레지스터 리네임 (Register Renaming)
레지스터 리네임(Register Renaming)은 프로세서가 명령어 세트 아키텍처(ISA)에 정의된 제한된 수의 논리적 레지스터(logical registers)를, 내부적으로 훨씬 많은 수의 물리적 레지스터...
Circuit
MOSFET Operation Principles
MOSFET(Metal-Oxide-Semiconductor Field-Effect Transistor)는 현대 디지털 회로의 기반이 되는 전계효과 트랜지스터이다. 1959년 Bell Labs의 Mohamed A...
Digital Logic Gates
디지털 로직 게이트는 불리언 대수(Boolean Algebra) 연산을 수행하는 기본적인 디지털 회로 소자이다. 하나 이상의 이진 입력을 받아 단일 이진 출력을 생성하며, 현대 컴퓨터의 모든 연산과 제어의 기반...
PMOS NMOS CMOS Analysis
MOSFET · n-channel / p-channel · CMOS Inverter · Low Power · Memory Cells
Memory Hierarchy
컴퓨터 시스템에서 프로세서와 저장 장치 사이의 속도 차이(Processor-Memory Gap)는 수십 년간 컴퓨팅 아키텍처의 핵심 과제였다. 레지스터는 수 피코초(ps) 내에 접근 가능하지만, 메인 메모리(D...
Data Representation
디지털 시스템은 모든 정보를 이진수(0과 1)로 표현한다. 데이터 표현 방식은 프로세서 설계, 메모리 시스템, 통신 프로토콜 등 컴퓨터 공학 전반에 걸쳐 가장 근본적인 주제이다. 정수 표현(부호 없는 수, 1의...
RC Timing Analysis
RC Timing Analysis는 디지털 회로에서 신호 전달 지연(propagation delay)을 분석하는 핵심 기법이다. 실제 반도체 칩에서는 이상적인 직선 연결이 존재하지 않으며, 모든 배선(trace...
ADC/DAC 변환 회로
ADC(Analog-to-Digital Converter)와 DAC(Digital-to-Analog Converter)는 아날로그 신호와 디지털 신호를 상호 변환하는 핵심 혼합 신호 회로입니다. ADC는 연속적...
PLL/DLL 클럭 생성
PLL(Phase-Locked Loop)과 DLL(Delay-Locked Loop)은 전자 시스템에서 클럭 신호의 위상과 주파수를 정밀하게 제어하기 위한 피드백 제어 회로입니다. PLL은 출력 신호의 위상이 입...
Op-Amp 연산 증폭기
Op-Amp(Operational Amplifier, 연산 증폭기)는 차동 입력, 단일 출력을 가지며 극도로 높은 이득을 가진 DC 결합 아날로그 증폭기입니다. 원래 아날로그 컴퓨터에서 수학 연산을 수행하기 위...
전력 전자 기초
전력 전자(Power Electronics)는 전기 에너지의 제어와 변환을 위한 전자공학 분야입니다. 전력 반도체 소자를 이용해 DC와 AC 사이의 전력 변환, 전압·전류 조절, 주파수 변환 등을 수행합니다. ...
혼합 신호 인터페이스
혼합 신호 인터페이스는 아날로그 영역과 디지털 영역을 연결하는 통합 인터페이스 기술입니다. 현대 SoC(System-on-Chip)에서는 센서, RF 트랜시버, 오디오 코덱 등 다양한 아날로그 주변장치와 디지털...
클럭 배포
클럭 배포(Clock Distribution)는 단일 클럭 소스에서 칩 내부의 모든 레지스터나 플립플롭에 클럭 신호를 균일하게 전달하는 네트워크를 설계하는 문제입니다. 동기 디지털 회로에서 클럭은 모든 저장 장...
DRAM
Memory Design Philosophy
DDR, LPDDR, GDDR, HBM은 모두 DRAM 계열이지만, 각기 다른 시스템 제약을 해결하도록 최적화되어 있습니다. DDR은 교체 가능성과 용량 확장을, LPDDR은 배터리 효율과 패키지 통합을, GD...
1T1C DRAM Analysis
One-Transistor One-Capacitor DRAM Cell · Array · Read/Write · Sense Amplifier · Refresh
DRAM Subarray x4 Read
Bank · Subarray · Mat · Hierarchical Word/Bit Line · x4 Read · Prefetch
DRAM Refresh Comparison
All-Bank / Per-Bank / Same-Bank / FGR · Self-Refresh / PASR / TCSR · RFM / ARFM / DRFM · ECS / PPR
DRAM 8F 6F 4F Structure
Feature Size · Folded/Open Bit Line · Buried Word Line · Vertical Channel Transistor
DDR Generation Comparison
DDR 세대는 같은 DRAM 셀을 쓰더라도 I/O 인터페이스, prefetch, bank 구조, 전력 관리 방식을 바꿔가며 대역폭과 효율을 끌어올려 왔습니다. DDR1에서 DDR5로 갈수록 내부 코어는 비교적 ...
DIMM Formfactor Comparison
DIMM · SO-DIMM · RDIMM · LRDIMM · CUDIMM · CAMM2 · LPCAMM2 · SOCAMM · SOCAMM2
GDDR Generation Comparison
GDDR는 GPU와 AI 가속기에서 쓰는 고대역폭 그래픽 DRAM입니다. 같은 DRAM 셀을 쓰더라도 I/O signaling, prefetch, 채널 분할, 전원·신뢰성 기능을 계속 바꿔 세대마다 핀당 속도와...
HBM Generation Comparison
HBM(High Bandwidth Memory)은 TSV 기반 3D 적층과 실리콘 인터포저를 이용해 GPU와 AI 가속기 가까이에서 TB/s급 대역폭을 제공하는 DRAM 계열입니다. HBM1과 HBM2는 102...
LPDDR Generation Comparison
LPDDR은 모바일과 저전력 시스템을 위한 DRAM 계열로, 같은 셀 구조를 쓰면서도 더 낮은 전압, 더 세밀한 전력 상태, 더 높은 핀당 전송률을 목표로 세대가 진화해 왔습니다. DDR 계열보다 배터리 효율과...
DDR 내부 구조
DDR(Double Data Rate) SDRAM은 현대 컴퓨터 시스템의 주 메모리로 사용되는 동기식 다이나믹 램입니다. 이 문서에서는 DDR4와 DDR5 세대의 내부 구조를 분석하고, 뱅크(Bank), 랭크(...
GDDR 내부 구조
GDDR(Graphics Double Data Rate)는 GPU와 AI 가속기에서 사용되는 고대역폭 그래픽 DRAM입니다. 같은 DRAM 셀 기술을 기반으로 하되, I/O signaling, prefetch,...
LPDDR 내부 구조
LPDDR(Low Power Double Data Rate) SDRAM은 모바일 기기, 노트북, 태블릿 등에서 사용되는 저전력 고성능 메모리입니다. 이 문서에서는 LPDDR4X, LPDDR5, LPDDR5X 세...
HBM 내부 구조
HBM(High Bandwidth Memory)은 TSV(Through-Silicon Via) 기반 3D 적층과 실리콘 인터포저를 통해 GPU 및 AI 가속기와 근거리에서 TB/s급 대역폭을 제공하는 DRAM ...
DRAM 온도 관리
DRAM은 수십억 개의 커패시터 셀로 구성된 반도체 소자로, 동작 중 발생하는 열이 데이터 무결성과 성능에 직접적인 영향을 미칩니다. 커패시터의 누설 전류는 온도에 지수적으로 비례하여 증가하므로, 고온 환경에서...
DRAM 주소 지정
Bank Address · Row Address · Column Address · Address Multiplexing · Address Mapping
DRAM 타이밍 파라미터
CAS Latency (CL) · Row to Column Delay (tRCD) · Row Precharge Time (tRP) · Row Active Time (tRAS) · Refresh Cycle Tim...
LPDDR6 사양 요약
LPDDR6는 JEDEC JESD209-6으로 2025년 7월 공식 발표된 차세대 저전력 DRAM 표준입니다. 이전 세대인 LPDDR5/5X 대비 대역폭, 전력 효율, 신뢰성에서 크게 향상되었으며, 모바일뿐 아...
DRAM 테스트/신뢰성
DRAM은 수십억 개의 미세한 커패시터 셀로 구성된 반도체 소자로, 제조 공정에서의 미세 결함과 동작 중의 열화 현상으로 인해 다양한 고장이 발생할 수 있습니다. DRAM 테스트/신뢰성 분야는 이러한 고장을 사...
zHBM 분석
zHBM은 삼성전자가 2026년 2월 SEMICON Korea에서 공개한 차세대 HBM 개발 아키텍처입니다. 현재의 HBM은 GPU와 HBM 스택을 실리콘 인터포저 위에 나란히 배치하는 2.5D 패키징이 일반적...
SPHBM 분석
SPHBM은 Standard Package High Bandwidth Memory의 약자로, 실리콘 인터포저가 필요한 기존 HBM 패키징의 비용·면적 제약을 완화하면서 HBM급 대역폭을 제공하기 위한 JEDEC...
HBM3 Spec Summary
HBM3(High Bandwidth Memory 3)는 JEDEC JESD238(2022년 1월)로 공표된 3D 적층 DRAM 인터페이스 표준입니다. HBM2E 대비 데이터 레이트가 2배 향상된 핀당 6.4Gb...
GPU
GPU 메모리 아키텍처 기초
GPU는 대규모 병렬 연산을 수행하는 프로세서로, 수천 개의 연산 코어가 동시에 동작하기 때문에 메모리 대역폭이 핵심 병목입니다. GPU 메모리 아키텍처는 CPU 메모리와 근본적으로 다른 접근 방식을 취하며, ...
CUDA 메모리 관리
CUDA 메모리 관리는 호스트 DRAM과 디바이스 메모리 사이의 데이터 이동, 할당 수명, 주소 가시성을 함께 다루는 계층입니다. GPU 연산 성능이 높아질수록 커널 자체보다 메모리 배치와 전송 방식이 병목이 ...
GPU 메모리 최적화 기법
GPU 성능은 연산 유닛의 수만큼이나 메모리 접근 방식에 크게 좌우됩니다. 같은 커널이라도 글로벌 메모리 접근이 흩어져 있거나, 같은 데이터를 여러 번 다시 읽거나, 호스트와 디바이스 사이의 이동이 잦으면 처리...
GPU 메모리 코일레싱 (Memory Coalescing)
GPU의 병렬 연산 성능은 메모리 서브시스템의 효율성에 크게 좌우됩니다. Memory Coalescing은 워프(warp) 내 32개 스레드가 각각 요청하는 글로벌 메모리 접근을 하드웨어가 자동으로 합쳐 최소한...
멀티 GPU 통신
멀티 GPU 통신은 대규모 AI 학습과 추론에서 여러 GPU가 효율적으로 데이터를 주고받을 수 있도록 하는 고속 인터커넥트 기술입니다. 단일 GPU의 메모리와 연산 능력이 한계에 봉착하면서, 트랜스포머 모델의 ...
칩렛 GPU
칩렛 GPU는 단일 다이(monolithic die)에 모든 기능을 집적하는 대신, 연산·메모리·I/O 같은 기능을 독립적인 칩렛(chiplet)으로 분리하고 패키지 내에서 결합하는 GPU 설계 방식입니다. 기...
GPU Heterogeneous Memory Papers
GPU의 온보드 HBM 용량은 수십 GB 수준에 머물러 대규모 DNN과 LLM 학습·추론에서 바로 병목이 됩니다. 이 제약을 줄이기 위해 GPU 이기종 메모리 연구는 UVM 기반 페이지 관리에서 시작해, 레이어...
LLM
LLM Basics
Tokenization · Transformer · Next-token Prediction · Training/Post-training · Inference · KV Cache · Serving
Memory Centric LLM Serving Survey
Memory-Centric LLM Serving: KV 압축·캐싱·오프로딩·P/D 분리·PIM/PNM·신뢰성 (최근 연구 종합)
Architecture Venues LLM Memory Papers
ISCA · MICRO · HPCA · ASPLOS · DAC · PACT · DATE — KV 캐시·PIM/PNM·CXL·in-storage·양자화·서빙·신뢰성
MoE Serving Routing LoadBalance
Expert Routing · All-to-All Dispatch · Capacity Factor · Expert Parallelism · Hot Expert Replication
MoE Analysis
Sparse Activation · Routing/Gating · Load Balancing · DeepSeekMoE · Expert Parallelism/Offloading
PagedAttention Analysis
vLLM · KV Cache Paging · Block Table · Copy-on-Write · Continuous Batching · KV Offloading
FlashAttention Analysis
IO-aware Exact Attention · Tiling · Online Softmax · Recomputation · FA-2/FA-3 · Flash-Decoding
MLA Analysis
Low-Rank KV Joint Compression · Decoupled RoPE · Weight Absorption · DeepSeek-V2/V3
MTP Analysis
Multi-Token Prediction · 병렬 head / 순차 module · Self-Speculative Decoding · DeepSeek-V3
RAG Analysis
Retrieval · Augmentation · Generation · Embedding/Vector DB · Hybrid Search · Reranking · GraphRAG
KV Cache Quantization Analysis
KV Cache Quantization · Per-channel Key / Per-token Value · KIVI · KVQuant · FP8/INT8 · Mixed Precision
KV Cache Offloading Analysis
Memory Hierarchy · Prefix Reuse · PD Disaggregation · LMCache · Mooncake · CacheGen · CXL-PNM
Prefix Caching Analysis
공통 프리픽스 KV 재사용 · 블록·해시 매칭 · RadixAttention vs APC · 프로바이더 Prompt Caching · 멀티턴·RAG
Semantic Caching Analysis
의미 기반 응답 재사용 · 임베딩 유사도 · 임계값 트레이드오프 · GPTCache · 다층 캐시 · 프리픽스 캐싱과의 대비
StreamingLLM Analysis
무한 스트리밍 · Attention Sink · Sink + Window · Rolling Cache · KV 축출(H2O) · '문맥 확장이 아님'
Sliding Window Attention Analysis
국소 어텐션 아키텍처 · Receptive Field · Rolling Buffer Cache · Longformer·Mistral·Gemma · SWA vs StreamingLLM
Continuous Batching Analysis
Dynamic Scheduler · Decode Slot Refill · Chunked Prefill · PagedAttention · Fairness vs Throughput
Speculative Decoding Analysis
Draft Model · Verification · Acceptance Rate · Medusa/EAGLE · Throughput vs TTFT
Disaggregated LLM Serving Analysis
Prefill-Decode Disaggregation · KV Transfer · Network Fabric · Remote Cache · Elastic Pooling
LLM Inference Scheduler Analysis
Admission Control · Batching Policy · SLO Aware Queueing · Fairness · Token Budgeting
KV Cache 압축
> KV Cache Compression · Quantization · Token Eviction · Rank Compression · Mixed Precision · Adaptive Strategies
활성값 압축
> Activation Compression · SmoothQuant · AWQ · LLM.int8() · Weight-Activation Quantization · Outlier Handling
MQA (Multi-Query Attention) 분석
Multi-Query Attention(MQA)은 여러 Query head가 하나의 Key head와 Value head를 공유하는 Attention 변형입니다. Query head는 그대로 유지하므로 여러 표...
GQA (Grouped-Query Attention) 분석
Grouped-Query Attention(GQA)은 Query head는 여러 개 유지하면서 Key/Value head만 줄이고, 여러 Query head가 하나의 KV head를 공유하는 Attention ...
Linux
Linux 메모리 관리 기초
Linux 메모리 관리는 프로세스마다 독립된 가상 주소 공간을 제공하고, 그 뒤에서 실제 물리 메모리와 파일을 연결하는 핵심 서브시스템입니다. mmap()으로 만든 매핑, malloc()이 쓰는 힙, 스택, 파...
Linux Memory Tiering Deep
Linux 메모리 티어링은 DRAM, HBM, CXL/PMem 같은 서로 다른 메모리 계층을 하나의 정책 아래에서 다루는 기법입니다. 핵심은 hot 페이지를 더 빠른 티어로 올리고, cold 페이지를 더 느린 ...
Linux 메모리 최적화
Linux에서 메모리 최적화는 단순히 더 많은 메모리를 쓰는 문제가 아니라, 같은 데이터는 덜 쓰고, 자주 접근하는 데이터는 더 큰 단위로 다루고, 한동안 쓰이지 않는 데이터는 압축해서 보관하는 문제입니다. T...
하드웨어 메모리 압축
하드웨어 메모리 압축은 RAM의 물리적 용량을 소프트웨어 압축 알고리즘 대비 훨씬 낮은 지연시간으로 확장하는 기술입니다. DRAM 가격이 비싼 서버 환경이나 메모리 제약이 큰 엣지/임베디드 장치에서 효과적이며,...
소프트웨어 메모리 압축
소프트웨어 메모리 압축은 운영체제 커널 수준에서 메모리 페이지를 압축하여 물리적 RAM 용량을 가상으로 확장하는 기술입니다. 하드웨어 압축 엔진 없이 CPU의 일반적인 연산 자원만으로 압축/해제를 수행하며, z...
중복 제거
메모리 중복 제거(deduplication)는 동일한 내용을 가진 메모리 페이지들을 하나의 공유 페이지로 병합하여 물리적 RAM 사용량을 줄이는 Linux 커널 기술입니다. 대표적인 구현인 KSM(Kernel ...
투명 거대 페이지
투명 거대 페이지(Transparent Huge Pages, THP)는 Linux 커널이 기본 페이지(4KB)보다 큰 페이지(2MB, 1GB 등)를 자동으로 할당하여 TLB(Translation Lookasid...
스왑/zRAM
스왑은 물리적 RAM 용량이 부족할 때, 사용하지 않는 메모리 페이지를 디스크에 임시로 저장하여 시스템이 더 많은 메모리를 가진 것처럼 동작하게 하는 가상 메모리 기법입니다. 전통적인 스왑은 디스크 I/O를 동...
OOM 관리
Linux에서 Out Of Memory(OOM) 관리는 시스템 물리 메모리와 스왑이 모두 소진되었을 때 프로세스를 종료하여 시스템을 복구하는 메커니즘입니다. 커널은 oom-killer를 통해 가장 적합한 프로세...
Linux 메모리 컴팩션
Linux 메모리 컴팩션(Memory Compaction)은 시스템 가동 중 물리 메모리 파편화(fragmentation)를 해결하여 연속된 큰 메모리 영역을 확보하는 메커니즘입니다. THP(Transparen...
KSM (Kernel Samepage Merging)
KSM(Kernel Samepage Merging)은 Linux 커널 2.6.32부터 도입된 메모리 중복 제거(deduplication) 기술입니다. KVM 가상화 환경에서 유사한 게스트 OS 이미지 간의 메모...
CXL 메모리 할당, hotplug, tiering
CXL 메모리는 단순한 장치 메모리가 아니라, Linux가 부팅 시점부터 runtime hotplug까지 이어서 다루는 메모리 자원입니다. 펌웨어가 제공하는 ACPI 정보로 NUMA 노드와 접근 성능을 읽고, ...
cgroup 메모리
cgroup 메모리 컨트롤러는 Linux 커널에서 프로세스 그룹별로 메모리 사용량을 측정하고 제한하는 리소스 관리 메커니즘입니다. 컨테이너, VM, 분리된 워크로드 간에 메모리를 격리하고 할당하여, 특정 애플리...
서버리스 Linux 최적화
서버리스 컴퓨팅 환경에서 Linux는 컨테이너 또는 마이크로VM 기반으로 실행되며, Cold Start 성능과 리소스 효율이 핵심 지표입니다. 서버리스 Linux 최적화는 부팅 시간 단축, 메모리 사용량 절감,...
NAND
NMOS FloatingGate ChargeTrap
Flash Cell = Programmable-Vth NMOS · FN Tunneling · Program / Erase / Read
NAND NVMe SSD Analysis
NAND Flash Memory · SSD Controller · FTL · NVMe Protocol · OS I/O Stack
NAND Flash Internals
NAND Flash Cell · String/Array · Vth Distribution · 3D V-NAND · Program/Erase Physics
FTL WearLeveling GarbageCollection
Logical-to-Physical Mapping · Out-of-Place Update · WAF · Over-Provisioning · TRIM
SSD Internal Parallelism Channel Die Plane
Channel · Package · Die(LUN) · Plane · Superpage/Stripe · Queue Depth
NAND 에러 관리
ECC · Bad Block Management · Read Disturb · Data Retention · Read Retry · 에러 유형별 대응 전략
ZNS OpenChannelSSD Analysis
Host-Managed Flash · Zone Write Pointer · Zone Append · FTL Offload · Log-Structured Software
NVMe 2.0 분석
모듈화된 Command Set · Endurance Group · I/O Determinism · ZNS/KV Command Set · SR-IOV 가상화
NVM
NVM Interface Analysis
NVMe · CXL.mem · HBM-PIM · Storage Class Memory · Compute Express Link · Processing-In-Memory
ReRAM Analysis
Resistive RAM · MIM Cell · Filament · Set/Reset · Cross-point · In-Memory Computing
Persistent Memory (영구 메모리)
Persistent Memory(PMEM, 영구 메모리)는 DRAM의 빠른 바이트 주소 접근성과 NAND Flash의 비휘발성을 결합한 차세대 메모리 기술입니다. 전통적인 메모리 계층에서 DRAM은 빠르지만 휘...
Protocol
CXL Version Comparison
CXL(Compute Express Link)은 CPU와 가속기, 메모리 디바이스 사이를 잇는 오픈 인터커넥트 표준이다. PCIe 물리 계층 위에서 CXL.io, CXL.cache, CXL.mem을 함께 사용하...
PCIe Gen5/Gen6
PCIe(Peripheral Component Interconnect Express)는 CPU와 주변장치, 가속기, 저장소 디바이스를 연결하는 고속 직렬 인터커넥트 표준이다. PCIe 5.0은 32 GT/s, ...
AMBA/AXI 프로토콜
AMBA(Advanced Microcontroller Bus Architecture)는 Arm이 1996년에 도입한 SoC(System-on-a-Chip) 내부 인터커넥트 표준이다. CPU, GPU, 메모리 컨...
UCIe Chiplet Interconnect
UCIe(Universal Chiplet Interconnect Express)는 다양한 칩렛 간의 고속 통신을 위한 오픈 표준 인터커넥트이다. Intel, AMD, Arm, TSMC, Samsung, Qual...
CXL 메모리 풀링
CXL(Compute Express Link) 메모리 풀링은 CXL 2.0에서 도입된 핵심 기능으로, 여러 호스트 CPU가 물리적으로 분리된 메모리 리소스를 공유할 수 있게 해주는 기술이다. 기존 DIMM 기반...
CXL 기반 시스템
CXL(Compute Express Link) 기반 시스템은 CPU, 메모리, 가속기를 CXL 프로토콜로 연결하는 차세대 컴퓨팅 아키텍처다. 기존 PCIe 기반 시스템이 I/O 중심이었던 것과 달리, CXL은 ...
SRAM
6T SRAM Analysis
Six-Transistor SRAM Cell · Cross-Coupled Inverters · Read/Write · Stability Trade-off · Cache
SRAM vs DRAM Comparison
SRAM과 DRAM은 둘 다 전원이 꺼지면 데이터가 사라지는 휘발성 메모리이지만, 비트를 저장하는 방식이 완전히 다릅니다. SRAM은 cross-coupled inverter latch가 값을 유지하는 구조라 ...
SRAM 셀 변형 분석
SRAM은 6T 셀을 기본으로 하지만, 공정 축소와 저전압 동작이 겹치면 read disturb, 누설 전류, soft error가 더 도드라집니다. 그래서 셀 자체를 바꾸거나 배열 운용 방식을 바꿔 읽기 안정...
SRAM 리텍션 수율
SRAM 리텍션 수율은 정해진 전압, 온도, 대기 시간에서 데이터를 끝까지 유지한 셀의 비율을 뜻합니다. 같은 6T SRAM이라도 공정 편차, 누설 경로, 약한 PMOS, 비트라인 커플링에 따라 일부 셀만 먼저...
저전력 SRAM
SRAM은 CPU 캐시, 임베디드 시스템, IoT 디바이스 등에서 널리 사용되지만, 미세 공정으로 갈수록 누설 전류(leakage current)와 동적 전력(dynamic power)이 주요 문제로 부상합니다...
임베디드 SRAM
임베디드 SRAM(Embedded SRAM, eSRAM)은 별도 칩이 아니라 SoC(System on Chip) 내부에 직접 집적되는 SRAM입니다. CPU 캐시, 버퍼, DMA 엔진, 무선 기지국의 버퍼 등 ...
Security
Rowhammer 공격과 방어
Rowhammer는 현대 DRAM(Dynamic Random-Access Memory)의 물리적 특성을 악용한 하드웨어 보안 취약점이다. DRAM 셀이 미세 공정으로 고밀도 집적되면서 인접 셀 간 전기적 간섭이...
메모리 암호화
메모리 암호화(Memory Encryption)는 메모리에 저장된 데이터를 물리적 또는 논리적 접근으로부터 보호하기 위해 암호화 알고리즘을 적용하는 기술이다. DRAM에 저장되는 데이터는 CPU 외부의 물리적 ...
SGX/TEE 보안 기술
Trusted Execution Environment(TEE)는 메인 프로세서 내에서 코드와 데이터를 격리하여 보호하는 하드웨어 기반 보안 기술이다. TEE는 외부 소프트웨어(운영체제, 하이퍼바이저, 악성 코드...
Spectre/Meltdown 상세
Spectre(스펙터)와 Meltdown(멜트다운)은 2018년 1월 공개된 현대 프로세서의 추론 실행(Speculative Execution)과 캐시 사이드 채널을 악용한 하드웨어 보안 취약점이다. 두 취약점...
사이드 채널 공격
사이드 채널 공격(Side-Channel Attack)은 컴퓨터 시스템의 물리적 구현에서 의도치 않게 새어나가는 정보를 악용하여 민감한 데이터를 추출하는 보안 공격 기법이다. 암호화 알고리즘 자체의 수학적 취약...
Rowhammer 방어 기술
Rowhammer 공격이 2014년 처음 보고된 이후 DRAM 메모리 보안은 지속적인 연구와 표준화 작업이 이루어져 왔다. 초기 DDR3 시대의 간단한 리프레시 주기 단축에서 시작하여, 현대 DDR4/DDR5 ...
Spectre v2 상세
Spectre v2 (CVE-2017-5715, Branch Target Injection)는 현대 프로세서의 간접 분기 예측기(Indirect Branch Predictor)와 분기 대상 버퍼(BTB, Bra...
Storage
파일 시스템 개요
파일 시스템은 운영체제가 저장 장치의 데이터를 구조화하여 관리하는 메커니즘이다. 디스크 블록 할당, 메타데이터 관리, 디렉토리 구조, 무결성 보장 등 스토리지 계층의 핵심 기능을 담당하며, 선택에 따라 시스템의...
RAID 기술
RAID(Redundant Array of Independent Disks)는 여러 개의 물리적 디스크를 하나의 논리적 볼륨으로 묶어 성능 향상, 데이터 중복, 또는 두 가지를 동시에 달성하는 스토리지 가상화 ...
ext4 상세
ext4는 리눅스 커널 2.6.28(2008년)에서 첫 도입된 확장 파일 시스템의 네 번째 버전으로, 기존 ext3에서 디스크 포맷과 데이터 구조를 대폭 개선한 범용 파일 시스템이다. Extent 기반 할당, ...
Btrfs 상세
Btrfs(B-tree File System)는 Copy-on-Write(CoW) 원리를 기반으로 한 현대적인 파일 시스템으로, 2007년 Oracle의 Chris Mason에 의해 개발이 시작되어 2009년 ...
네트워크 스토리지
네트워크 스토리지는 컴퓨터 네트워크를 통해 여러 클라이언트에서 데이터 저장소에 접근할 수 있도록 하는 기술이다. 직접 연결 스토리지(DAS), 네트워크 연결 스토리지(NAS), 스토리지 에어리어 네트워크(SAN...
I/O 스케줄러
I/O 스케줄러는 블록 레이어에서 I/O 요청의 순서와 전달을 관리하여 디스크 성능과 지연시간을 최적화하는 커널 컴포넌트이다. 과거에는 단일 큐 기반의 CFQ(Complete Fair Queueing)가 주류였...
ZFS/Btrfs 고급 기능
ZFS(Zettabyte File System)와 Btrfs(B-tree File System)는 현대적인 Copy-on-Write(CoW) 파일 시스템으로, 기존 파일 시스템의 한계를 극복하기 위해 다양한 고...
System
CPU Cache Architecture
CPU Cache Architecture는 프로세서와 메인 메모리(DRAM) 사이의 속도 격차를 해소하기 위한 핵심 하드웨어 메커니즘이다. 현대 CPU는 수 GHz 클럭으로 동작하는 반면 DRAM은 수백 사이클...
Virtual Memory
Virtual Memory는 각 프로세스에 독립된 가상 주소 공간(Virtual Address Space)을 제공하여, 물리 메모리의 제약으로부터 프로세스를 격리하는 메모리 관리 기법이다. 이를 통해 여러 프로...
Memory Controller
Memory Controller는 CPU와 메인 메모리(DRAM) 사이에서 데이터 흐름을 관리하는 핵심 디지털 회로이다. DRAM은 주기적인 리프레시가 필요하고, 복잡한 타이밍 제약(tRCD, tCAS, tRP...
ECC Error Correction
ECC(Error Correction Code)는 컴퓨터 메모리 시스템에서 데이터 무결성을 보장하기 위해 사용되는 오류 정정 기술이다. DRAM 셀에 저장된 비트가 우주선 입자(cosmic ray), 알파 입자...
NVMe Architecture
NVMe(Non-Volatile Memory Express)는 PCIe를 중심으로, 확장 시에는 RDMA나 TCP 같은 fabric transport 위에서도 사용할 수 있도록 정의된 고성능 비휘발성 스토리지 ...
Power Management
Power Management는 컴퓨팅 시스템에서 에너지 소비를 최적화하기 위한 기술적 전략의 총칭이다. 특히 메모리 서브시스템은 전체 시스템 전력의 30~40%를 차지할 수 있어, 효과적인 전력 관리가 필수적...
디버깅/프로파일링
디버깅/프로파일링은 소프트웨어 개발 과정에서 프로그램의 동작을 분석하고 문제를 해결하는 핵심 기법이다. 디버깅은 프로그램의 논리적 오류(bug)를 찾아 수정하는 과정이고, 프로파일링은 프로그램의 성능 병목과 리...
서버리스 컨테이너 (Serverless Container)
서버리스 컨테이너는 컨테이너 기반 애플리케이션을 서버 인프라 관리 없이 실행할 수 있는 클라우드 컴퓨팅 모델입니다. 기존 FaaS(Function as a Service)가 함수 단위 실행에 머무르는 반면, 서...
서버리스 스토리지 (Serverless Storage)
서버리스 스토리지는 클라우드 제공자가 인프라 관리, 확장, 백업을 처리하는 저장 서비스입니다. 서버리스 컴퓨팅 환경에서는 Lambda 함수나 컨테이너가 시작과 동시에 스토리지에 접근해야 하므로, 적절한 저장소 ...
임시 스토리지 관리 (Ephemeral Storage Management)
임시 스토리지(Ephemeral Storage)는 프로세스나 컨테이너의 수명과 동일하게 존재하다가 종료 시 자동으로 삭제되는 저장소를 말합니다. Linux에서는 주로 /tmp, /dev/shm, tmpfs로 마...
NUMA 아키텍처
NUMA(Non-Uniform Memory Access)는 멀티 프로세서 시스템에서 메모리 접근 시간이 프로세서와 메모리의 물리적 상대 위치에 따라 달라지는 메모리 아키텍처이다. 각 프로세서(또는 프로세서 그룹...
메모리 인터커넥트
메모리 인터커넥트는 CPU, GPU, 메모리 컨트롤러, I/O 디바이스 등 SoC(System on Chip) 내부 또는 칩 간 데이터를 전달하는 통신 경로를 말한다. 인터커넥트의 성능은 시스템 전체 대역폭과 ...
PIM/NMP 아키텍처 개요
PIM(Processing-In-Memory)은 메모리 칩 내부에 연산 요소를 통합하여 CPU와 메모리 간 데이터 이동으로 인한 병목을 줄이는 컴퓨터 아키텍처이다. 전통적인 von Neumann 구조에서는 CP...
PIM 응용
PIM(Processing-In-Memory)은 메모리 내부에 연산 유닛을 통합하여 데이터 이동 병목을 해결하는 아키텍처이다. 실제 상용 제품과 연구 플랫폼이 등장하면서 DNN 추론/학습, 그래프 처리, 유전체...
NMP 아키텍처
NMP(Near-Memory Processing)는 메모리 컨트롤러 근처 또는 3D 적층 메모리의 로직 레이어에 연산 유닛을 배치하여 데이터 이동 병목을 완화하는 컴퓨팅 아키텍처이다. PIM(Processing...
캐시 일관성 MESI/MOESI
캐시 일관성(Cache Coherence)은 멀티코어/멀티프로세서 시스템에서 각 코어의 로컬 캐시에 저장된 공유 데이터의 일관성을 유지하는 메커니즘이다. 하나의 메모리 위치에 대한 여러 캐시 복사본이 존재할 때...
메모리 디스애그리게이션 고도화
메모리 디스애그리게이션은 서버의 CPU와 메모리를 논리적으로 분리하여, 메모리를 중앙 풀(pool)로 통합하고 필요에 따라 동적으로 할당하는 기술이다. 전통적인 서버 아키텍처에서 CPU는 로컬 DIMM 슬롯에 ...
서버리스 시스템 (Serverless System)
서버리스 컴퓨팅은 클라우드 제공자가 하드웨어 및 소프트웨어 리소스의 프로비저닝, 배포, 관리를 고객이 수행하지 않도록 하는 클라우드 서비스 카테고리입니다. ISO/IEC 22123-2에 따르면, 서버리스 컴퓨팅...
서버리스 메모리 (Serverless Memory)
서버리스 컴퓨팅 환경에서 메모리 관리는 기존 인프라와 근본적으로 다른 특성을 가집니다. 전통적인 서버 환경에서는 OS 수준에서 메모리를 직접 관리하지만, 서버리스 환경에서는 클라우드 제공자가 함수별 메모리 할당...
콜드 스타트 최적화 (Cold Start Optimization)
서버리스 컴퓨팅에서 콜드 스타트는 함수가 처음 호출되거나 비활성 상태에서 재사용될 때 실행 환경을 처음부터 구성하는 과정입니다. 이 과정에는 런타임 로드, 의존성 초기화, 네트워크 설정 등 여러 단계가 포함되며...