Ryotta's Basic 203개 문서 · 708개 이미지

반도체 메모리 · 시스템 아키텍처 · LLM 추론 최적화 기술을 분석한 기술 문서 저장소입니다.

AI Optimization

⚡ AI Optimization

Square Tiling 기초

Square Tiling은 행렬 곱셈(Matrix Multiplication) 연산을 효율적으로 수행하기 위한 기본적인 최적화 기법이다. 큰 행렬을 작은 정사각형 타일(Tile)로 분할하여 캐시 메모리와 레지스...

⚡ AI Optimization

메모리 레이아웃 최적화

메모리 레이아웃 최적화는 텐서 데이터가 메모리에 배치되는 순서를 조정하여 하드웨어의 캐시, SIMD/SIMT 유닛, 텐서 코어 등과 효율적으로 매칭하는 기법이다. 동일한 4차원 텐서도 NHWC, NCHW, NC...

⚡ AI Optimization

메모리 접근 패턴

메모리 접근 패턴(memory access pattern)은 프로그램이 메모리 주소를 읽고 쓰는 방식을 나타낸다. 접근 패턴은 캐시 성능, SIMD/SIMT 유닛 활용도, 메모리 대역폭 사용량에 직접적인 영향을...

⚡ AI Optimization

데이터 병렬화

데이터 병렬화(Data Parallelism)는 하나의 모델 복제본을 여러 device 또는 process에 배치하고, 각 worker가 서로 다른 mini-batch를 동시에 처리하는 분산 학습 기법이다. 각...

⚡ AI Optimization

Register/Shared Memory Tiling

Register/Shared Memory Tiling은 GPU에서 GEMM(Generic Matrix Multiply) 연산을 극한 성능으로 수행하기 위한 메모리 계층 기반 타일링 기법이다. Square Til...

⚡ AI Optimization

Output/Weight Stationary

Output Stationary과 Weight Stationary는 시스토릭 어레이(Systolic Array)에서 행렬 곱셈(GEMM) 연산 시 데이터를 어떤 하드웨어 요소에 고정시킬 것인지를 결정하는 두 가...

⚡ AI Optimization

Hierarchical Tiling

Hierarchical Tiling은 GEMM(General Matrix Multiply) 연산에서 메모리 계층 구조에 맞춰 행렬을 여러 단계로 분할하는 기법이다. 단순 Square Tiling이 단일 캐시 레...

⚡ AI Optimization

뱅크 충돌 방지

뱅크 충돌(Bank Conflict)은 GPU 공유 메모리(Shared Memory)에서 동일한 뱅크에 있는 여러 주소에 대한 동시 접근이 발생할 때 발생하는 성능 병목 현상이다. NVIDIA GPU의 공유 메...

⚡ AI Optimization

양자화 최적화

양자화(Quantization)는 신경망의 가중치와 활성값을 고정밀도 부동소수점(FP32/FP16) 대신 저비트 정수(INT8, INT4, INT2)로 표현하여 모델 크기를 줄이고 추론 속도를 향상시키는 모델 ...

⚡ AI Optimization

희소성 최적화

희소성 최적화(Sparsity Optimization)는 신경망의 가중치나 활성값 중 중요하지 않은 값을 제로화하여 모델의 메모리 사용량을 줄이고 연산 속도를 향상시키는 기법이다. 딥러닝 모델의 파라미터 수가 ...

⚡ AI Optimization

파이프라인 병렬화

파이프라인 병렬화(Pipeline Parallelism, PP)는 순차적인 신경망의 연속된 레이어를 여러 device의 stage로 나누고, 서로 다른 micro-batch가 서로 다른 stage를 동시에 통과...

⚡ AI Optimization

근사 연산

근사 연산(Approximate Computing)은 모든 계산 결과를 비트 단위로 정확하게 만들기보다, 애플리케이션이 허용하는 품질 손실 범위 안에서 에너지, 지연 시간, 메모리 트래픽을 줄이는 설계 패러다임...

AI Software

💻 AI Software

AI 소프트웨어 스택 개요

AI 소프트웨어 스택(AI Software Stack)은 머신러닝 모델을 하드웨어 가속기에서 효율적으로 실행하기 위한 계층형 소프트웨어 시스템을 총칭한다. 최상위의 프레임워크(TensorFlow, PyTorch...

💻 AI Software

CUDA 소프트웨어 스택

CUDA(Compute Unified Device Architecture)는 NVIDIA가 개발한 병렬 컴퓨팅 플랫폼으로, GPU를 범용 계산(GPGPU)에 활용할 수 있는 소프트웨어 스택을 제공합니다. 200...

💻 AI Software

ExecuTorch Backend 상세

ExecuTorch는 PyTorch가 개발한 온디바이스 AI 추론 프레임워크로, 스마트폰부터 마이크로컨트롤러까지 다양한 엣지 디바이스에서 AI 모델을 효율적으로 실행하기 위한 통합 솔루션이다. Meta의 Ins...

💻 AI Software

ExecuTorch Compiler 상세

ExecuTorch 컴파일러는 PyTorch 모델을 엣지 디바이스에서 효율적으로 실행할 수 있는 .pte 파일로 변환하는 정적(AOT) 컴파일 시스템이다. 기존 Backend 문서가 백엔드 시스템과 딜리게이트 ...

💻 AI Software

llama.cpp Backend 상세

llama.cpp는 Andrej Karpathy가 2023년 3월에 시작한 C/C++ 기반 LLM 추론 엔진으로, 현재 GitHub에서 120K 이상의 스타를 보유한 가장 대중적인 로컬 LLM 추론 프레임워크이...

💻 AI Software

CUDA 상세

CUDA(Compute Unified Device Architecture)는 NVIDIA가 2007년에 도입한 병렬 컴퓨팅 플랫폼이자 프로그래밍 모델로, GPU의 범용 연산 자원을 C/C++ 기반 코드와 전용 ...

💻 AI Software

ROCm 상세

ROCm(Radeon Open Compute)은 AMD가 2016년에 도입한 오픈소스 GPU 컴퓨팅 플랫폼으로, AMD Instinct 데이터센터 GPU와 Radeon GPU에서 HPC(High Performa...

💻 AI Software

TPU 소프트웨어 스택

TPU 소프트웨어 스택은 Google이 개발한 TPU 하드웨어를 활용하기 위한 종합적인 소프트웨어 생태계로, JAX를 핵심으로 하는 유연하고 확장 가능한 프로그래밍 모델을 제공한다. 이 스택은 기계 학습 워크로...

💻 AI Software

TVM 상세

Apache TVM(Tensor Virtual Machine)은 다양한 하드웨어 가속기에서 고성능 머신러닝 실행을 가능하게 하는 오픈소스 딥 러닝 컴파일러 스택이다. 2017년에 소개된 이후 Apache 소프트...

💻 AI Software

XLA 상세

XLA(Accelerated Linear Algebra)는 Google이 개발한 오픈소스 머신러닝 컴파일러 프레임워크로, TensorFlow 및 JAX 모델을 다양한 하드웨어 가속기에서 효율적으로 실행하기 위해...

💻 AI Software

AI 컴파일러 기술

AI 컴파일러의 핵심 기술은 그래프 최적화(Graph Optimization), 커널 융합(Kernel Fusion), 자동 튜닝(Auto-Tuning)으로 대별된다. 그래프 최적화는 연산 그래프의 구조적 특성...

💻 AI Software

ROCm 소프트웨어 스택

ROCm(Radeon Open Compute) 소프트웨어 스택은 AMD Instinct 데이터센터 GPU와 Radeon GPU에서 HPC(High Performance Computing) 및 AI 워크로드를 가...

💻 AI Software

llama.cpp Compiler 상세

> llama.cpp는 C/C++로 구현된 경량 LLM 추론 엔진으로, 다양한 하드웨어에서 최적화된 추론을 제공합니다.

Accelerator

🧠 Accelerator

텐서 코어 아키텍처

텐서 코어(Tensor Core)는 딥 러닝 및 과학 계산에서 행렬 곱셈-누적(Matrix Multiply-Accumulate, MMA) 연산을 가속화하기 위해 설계된 특수 하드웨어 유닛이다. NVIDIA가 2...

🧠 Accelerator

AI 가속기 개요

AI 가속기(AI Accelerator)는 인공지능 및 머신러닝 워크로드를 특화된 하드웨어로 가속화하는 프로세서를 총칭한다. 범용 프로세서(CPU)가 von Neumann 구조에서 메모리 병목과 낮은 병렬성에 ...

🧠 Accelerator

혼합 정밀도 하드웨어 (Mixed Precision Hardware)

혼합 정밀도 하드웨어는 단일 연산에서 다양한 비트 폭의 부동소수점 형식을 혼합 사용하여 메모리 효율성과 연산 처리량을 극대화하는 기술입니다. FP32, FP16, BF16, FP8, FP4 등 다양한 정밀도 형...

🧠 Accelerator

추론 vs 훈련 가속기

AI 모델의 수명 주기는 크게 훈련(Training)과 추론(Inference) 두 단계로 나뉜다. 훈련은 대규모 데이터셋으로 모델 파라미터를 학습하는 과정으로, 막대한 병렬 연산과 메모리 대역폭이 요구된다. ...

🧠 Accelerator

엣지 AI 가속기

엣지 AI 가속기(Edge AI Accelerator)는 엔드 디바이스 또는 네트워크 엣지에서 추론(Inference) 워크로드를 가속화하는 전용 하드웨어를 총칭한다. 클라우드 데이터센터에서 실행되는 전통적인 ...

🧠 Accelerator

AI 컴파일러 개요

AI 컴파일러(AI Compiler)는 머신러닝 모델을 하드웨어 가속기에서 효율적으로 실행하기 위해 고도로 최적화된 실행 코드를 생성하는 소프트웨어 시스템이다. 전통적인 컴파일러가 소스 코드를 기계어로 변환하는...

🧠 Accelerator

TPU 상세

TPU(Tensor Processing Unit)는 Google이 자체 설계한 신경망 학습 전용 ASIC(Application-Specific Integrated Circuit)으로, 2015년부터 Google...

🧠 Accelerator

NPU 상세

NPU(Neural Processing Unit)는 모바일, 엣지, 임베디드 기기에서 추론(Inference) 워크로드를 가속화하도록 설계된 전용 프로세서이다. GPU가 범용 병렬 처리 능력으로 AI 훈련/추론...

🧠 Accelerator

NVIDIA GPU 상세

NVIDIA 데이터센터 GPU는 AI 훈련과 추론 워크로드를 가속화하는 범용 병렬 프로세서로, Volta 아키텍처부터 지속적으로 세대를 거듭하며 딥 러닝 가속기 시장에서 주도적인 위치를 차지하고 있다. A100...

🧠 Accelerator

AMD GPU 상세

AMD Instinct 데이터센터 GPU는 AI 훈련과 추론, HPC 워크로드를 가속화하는 범용 병렬 프로세서로, CDNA(Compute DNA) 아키텍처를 기반으로 개발되었다. MI250X(CDNA2, 202...

🧠 Accelerator

커스텀 ASIC 개요

커스텀 ASIC(Application-Specific Integrated Circuit)은 특정 워크로드에 최적화된 맞춤형 반도체 칩으로, GPU 등 범용 가속기 대비 높은 성능 효율과 낮은 지연 시간을 제공한...

🧠 Accelerator

희소 연산 하드웨어

희소 연산 하드웨어(Sparsity Hardware)는 딥 러닝 모델의 가중치나 활성값에서 0이 아닌 값만 골라 연산을 수행하는 하드웨어 가속 기술이다. 대규모 언어 모델(LLM)의 파라미터 수가 수백억에서 수...

Arch

🏗️ Arch

CPU 마이크로아키텍처 기초

CPU 마이크로아키텍처(Microarchitecture)는 명령어 세트 아키텍처(ISA)가 실제 프로세서 하드웨어에서 어떻게 구현되는지를 나타내는 컴퓨터 공학의 핵심 분야이다. ISA는 프로그래머나 컴파일러가 ...

🏗️ Arch

분기 예측 (Branch Prediction)

분기 예측(Branch Prediction)은 현대 마이크로아키텍처에서 파이프라인 효율을 극대화하기 위한 핵심 기술이다. 조건 분기 명령어(conditional branch)의 결과가 결정되기 전에 분기의 방향...

🏗️ Arch

Out-of-Order 실행 (Out-of-Order Execution)

Out-of-Order 실행(Out-of-Order Execution, OoO)은 프로세서 아키텍처에서 명령어를 프로그램 순서와 다른 순서로 동적으로 실행하여 성능을 향상시키는 기술이다. 이 기술은 명령어 수준...

🏗️ Arch

슈퍼스칼라/와이드 이슈 (Superscalar/Wide-Issue)

슈퍼스칼라 프로세서(Superscalar Processor)는 단일 프로세서 코어 내에서 명령어 수준 병렬성(Instruction-Level Parallelism, ILP)을 활용하여 클럭당 복수의 명령어를 동...

🏗️ Arch

벡터/SIMD 아키텍처 (Vector/SIMD Architecture)

벡터 처리(Vector Processing)와 SIMD(Single Instruction, Multiple Data)는 하나의 명령어로 여러 데이터 요소를 동시에 연산하는 병렬 처리 기법이다. SIMD 아키텍처...

🏗️ Arch

스레드 멀티플렉싱 (SMT/Hyper-Threading)

동시 멀티스레딩(Simultaneous Multithreading, SMT)은 슈퍼스칼라 CPU의 전반적인 효율성을 개선하기 위한 하드웨어 기술이다. 이 기술은 하나의 물리적 코어에서 여러 개의 독립적인 스레드...

🏗️ Arch

명령어 세트 아키텍처 (ISA)

명령어 세트 아키텍처(Instruction Set Architecture, ISA)는 프로세서가 프로그래머나 컴파일러에게 노출하는 프로그래밍 인터페이스를 정의하는 추상 모델이다. ISA는 소프트웨어와 하드웨어 ...

🏗️ Arch

파이프라인 스톨

파이프라인 스톨(Pipeline Stall) 또는 버블(Bubble)은 명령어 파이프라인에서 다음 명령어가 다음 클럭 주기에 바로 실행될 수 없는 상황을 의미한다. 파이프라인은 여러 명령어가 동시에 처리되도록 ...

🏗️ Arch

인터럽트/예외 처리

인터럽트(Interrupt)와 예외(Exception)는 프로세서가 현재 실행 중인 코드를 중단하고 특수 처리 루틴으로 전환하게 만드는 하드웨어/소프트웨어 메커니즘이다. 인터럽트는 외부 디바이스(키보드, 디스크...

🏗️ Arch

카운터/모니터링 (PMU, Performance Counters, PEBS)

프로세서 모니터링 유닛(PMU)의 핵심 구성인 성능 모니터링 카운터(Performance Monitoring Counters, PMC)는 현대 마이크로프로세서에 내장된 특수 레지스터로, CPU의 다양한 하드웨어...

🏗️ Arch

캐시 일관성 프로토콜 (Cache Coherence Protocol)

캐시 일관성(Cache Coherence)은 다중 프로세서 시스템에서 여러 프로세서의 캐시 메모리에 동일한 메모리 주소에 대한 복사본이 존재할 때, 각 캐시의 데이터가 일관성을 유지하도록 보장하는 메커니즘이다....

🏗️ Arch

메모리 일관성 모델 (Memory Consistency Model)

메모리 일관성 모델(Memory Consistency Model)은 다중 프로세서/스레드 환경에서 메모리 연산의 순서와 가시성을 정의하는 규칙으로, 프로그래머와 하드웨어 간의 계약(contract) 역할을 한다...

🏗️ Arch

메모리 의존성 판별 (Memory Disambiguation)

메모리 의존성 판별(Memory Disambiguation)은 고성능 비순차 실행(out-of-order execution) 마이크로프로세서에서 로드와 스토어를 프로그램 순서와 다르게 실행할 때 사용하는 하드웨...

🏗️ Arch

가상화 하드웨어

하드웨어 가상화(Hardware Virtualization)는 CPU와 메모리 관리 하드웨어에 직접적인 지원을 추가하여, 하나의 물리적 시스템에서 여러 개의 독립된 가상 시스템(VM)을 효율적으로 실행할 수 있...

🏗️ Arch

멀티코어/이기종 아키텍처

멀티코어 아키텍처는 하나의 칩에 여러 개의 처리 코어를 집적하여 병렬 처리 성능을 높는 기술이다. 초기의 동일 코어 구성(SMP, Symmetric Multiprocessing)에서 출발하여, 연산 능력과 전력...

🏗️ Arch

Intel/AMD 마이크로아키텍처 비교

현대 x86 프로세서 시장은 Intel과 AMD 양사가 지배하고 있으며, 각각 독자적인 마이크로아키텍처 진화 경로를 걸어왔다. Intel은 Alder Lake(12세대)부터 하이브리드 아키텍처(P-코어 + E-...

🏗️ Arch

프리페치 기법

프리페치(Prefetching)는 데이터나 명령어가 실제로 필요하기 전에 미리 가져오는 기술로, 메모리 접근 지연 시간을 줄여 프로세서 성능을 향상시킨다. 현대 프로세서에서 메모리 접근 속도는 프로세서 처리 속...

🏗️ Arch

레지스터 리네임 (Register Renaming)

레지스터 리네임(Register Renaming)은 프로세서가 명령어 세트 아키텍처(ISA)에 정의된 제한된 수의 논리적 레지스터(logical registers)를, 내부적으로 훨씬 많은 수의 물리적 레지스터...

Circuit

⚡ Circuit

MOSFET Operation Principles

MOSFET(Metal-Oxide-Semiconductor Field-Effect Transistor)는 현대 디지털 회로의 기반이 되는 전계효과 트랜지스터이다. 1959년 Bell Labs의 Mohamed A...

⚡ Circuit

Digital Logic Gates

디지털 로직 게이트는 불리언 대수(Boolean Algebra) 연산을 수행하는 기본적인 디지털 회로 소자이다. 하나 이상의 이진 입력을 받아 단일 이진 출력을 생성하며, 현대 컴퓨터의 모든 연산과 제어의 기반...

⚡ Circuit

PMOS NMOS CMOS Analysis

MOSFET · n-channel / p-channel · CMOS Inverter · Low Power · Memory Cells

⚡ Circuit

Memory Hierarchy

컴퓨터 시스템에서 프로세서와 저장 장치 사이의 속도 차이(Processor-Memory Gap)는 수십 년간 컴퓨팅 아키텍처의 핵심 과제였다. 레지스터는 수 피코초(ps) 내에 접근 가능하지만, 메인 메모리(D...

⚡ Circuit

Data Representation

디지털 시스템은 모든 정보를 이진수(0과 1)로 표현한다. 데이터 표현 방식은 프로세서 설계, 메모리 시스템, 통신 프로토콜 등 컴퓨터 공학 전반에 걸쳐 가장 근본적인 주제이다. 정수 표현(부호 없는 수, 1의...

⚡ Circuit

RC Timing Analysis

RC Timing Analysis는 디지털 회로에서 신호 전달 지연(propagation delay)을 분석하는 핵심 기법이다. 실제 반도체 칩에서는 이상적인 직선 연결이 존재하지 않으며, 모든 배선(trace...

⚡ Circuit

ADC/DAC 변환 회로

ADC(Analog-to-Digital Converter)와 DAC(Digital-to-Analog Converter)는 아날로그 신호와 디지털 신호를 상호 변환하는 핵심 혼합 신호 회로입니다. ADC는 연속적...

⚡ Circuit

PLL/DLL 클럭 생성

PLL(Phase-Locked Loop)과 DLL(Delay-Locked Loop)은 전자 시스템에서 클럭 신호의 위상과 주파수를 정밀하게 제어하기 위한 피드백 제어 회로입니다. PLL은 출력 신호의 위상이 입...

⚡ Circuit

Op-Amp 연산 증폭기

Op-Amp(Operational Amplifier, 연산 증폭기)는 차동 입력, 단일 출력을 가지며 극도로 높은 이득을 가진 DC 결합 아날로그 증폭기입니다. 원래 아날로그 컴퓨터에서 수학 연산을 수행하기 위...

⚡ Circuit

전력 전자 기초

전력 전자(Power Electronics)는 전기 에너지의 제어와 변환을 위한 전자공학 분야입니다. 전력 반도체 소자를 이용해 DC와 AC 사이의 전력 변환, 전압·전류 조절, 주파수 변환 등을 수행합니다. ...

⚡ Circuit

혼합 신호 인터페이스

혼합 신호 인터페이스는 아날로그 영역과 디지털 영역을 연결하는 통합 인터페이스 기술입니다. 현대 SoC(System-on-Chip)에서는 센서, RF 트랜시버, 오디오 코덱 등 다양한 아날로그 주변장치와 디지털...

⚡ Circuit

클럭 배포

클럭 배포(Clock Distribution)는 단일 클럭 소스에서 칩 내부의 모든 레지스터나 플립플롭에 클럭 신호를 균일하게 전달하는 네트워크를 설계하는 문제입니다. 동기 디지털 회로에서 클럭은 모든 저장 장...

DRAM

🧠 DRAM

Memory Design Philosophy

DDR, LPDDR, GDDR, HBM은 모두 DRAM 계열이지만, 각기 다른 시스템 제약을 해결하도록 최적화되어 있습니다. DDR은 교체 가능성과 용량 확장을, LPDDR은 배터리 효율과 패키지 통합을, GD...

🧠 DRAM

1T1C DRAM Analysis

One-Transistor One-Capacitor DRAM Cell · Array · Read/Write · Sense Amplifier · Refresh

🧠 DRAM

DRAM Subarray x4 Read

Bank · Subarray · Mat · Hierarchical Word/Bit Line · x4 Read · Prefetch

🧠 DRAM

DRAM Refresh Comparison

All-Bank / Per-Bank / Same-Bank / FGR · Self-Refresh / PASR / TCSR · RFM / ARFM / DRFM · ECS / PPR

🧠 DRAM

DRAM 8F 6F 4F Structure

Feature Size · Folded/Open Bit Line · Buried Word Line · Vertical Channel Transistor

🧠 DRAM

DDR Generation Comparison

DDR 세대는 같은 DRAM 셀을 쓰더라도 I/O 인터페이스, prefetch, bank 구조, 전력 관리 방식을 바꿔가며 대역폭과 효율을 끌어올려 왔습니다. DDR1에서 DDR5로 갈수록 내부 코어는 비교적 ...

🧠 DRAM

DIMM Formfactor Comparison

DIMM · SO-DIMM · RDIMM · LRDIMM · CUDIMM · CAMM2 · LPCAMM2 · SOCAMM · SOCAMM2

🧠 DRAM

GDDR Generation Comparison

GDDR는 GPU와 AI 가속기에서 쓰는 고대역폭 그래픽 DRAM입니다. 같은 DRAM 셀을 쓰더라도 I/O signaling, prefetch, 채널 분할, 전원·신뢰성 기능을 계속 바꿔 세대마다 핀당 속도와...

🧠 DRAM

HBM Generation Comparison

HBM(High Bandwidth Memory)은 TSV 기반 3D 적층과 실리콘 인터포저를 이용해 GPU와 AI 가속기 가까이에서 TB/s급 대역폭을 제공하는 DRAM 계열입니다. HBM1과 HBM2는 102...

🧠 DRAM

LPDDR Generation Comparison

LPDDR은 모바일과 저전력 시스템을 위한 DRAM 계열로, 같은 셀 구조를 쓰면서도 더 낮은 전압, 더 세밀한 전력 상태, 더 높은 핀당 전송률을 목표로 세대가 진화해 왔습니다. DDR 계열보다 배터리 효율과...

🧠 DRAM

DDR 내부 구조

DDR(Double Data Rate) SDRAM은 현대 컴퓨터 시스템의 주 메모리로 사용되는 동기식 다이나믹 램입니다. 이 문서에서는 DDR4와 DDR5 세대의 내부 구조를 분석하고, 뱅크(Bank), 랭크(...

🧠 DRAM

GDDR 내부 구조

GDDR(Graphics Double Data Rate)는 GPU와 AI 가속기에서 사용되는 고대역폭 그래픽 DRAM입니다. 같은 DRAM 셀 기술을 기반으로 하되, I/O signaling, prefetch,...

🧠 DRAM

LPDDR 내부 구조

LPDDR(Low Power Double Data Rate) SDRAM은 모바일 기기, 노트북, 태블릿 등에서 사용되는 저전력 고성능 메모리입니다. 이 문서에서는 LPDDR4X, LPDDR5, LPDDR5X 세...

🧠 DRAM

HBM 내부 구조

HBM(High Bandwidth Memory)은 TSV(Through-Silicon Via) 기반 3D 적층과 실리콘 인터포저를 통해 GPU 및 AI 가속기와 근거리에서 TB/s급 대역폭을 제공하는 DRAM ...

🧠 DRAM

DRAM 온도 관리

DRAM은 수십억 개의 커패시터 셀로 구성된 반도체 소자로, 동작 중 발생하는 열이 데이터 무결성과 성능에 직접적인 영향을 미칩니다. 커패시터의 누설 전류는 온도에 지수적으로 비례하여 증가하므로, 고온 환경에서...

🧠 DRAM

DRAM 주소 지정

Bank Address · Row Address · Column Address · Address Multiplexing · Address Mapping

🧠 DRAM

DRAM 타이밍 파라미터

CAS Latency (CL) · Row to Column Delay (tRCD) · Row Precharge Time (tRP) · Row Active Time (tRAS) · Refresh Cycle Tim...

🧠 DRAM

LPDDR6 사양 요약

LPDDR6는 JEDEC JESD209-6으로 2025년 7월 공식 발표된 차세대 저전력 DRAM 표준입니다. 이전 세대인 LPDDR5/5X 대비 대역폭, 전력 효율, 신뢰성에서 크게 향상되었으며, 모바일뿐 아...

🧠 DRAM

DRAM 테스트/신뢰성

DRAM은 수십억 개의 미세한 커패시터 셀로 구성된 반도체 소자로, 제조 공정에서의 미세 결함과 동작 중의 열화 현상으로 인해 다양한 고장이 발생할 수 있습니다. DRAM 테스트/신뢰성 분야는 이러한 고장을 사...

🧠 DRAM

zHBM 분석

zHBM은 삼성전자가 2026년 2월 SEMICON Korea에서 공개한 차세대 HBM 개발 아키텍처입니다. 현재의 HBM은 GPU와 HBM 스택을 실리콘 인터포저 위에 나란히 배치하는 2.5D 패키징이 일반적...

🧠 DRAM 추가됨

SPHBM 분석

SPHBM은 Standard Package High Bandwidth Memory의 약자로, 실리콘 인터포저가 필요한 기존 HBM 패키징의 비용·면적 제약을 완화하면서 HBM급 대역폭을 제공하기 위한 JEDEC...

🧠 DRAM

HBM3 Spec Summary

HBM3(High Bandwidth Memory 3)는 JEDEC JESD238(2022년 1월)로 공표된 3D 적층 DRAM 인터페이스 표준입니다. HBM2E 대비 데이터 레이트가 2배 향상된 핀당 6.4Gb...

GPU

🎮 GPU

GPU 메모리 아키텍처 기초

GPU는 대규모 병렬 연산을 수행하는 프로세서로, 수천 개의 연산 코어가 동시에 동작하기 때문에 메모리 대역폭이 핵심 병목입니다. GPU 메모리 아키텍처는 CPU 메모리와 근본적으로 다른 접근 방식을 취하며, ...

🎮 GPU

CUDA 메모리 관리

CUDA 메모리 관리는 호스트 DRAM과 디바이스 메모리 사이의 데이터 이동, 할당 수명, 주소 가시성을 함께 다루는 계층입니다. GPU 연산 성능이 높아질수록 커널 자체보다 메모리 배치와 전송 방식이 병목이 ...

🎮 GPU

GPU 메모리 최적화 기법

GPU 성능은 연산 유닛의 수만큼이나 메모리 접근 방식에 크게 좌우됩니다. 같은 커널이라도 글로벌 메모리 접근이 흩어져 있거나, 같은 데이터를 여러 번 다시 읽거나, 호스트와 디바이스 사이의 이동이 잦으면 처리...

🎮 GPU

GPU 메모리 코일레싱 (Memory Coalescing)

GPU의 병렬 연산 성능은 메모리 서브시스템의 효율성에 크게 좌우됩니다. Memory Coalescing은 워프(warp) 내 32개 스레드가 각각 요청하는 글로벌 메모리 접근을 하드웨어가 자동으로 합쳐 최소한...

🎮 GPU

멀티 GPU 통신

멀티 GPU 통신은 대규모 AI 학습과 추론에서 여러 GPU가 효율적으로 데이터를 주고받을 수 있도록 하는 고속 인터커넥트 기술입니다. 단일 GPU의 메모리와 연산 능력이 한계에 봉착하면서, 트랜스포머 모델의 ...

🎮 GPU

칩렛 GPU

칩렛 GPU는 단일 다이(monolithic die)에 모든 기능을 집적하는 대신, 연산·메모리·I/O 같은 기능을 독립적인 칩렛(chiplet)으로 분리하고 패키지 내에서 결합하는 GPU 설계 방식입니다. 기...

🎮 GPU

GPU Heterogeneous Memory Papers

GPU의 온보드 HBM 용량은 수십 GB 수준에 머물러 대규모 DNN과 LLM 학습·추론에서 바로 병목이 됩니다. 이 제약을 줄이기 위해 GPU 이기종 메모리 연구는 UVM 기반 페이지 관리에서 시작해, 레이어...

LLM

🤖 LLM

LLM Basics

Tokenization · Transformer · Next-token Prediction · Training/Post-training · Inference · KV Cache · Serving

🤖 LLM

Memory Centric LLM Serving Survey

Memory-Centric LLM Serving: KV 압축·캐싱·오프로딩·P/D 분리·PIM/PNM·신뢰성 (최근 연구 종합)

🤖 LLM

Architecture Venues LLM Memory Papers

ISCA · MICRO · HPCA · ASPLOS · DAC · PACT · DATE — KV 캐시·PIM/PNM·CXL·in-storage·양자화·서빙·신뢰성

🤖 LLM

MoE Serving Routing LoadBalance

Expert Routing · All-to-All Dispatch · Capacity Factor · Expert Parallelism · Hot Expert Replication

🤖 LLM

LLM 양자화

가중치 양자화 · GPTQ · AWQ · GGUF · 훈련 후 양자화 · 활성값 인식 · 혼합 정밀도 · 온디바이스 LLM

🤖 LLM

LLM Inference Engine Analysis

vLLM · TensorRT-LLM · SGLang · TGI · llama.cpp — 아키텍처 비교와 선택 기준

🤖 LLM

MoE Analysis

Sparse Activation · Routing/Gating · Load Balancing · DeepSeekMoE · Expert Parallelism/Offloading

🤖 LLM

PagedAttention Analysis

vLLM · KV Cache Paging · Block Table · Copy-on-Write · Continuous Batching · KV Offloading

🤖 LLM

vAttention Analysis

CUDA Virtual Memory · Contiguous KV Cache · Demand Paging · ASPLOS 2025

🤖 LLM

FlashAttention Analysis

IO-aware Exact Attention · Tiling · Online Softmax · Recomputation · FA-2/FA-3 · Flash-Decoding

🤖 LLM

MLA Analysis

Low-Rank KV Joint Compression · Decoupled RoPE · Weight Absorption · DeepSeek-V2/V3

🤖 LLM

MTP Analysis

Multi-Token Prediction · 병렬 head / 순차 module · Self-Speculative Decoding · DeepSeek-V3

🤖 LLM

RAG Analysis

Retrieval · Augmentation · Generation · Embedding/Vector DB · Hybrid Search · Reranking · GraphRAG

🤖 LLM

KV Cache Quantization Analysis

KV Cache Quantization · Per-channel Key / Per-token Value · KIVI · KVQuant · FP8/INT8 · Mixed Precision

🤖 LLM

KV Cache Offloading Analysis

Memory Hierarchy · Prefix Reuse · PD Disaggregation · LMCache · Mooncake · CacheGen · CXL-PNM

🤖 LLM

Prefix Caching Analysis

공통 프리픽스 KV 재사용 · 블록·해시 매칭 · RadixAttention vs APC · 프로바이더 Prompt Caching · 멀티턴·RAG

🤖 LLM

Semantic Caching Analysis

의미 기반 응답 재사용 · 임베딩 유사도 · 임계값 트레이드오프 · GPTCache · 다층 캐시 · 프리픽스 캐싱과의 대비

🤖 LLM

StreamingLLM Analysis

무한 스트리밍 · Attention Sink · Sink + Window · Rolling Cache · KV 축출(H2O) · '문맥 확장이 아님'

🤖 LLM

Sliding Window Attention Analysis

국소 어텐션 아키텍처 · Receptive Field · Rolling Buffer Cache · Longformer·Mistral·Gemma · SWA vs StreamingLLM

🤖 LLM

Continuous Batching Analysis

Dynamic Scheduler · Decode Slot Refill · Chunked Prefill · PagedAttention · Fairness vs Throughput

🤖 LLM

Speculative Decoding Analysis

Draft Model · Verification · Acceptance Rate · Medusa/EAGLE · Throughput vs TTFT

🤖 LLM

Disaggregated LLM Serving Analysis

Prefill-Decode Disaggregation · KV Transfer · Network Fabric · Remote Cache · Elastic Pooling

🤖 LLM

LLM Inference Scheduler Analysis

Admission Control · Batching Policy · SLO Aware Queueing · Fairness · Token Budgeting

🤖 LLM

KV Cache 압축

> KV Cache Compression · Quantization · Token Eviction · Rank Compression · Mixed Precision · Adaptive Strategies

🤖 LLM

활성값 압축

> Activation Compression · SmoothQuant · AWQ · LLM.int8() · Weight-Activation Quantization · Outlier Handling

🤖 LLM

추론용 추측 실행

Draft-Verify 파이프라인, 서빙 프레임워크 통합, 메모리/compute 트레이드오프, 레이턴시 vs 쓰루풋 최적화

🤖 LLM

MQA (Multi-Query Attention) 분석

Multi-Query Attention(MQA)은 여러 Query head가 하나의 Key head와 Value head를 공유하는 Attention 변형입니다. Query head는 그대로 유지하므로 여러 표...

🤖 LLM

GQA (Grouped-Query Attention) 분석

Grouped-Query Attention(GQA)은 Query head는 여러 개 유지하면서 Key/Value head만 줄이고, 여러 Query head가 하나의 KV head를 공유하는 Attention ...

Linux

🐧 Linux

Linux 메모리 관리 기초

Linux 메모리 관리는 프로세스마다 독립된 가상 주소 공간을 제공하고, 그 뒤에서 실제 물리 메모리와 파일을 연결하는 핵심 서브시스템입니다. mmap()으로 만든 매핑, malloc()이 쓰는 힙, 스택, 파...

🐧 Linux

Linux Memory Tiering Deep

Linux 메모리 티어링은 DRAM, HBM, CXL/PMem 같은 서로 다른 메모리 계층을 하나의 정책 아래에서 다루는 기법입니다. 핵심은 hot 페이지를 더 빠른 티어로 올리고, cold 페이지를 더 느린 ...

🐧 Linux

Linux 메모리 최적화

Linux에서 메모리 최적화는 단순히 더 많은 메모리를 쓰는 문제가 아니라, 같은 데이터는 덜 쓰고, 자주 접근하는 데이터는 더 큰 단위로 다루고, 한동안 쓰이지 않는 데이터는 압축해서 보관하는 문제입니다. T...

🐧 Linux

하드웨어 메모리 압축

하드웨어 메모리 압축은 RAM의 물리적 용량을 소프트웨어 압축 알고리즘 대비 훨씬 낮은 지연시간으로 확장하는 기술입니다. DRAM 가격이 비싼 서버 환경이나 메모리 제약이 큰 엣지/임베디드 장치에서 효과적이며,...

🐧 Linux

소프트웨어 메모리 압축

소프트웨어 메모리 압축은 운영체제 커널 수준에서 메모리 페이지를 압축하여 물리적 RAM 용량을 가상으로 확장하는 기술입니다. 하드웨어 압축 엔진 없이 CPU의 일반적인 연산 자원만으로 압축/해제를 수행하며, z...

🐧 Linux

중복 제거

메모리 중복 제거(deduplication)는 동일한 내용을 가진 메모리 페이지들을 하나의 공유 페이지로 병합하여 물리적 RAM 사용량을 줄이는 Linux 커널 기술입니다. 대표적인 구현인 KSM(Kernel ...

🐧 Linux

투명 거대 페이지

투명 거대 페이지(Transparent Huge Pages, THP)는 Linux 커널이 기본 페이지(4KB)보다 큰 페이지(2MB, 1GB 등)를 자동으로 할당하여 TLB(Translation Lookasid...

🐧 Linux

스왑/zRAM

스왑은 물리적 RAM 용량이 부족할 때, 사용하지 않는 메모리 페이지를 디스크에 임시로 저장하여 시스템이 더 많은 메모리를 가진 것처럼 동작하게 하는 가상 메모리 기법입니다. 전통적인 스왑은 디스크 I/O를 동...

🐧 Linux

OOM 관리

Linux에서 Out Of Memory(OOM) 관리는 시스템 물리 메모리와 스왑이 모두 소진되었을 때 프로세스를 종료하여 시스템을 복구하는 메커니즘입니다. 커널은 oom-killer를 통해 가장 적합한 프로세...

🐧 Linux

Linux 메모리 컴팩션

Linux 메모리 컴팩션(Memory Compaction)은 시스템 가동 중 물리 메모리 파편화(fragmentation)를 해결하여 연속된 큰 메모리 영역을 확보하는 메커니즘입니다. THP(Transparen...

🐧 Linux

KSM (Kernel Samepage Merging)

KSM(Kernel Samepage Merging)은 Linux 커널 2.6.32부터 도입된 메모리 중복 제거(deduplication) 기술입니다. KVM 가상화 환경에서 유사한 게스트 OS 이미지 간의 메모...

🐧 Linux

CXL 메모리 할당, hotplug, tiering

CXL 메모리는 단순한 장치 메모리가 아니라, Linux가 부팅 시점부터 runtime hotplug까지 이어서 다루는 메모리 자원입니다. 펌웨어가 제공하는 ACPI 정보로 NUMA 노드와 접근 성능을 읽고, ...

🐧 Linux

cgroup 메모리

cgroup 메모리 컨트롤러는 Linux 커널에서 프로세스 그룹별로 메모리 사용량을 측정하고 제한하는 리소스 관리 메커니즘입니다. 컨테이너, VM, 분리된 워크로드 간에 메모리를 격리하고 할당하여, 특정 애플리...

🐧 Linux

서버리스 Linux 최적화

서버리스 컴퓨팅 환경에서 Linux는 컨테이너 또는 마이크로VM 기반으로 실행되며, Cold Start 성능과 리소스 효율이 핵심 지표입니다. 서버리스 Linux 최적화는 부팅 시간 단축, 메모리 사용량 절감,...

NAND

💾 NAND

NMOS FloatingGate ChargeTrap

Flash Cell = Programmable-Vth NMOS · FN Tunneling · Program / Erase / Read

💾 NAND

QLC/TLC/MLC 비교

셀 밀도 · 내구성 · 성능 · 비용 트레이드오프

💾 NAND

NAND NVMe SSD Analysis

NAND Flash Memory · SSD Controller · FTL · NVMe Protocol · OS I/O Stack

💾 NAND

NAND Flash Internals

NAND Flash Cell · String/Array · Vth Distribution · 3D V-NAND · Program/Erase Physics

💾 NAND

VFS FS PageCache BlockIO

VFS · File System · Page Cache · Block I/O Layer

💾 NAND

FTL WearLeveling GarbageCollection

Logical-to-Physical Mapping · Out-of-Place Update · WAF · Over-Provisioning · TRIM

💾 NAND

SSD Internal Parallelism Channel Die Plane

Channel · Package · Die(LUN) · Plane · Superpage/Stripe · Queue Depth

💾 NAND

NAND 에러 관리

ECC · Bad Block Management · Read Disturb · Data Retention · Read Retry · 에러 유형별 대응 전략

💾 NAND

ZNS OpenChannelSSD Analysis

Host-Managed Flash · Zone Write Pointer · Zone Append · FTL Offload · Log-Structured Software

💾 NAND

NVMe 2.0 분석

모듈화된 Command Set · Endurance Group · I/O Determinism · ZNS/KV Command Set · SR-IOV 가상화

💾 NAND

NAND 소자 물리

MOSFET 기반 셀 동작 · FN 터널링 · ISPP 프로그래밍 · Vth 분포 · 열화 메커니즘 · 3D NAND 물리

💾 NAND

NAND ECC 고급

LDPC · BCH · 코딩 이론 · 소프트/하드 디코딩 · 온다이 ECC · ECC 강도 비교

NVM

🔬 NVM

FeRAM Analysis

Ferroelectric RAM · Polarization · 1T1C · P-E Hysteresis · FeFET · HfO₂

🔬 NVM

NVM Interface Analysis

NVMe · CXL.mem · HBM-PIM · Storage Class Memory · Compute Express Link · Processing-In-Memory

🔬 NVM

ReRAM Analysis

Resistive RAM · MIM Cell · Filament · Set/Reset · Cross-point · In-Memory Computing

🔬 NVM

MRAM Analysis

Magnetic RAM · MTJ · TMR · Spin-Transfer/Orbit Torque · Universal Memory

🔬 NVM

PCM Analysis

Phase-Change Memory · GST · Crystalline/Amorphous · SET/RESET · 3D XPoint · SCM

🔬 NVM

STT-MRAM 상세 분석

Spin-Transfer Torque · MTJ · PMA · 1T1MTJ · Non-Volatile Memory · Embedded NVM

🔬 NVM

Persistent Memory (영구 메모리)

Persistent Memory(PMEM, 영구 메모리)는 DRAM의 빠른 바이트 주소 접근성과 NAND Flash의 비휘발성을 결합한 차세대 메모리 기술입니다. 전통적인 메모리 계층에서 DRAM은 빠르지만 휘...

Protocol

🔌 Protocol

CXL Version Comparison

CXL(Compute Express Link)은 CPU와 가속기, 메모리 디바이스 사이를 잇는 오픈 인터커넥트 표준이다. PCIe 물리 계층 위에서 CXL.io, CXL.cache, CXL.mem을 함께 사용하...

🔌 Protocol

PCIe Gen5/Gen6

PCIe(Peripheral Component Interconnect Express)는 CPU와 주변장치, 가속기, 저장소 디바이스를 연결하는 고속 직렬 인터커넥트 표준이다. PCIe 5.0은 32 GT/s, ...

🔌 Protocol

AMBA/AXI 프로토콜

AMBA(Advanced Microcontroller Bus Architecture)는 Arm이 1996년에 도입한 SoC(System-on-a-Chip) 내부 인터커넥트 표준이다. CPU, GPU, 메모리 컨...

🔌 Protocol

UCIe Chiplet Interconnect

UCIe(Universal Chiplet Interconnect Express)는 다양한 칩렛 간의 고속 통신을 위한 오픈 표준 인터커넥트이다. Intel, AMD, Arm, TSMC, Samsung, Qual...

🔌 Protocol

CXL 메모리 풀링

CXL(Compute Express Link) 메모리 풀링은 CXL 2.0에서 도입된 핵심 기능으로, 여러 호스트 CPU가 물리적으로 분리된 메모리 리소스를 공유할 수 있게 해주는 기술이다. 기존 DIMM 기반...

🔌 Protocol

CXL 기반 시스템

CXL(Compute Express Link) 기반 시스템은 CPU, 메모리, 가속기를 CXL 프로토콜로 연결하는 차세대 컴퓨팅 아키텍처다. 기존 PCIe 기반 시스템이 I/O 중심이었던 것과 달리, CXL은 ...

SRAM

🔲 SRAM

6T SRAM Analysis

Six-Transistor SRAM Cell · Cross-Coupled Inverters · Read/Write · Stability Trade-off · Cache

🔲 SRAM

SRAM vs DRAM Comparison

SRAM과 DRAM은 둘 다 전원이 꺼지면 데이터가 사라지는 휘발성 메모리이지만, 비트를 저장하는 방식이 완전히 다릅니다. SRAM은 cross-coupled inverter latch가 값을 유지하는 구조라 ...

🔲 SRAM

SRAM 셀 변형 분석

SRAM은 6T 셀을 기본으로 하지만, 공정 축소와 저전압 동작이 겹치면 read disturb, 누설 전류, soft error가 더 도드라집니다. 그래서 셀 자체를 바꾸거나 배열 운용 방식을 바꿔 읽기 안정...

🔲 SRAM

SRAM 리텍션 수율

SRAM 리텍션 수율은 정해진 전압, 온도, 대기 시간에서 데이터를 끝까지 유지한 셀의 비율을 뜻합니다. 같은 6T SRAM이라도 공정 편차, 누설 경로, 약한 PMOS, 비트라인 커플링에 따라 일부 셀만 먼저...

🔲 SRAM

저전력 SRAM

SRAM은 CPU 캐시, 임베디드 시스템, IoT 디바이스 등에서 널리 사용되지만, 미세 공정으로 갈수록 누설 전류(leakage current)와 동적 전력(dynamic power)이 주요 문제로 부상합니다...

🔲 SRAM

임베디드 SRAM

임베디드 SRAM(Embedded SRAM, eSRAM)은 별도 칩이 아니라 SoC(System on Chip) 내부에 직접 집적되는 SRAM입니다. CPU 캐시, 버퍼, DMA 엔진, 무선 기지국의 버퍼 등 ...

Security

🔒 Security

Rowhammer 공격과 방어

Rowhammer는 현대 DRAM(Dynamic Random-Access Memory)의 물리적 특성을 악용한 하드웨어 보안 취약점이다. DRAM 셀이 미세 공정으로 고밀도 집적되면서 인접 셀 간 전기적 간섭이...

🔒 Security

메모리 암호화

메모리 암호화(Memory Encryption)는 메모리에 저장된 데이터를 물리적 또는 논리적 접근으로부터 보호하기 위해 암호화 알고리즘을 적용하는 기술이다. DRAM에 저장되는 데이터는 CPU 외부의 물리적 ...

🔒 Security

SGX/TEE 보안 기술

Trusted Execution Environment(TEE)는 메인 프로세서 내에서 코드와 데이터를 격리하여 보호하는 하드웨어 기반 보안 기술이다. TEE는 외부 소프트웨어(운영체제, 하이퍼바이저, 악성 코드...

🔒 Security

Spectre/Meltdown 상세

Spectre(스펙터)와 Meltdown(멜트다운)은 2018년 1월 공개된 현대 프로세서의 추론 실행(Speculative Execution)과 캐시 사이드 채널을 악용한 하드웨어 보안 취약점이다. 두 취약점...

🔒 Security

사이드 채널 공격

사이드 채널 공격(Side-Channel Attack)은 컴퓨터 시스템의 물리적 구현에서 의도치 않게 새어나가는 정보를 악용하여 민감한 데이터를 추출하는 보안 공격 기법이다. 암호화 알고리즘 자체의 수학적 취약...

🔒 Security

Rowhammer 방어 기술

Rowhammer 공격이 2014년 처음 보고된 이후 DRAM 메모리 보안은 지속적인 연구와 표준화 작업이 이루어져 왔다. 초기 DDR3 시대의 간단한 리프레시 주기 단축에서 시작하여, 현대 DDR4/DDR5 ...

🔒 Security

Spectre v2 상세

Spectre v2 (CVE-2017-5715, Branch Target Injection)는 현대 프로세서의 간접 분기 예측기(Indirect Branch Predictor)와 분기 대상 버퍼(BTB, Bra...

Storage

💿 Storage

파일 시스템 개요

파일 시스템은 운영체제가 저장 장치의 데이터를 구조화하여 관리하는 메커니즘이다. 디스크 블록 할당, 메타데이터 관리, 디렉토리 구조, 무결성 보장 등 스토리지 계층의 핵심 기능을 담당하며, 선택에 따라 시스템의...

💿 Storage

RAID 기술

RAID(Redundant Array of Independent Disks)는 여러 개의 물리적 디스크를 하나의 논리적 볼륨으로 묶어 성능 향상, 데이터 중복, 또는 두 가지를 동시에 달성하는 스토리지 가상화 ...

💿 Storage

ext4 상세

ext4는 리눅스 커널 2.6.28(2008년)에서 첫 도입된 확장 파일 시스템의 네 번째 버전으로, 기존 ext3에서 디스크 포맷과 데이터 구조를 대폭 개선한 범용 파일 시스템이다. Extent 기반 할당, ...

💿 Storage

Btrfs 상세

Btrfs(B-tree File System)는 Copy-on-Write(CoW) 원리를 기반으로 한 현대적인 파일 시스템으로, 2007년 Oracle의 Chris Mason에 의해 개발이 시작되어 2009년 ...

💿 Storage

네트워크 스토리지

네트워크 스토리지는 컴퓨터 네트워크를 통해 여러 클라이언트에서 데이터 저장소에 접근할 수 있도록 하는 기술이다. 직접 연결 스토리지(DAS), 네트워크 연결 스토리지(NAS), 스토리지 에어리어 네트워크(SAN...

💿 Storage

I/O 스케줄러

I/O 스케줄러는 블록 레이어에서 I/O 요청의 순서와 전달을 관리하여 디스크 성능과 지연시간을 최적화하는 커널 컴포넌트이다. 과거에는 단일 큐 기반의 CFQ(Complete Fair Queueing)가 주류였...

💿 Storage

ZFS/Btrfs 고급 기능

ZFS(Zettabyte File System)와 Btrfs(B-tree File System)는 현대적인 Copy-on-Write(CoW) 파일 시스템으로, 기존 파일 시스템의 한계를 극복하기 위해 다양한 고...

System

🖥️ System

CPU Cache Architecture

CPU Cache Architecture는 프로세서와 메인 메모리(DRAM) 사이의 속도 격차를 해소하기 위한 핵심 하드웨어 메커니즘이다. 현대 CPU는 수 GHz 클럭으로 동작하는 반면 DRAM은 수백 사이클...

🖥️ System

Virtual Memory

Virtual Memory는 각 프로세스에 독립된 가상 주소 공간(Virtual Address Space)을 제공하여, 물리 메모리의 제약으로부터 프로세스를 격리하는 메모리 관리 기법이다. 이를 통해 여러 프로...

🖥️ System

Memory Controller

Memory Controller는 CPU와 메인 메모리(DRAM) 사이에서 데이터 흐름을 관리하는 핵심 디지털 회로이다. DRAM은 주기적인 리프레시가 필요하고, 복잡한 타이밍 제약(tRCD, tCAS, tRP...

🖥️ System

ECC Error Correction

ECC(Error Correction Code)는 컴퓨터 메모리 시스템에서 데이터 무결성을 보장하기 위해 사용되는 오류 정정 기술이다. DRAM 셀에 저장된 비트가 우주선 입자(cosmic ray), 알파 입자...

🖥️ System

NVMe Architecture

NVMe(Non-Volatile Memory Express)는 PCIe를 중심으로, 확장 시에는 RDMA나 TCP 같은 fabric transport 위에서도 사용할 수 있도록 정의된 고성능 비휘발성 스토리지 ...

🖥️ System

Power Management

Power Management는 컴퓨팅 시스템에서 에너지 소비를 최적화하기 위한 기술적 전략의 총칭이다. 특히 메모리 서브시스템은 전체 시스템 전력의 30~40%를 차지할 수 있어, 효과적인 전력 관리가 필수적...

🖥️ System

디버깅/프로파일링

디버깅/프로파일링은 소프트웨어 개발 과정에서 프로그램의 동작을 분석하고 문제를 해결하는 핵심 기법이다. 디버깅은 프로그램의 논리적 오류(bug)를 찾아 수정하는 과정이고, 프로파일링은 프로그램의 성능 병목과 리...

🖥️ System

서버리스 컨테이너 (Serverless Container)

서버리스 컨테이너는 컨테이너 기반 애플리케이션을 서버 인프라 관리 없이 실행할 수 있는 클라우드 컴퓨팅 모델입니다. 기존 FaaS(Function as a Service)가 함수 단위 실행에 머무르는 반면, 서...

🖥️ System

서버리스 스토리지 (Serverless Storage)

서버리스 스토리지는 클라우드 제공자가 인프라 관리, 확장, 백업을 처리하는 저장 서비스입니다. 서버리스 컴퓨팅 환경에서는 Lambda 함수나 컨테이너가 시작과 동시에 스토리지에 접근해야 하므로, 적절한 저장소 ...

🖥️ System

임시 스토리지 관리 (Ephemeral Storage Management)

임시 스토리지(Ephemeral Storage)는 프로세스나 컨테이너의 수명과 동일하게 존재하다가 종료 시 자동으로 삭제되는 저장소를 말합니다. Linux에서는 주로 /tmp, /dev/shm, tmpfs로 마...

🖥️ System

NUMA 아키텍처

NUMA(Non-Uniform Memory Access)는 멀티 프로세서 시스템에서 메모리 접근 시간이 프로세서와 메모리의 물리적 상대 위치에 따라 달라지는 메모리 아키텍처이다. 각 프로세서(또는 프로세서 그룹...

🖥️ System

메모리 인터커넥트

메모리 인터커넥트는 CPU, GPU, 메모리 컨트롤러, I/O 디바이스 등 SoC(System on Chip) 내부 또는 칩 간 데이터를 전달하는 통신 경로를 말한다. 인터커넥트의 성능은 시스템 전체 대역폭과 ...

🖥️ System

PIM/NMP 아키텍처 개요

PIM(Processing-In-Memory)은 메모리 칩 내부에 연산 요소를 통합하여 CPU와 메모리 간 데이터 이동으로 인한 병목을 줄이는 컴퓨터 아키텍처이다. 전통적인 von Neumann 구조에서는 CP...

🖥️ System

PIM 응용

PIM(Processing-In-Memory)은 메모리 내부에 연산 유닛을 통합하여 데이터 이동 병목을 해결하는 아키텍처이다. 실제 상용 제품과 연구 플랫폼이 등장하면서 DNN 추론/학습, 그래프 처리, 유전체...

🖥️ System

NMP 아키텍처

NMP(Near-Memory Processing)는 메모리 컨트롤러 근처 또는 3D 적층 메모리의 로직 레이어에 연산 유닛을 배치하여 데이터 이동 병목을 완화하는 컴퓨팅 아키텍처이다. PIM(Processing...

🖥️ System

캐시 일관성 MESI/MOESI

캐시 일관성(Cache Coherence)은 멀티코어/멀티프로세서 시스템에서 각 코어의 로컬 캐시에 저장된 공유 데이터의 일관성을 유지하는 메커니즘이다. 하나의 메모리 위치에 대한 여러 캐시 복사본이 존재할 때...

🖥️ System

메모리 디스애그리게이션 고도화

메모리 디스애그리게이션은 서버의 CPU와 메모리를 논리적으로 분리하여, 메모리를 중앙 풀(pool)로 통합하고 필요에 따라 동적으로 할당하는 기술이다. 전통적인 서버 아키텍처에서 CPU는 로컬 DIMM 슬롯에 ...

🖥️ System

서버리스 시스템 (Serverless System)

서버리스 컴퓨팅은 클라우드 제공자가 하드웨어 및 소프트웨어 리소스의 프로비저닝, 배포, 관리를 고객이 수행하지 않도록 하는 클라우드 서비스 카테고리입니다. ISO/IEC 22123-2에 따르면, 서버리스 컴퓨팅...

🖥️ System

서버리스 메모리 (Serverless Memory)

서버리스 컴퓨팅 환경에서 메모리 관리는 기존 인프라와 근본적으로 다른 특성을 가집니다. 전통적인 서버 환경에서는 OS 수준에서 메모리를 직접 관리하지만, 서버리스 환경에서는 클라우드 제공자가 함수별 메모리 할당...

🖥️ System

콜드 스타트 최적화 (Cold Start Optimization)

서버리스 컴퓨팅에서 콜드 스타트는 함수가 처음 호출되거나 비활성 상태에서 재사용될 때 실행 환경을 처음부터 구성하는 과정입니다. 이 과정에는 런타임 로드, 의존성 초기화, 네트워크 설정 등 여러 단계가 포함되며...