PHpullh
학습 라이브러리/AI Knowledge/LLM 추론 최적화 — vLLM & TensorRT

AI KNOWLEDGE · 기초 개념

LLM 추론 최적화 — vLLM & TensorRT

오픈소스 LLM 서빙 최적화. vLLM: PagedAttention으로 메모리 효율 3~4배, 처리량 10~24배↑. TensorRT-LLM: NVIDIA GPU 최적화. Flash Attention: 메모리 효율적 어텐션 계산. 프로덕션 LLM 서빙은 vLLM이 사실상 표준입니다.

기초 개념

핵심 설명

오픈소스 LLM 서빙 최적화. vLLM: PagedAttention으로 메모리 효율 3~4배, 처리량 10~24배↑. TensorRT-LLM: NVIDIA GPU 최적화. Flash Attention: 메모리 효율적 어텐션 계산. 프로덕션 LLM 서빙은 vLLM이 사실상 표준입니다.