Skip to content

Latest commit

 

History

History
54 lines (27 loc) · 4.26 KB

File metadata and controls

54 lines (27 loc) · 4.26 KB
id 29
category RAG
title 23년에 vLLM이 처음 등장했을 때, 추론 속도가 기존 대비 수백 배까지 빨라질 수 있다는 말은 참 놀라웠습니다. 그럼에도 당시에는 사용하기 어렵다는 이유로 많은 분이 외면하기도 했었죠. 하지만 2026년 현재, 누구나 vLLM을 씁니다. 결국 압도적인 속도가 불편함을 이기고 새로운 표준을 만들어낸 셈입니다.

23년에 vLLM이 처음 등장했을 때, 추론 속도가 기존 대비 수백 배까지 빨라질 수 있다는 말은 참 놀라웠습니다. 그럼에도 당시에는 사용하기 어렵다는 이유로 많은 분이 외면하기도 했었죠. 하지만 2026년 현재, 누구나 vLLM을 씁니다. 결국 압도적인 속도가 불편함을 이기고 새로운 표준을 만들어낸 셈입니다.

당시 vLLM의 작동 원리를 파악하려 블로그를 보다 복잡해 보여서 포기했던 기억이 납니다. 그런데 지금 다시 보니, 핵심은 우리가 학부 2, 3학년 운영체제(OS) 시간에 배우는 페이징(Paging) 기법을 LLM과 GPU 환경에 맞게 이식한 아주 고전적이고도 명쾌한 개념이더군요.

여기에 더해 요즘 에이전트 열풍과 함께 SGLang이 큰 인기를 누리고 있습니다. SGLang의 마법 역시 알고 보면 트리(Tree) 자료구조와 캐싱(Caching)이라는 기본기로 구현된 재활용의 미학입니다.

최신 추론 엔진의 핵심 개념들을 소개합니다. 26년 현재는 PagedAttention과 RadixAttention이 모든 엔진의 기본 소양이 되었지만, 두 프로젝트가 지향하는 정점은 분명 다릅니다. 그 차이를 풀어보겠습니다.

  1. vLLM: "단 한 칸의 메모리 낭비도 허용하지 않는다" (PagedAttention)

vLLM의 핵심은 공간의 최적화입니다. 이전의 시스템들은 LLM이 얼마나 길게 말할지 모르니 메모리를 미리 통째로 예약했습니다. 혼자 온 손님에게 100인실을 내어주는 식이었죠.

  • OS의 지혜: vLLM은 이를 해결하기 위해 메모리를 작은 페이지(Block) 단위로 쪼개고, 필요할 때마다 빈 공간에 끼워 넣는 페이징 기법을 도입했습니다.
  • 결과: 메모리 단편화(Fragmentation)를 0%에 가깝게 줄였습니다. 덕분에 남는 공간에 더 많은 요청을 밀어 넣어, 일반 추론 대비 처리량(Throughput)을 수십 배에서 최대 수백 배까지 끌어올립니다.
  1. SGLang: "했던 생각을 왜 또 해?" (RadixAttention)
  • 자료구조의 지혜: 한 번 계산한 기억(KV Cache)을 버리지 않고 Radix Tree라는 족보에 저장합니다. 질문의 앞부분이 예전과 같다면 계산 과정을 통째로 건너뛰고 기억만 꺼내 옵니다.
  1. 숫자와 환경으로 보는 장단점 비교

어떤 엔진을 써야 할지 고민이라면 이 지표를 보시면 됩니다.

  • 처리량(Throughput): 동시 접속자가 수백 명인 고부하 환경에서는 vLLM이 SGLang보다 약 11% 가량 더 높은 Peak 성능을 보여줍니다. (vLLM: 5,129 tokens/s vs SGLang: 4,638 tokens/s) 대규모 서빙의 표준다운 안정성입니다.
  • 지연 시간(Latency): 복잡한 에이전트 제어나 JSON 규격 생성 같은 지능형 작업에서는 SGLang이 vLLM 대비 최대 6.4배 높은 효율을 기록합니다. 재사용할 기억이 많을수록 SGLang은 무적이 됩니다.
  1. 아이러니: 가장 최첨단 기술의 뿌리는 기본기

재밌는 점은 2026년 현재 가장 핫한 이 기술들이 결국 OS의 페이징과 고전적인 트리 자료구조라는 점입니다.

  • vLLM은 OS의 메모리 할당(Allocation) 문제를 풀었고,

수학적인 화려함보다 "한정된 GPU 자원을 얼마나 알뜰하게 나눠 쓰고(vLLM), 영리하게 재사용할 것인가(SGLang)"라는 공학적 질문이 혁신을 만든 것입니다.

💡 마치며: 어떤 선택을 해야 할까?

  • "많은 사람에게 동시에 빠르게 서비스해야 한다"면 vLLM이 여전히 정답입니다. 가장 많은 모델과 하드웨어를 지원하는 든든한 표준입니다.

결국 vLLM은 GPU를 꽉 채워 쓰는 기술이고, SGLang은 그 데이터를 영리하게 재사용하는 기술입니다. 2026년의 추론은 이 두 거인의 어깨 위에서 이뤄지고 있습니다.

211