SGLang 서버 띄우기, 그리고 GPU 라인업 이해하기
LLM 추론 엔진 스터디를 시작했다. 4주 8세션 커리큘럼이고, SGLang을 축으로 배칭, KV 캐시, 어텐션 최적화, 벤치마킹까지 다룬다. 1주차 과제는 단순하다. SGLang 서버를 띄우고 요청 하나를 보내 응답을 받는 것.과제 자체는 명령어 두 줄이지만, 준비하면서 정리하게 된 배경 지식이 오히려 많았다. GPU를 어디서 빌릴지, 어떤 카드를 골라야 하는지, 애초에 SGLang이 뭔지. 그 과정을 함께 남긴다.SGLang이란한 줄로 말하면 LLM 추론(서빙) 엔진이다. Ollama, vLLM, TensorRT-LLM과 같은 카테고리다. 학습이 아니라, 이미 학습된 모델을 받아 요청을 최대한 빠르고 많이 처리하는 것이 목적이다.동작 순서는 이렇다.모델 가중치를 GPU에 로드KV 캐시 메모리 풀 할당..
더보기