개요
Inference는 학습이 끝난 모델에 새로운 입력을 주고 예측이나 생성 결과를 계산하는 단계다. 학습이 모델의 파라미터를 바꾸는 과정이라면, 추론에서는 보통 고정된 파라미터를 사용해 실제 요청을 처리한다.
서비스 환경
실제 서비스에서는 한 번의 추론만 빠르게 실행하는 것뿐 아니라 여러 사용자의 요청을 묶고, 메모리를 관리하고, 지연시간과 처리량을 함께 최적화해야 한다. MLPerf Inference는 다양한 배포 시나리오에서 학습된 모델을 얼마나 빠르게 실행하는지 비교하기 위한 표준화된 벤치마크를 제공한다.[1]
LLM 추론
SOURCES
출처
-
MLPerf Inference Benchmark MLCommons / arXiv원문 보기 ↗
-
Efficient Memory Management for Large Language Model Serving with PagedAttention UC Berkeley / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS