ORBiS TREE DOCUMENT
개념·기술 →Latency and Throughput
AI 서비스에서 한 요청의 응답 시간과 일정 시간 동안 처리할 수 있는 작업량을 구분해 보는 성능 지표.
개요
Latency는 하나의 요청이 들어온 뒤 결과가 나올 때까지 걸리는 시간을 나타내고, Throughput은 일정 시간 동안 시스템이 처리할 수 있는 요청이나 작업의 양을 나타낸다. 두 지표는 관련되어 있지만 같은 의미가 아니며, 시스템 설정에 따라 서로 절충 관계가 생길 수 있다.
벤치마크에서의 측정
MLPerf Inference는 실제 배포 환경을 반영하기 위해 여러 요청 패턴과 시나리오를 정의하고 지연시간 제약과 처리량 지표를 함께 사용한다.[1] 같은 하드웨어라도 배치 크기와 요청 도착 패턴, 모델과 정확도 조건이 달라지면 결과를 직접 비교하기 어렵다.
LLM 서비스
SOURCES
출처
-
MLPerf Inference: Datacenter MLCommons원문 보기 ↗
-
Efficient Memory Management for Large Language Model Serving with PagedAttention UC Berkeley / arXiv원문 보기 ↗
KNOWLEDGE LINKS