ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Inference

학습된 AI 모델에 새로운 입력을 넣어 예측이나 생성 결과를 계산하는 실행 단계.

최근 수정 2026.08.29 07:31 출처 2

개요

Inference는 학습이 끝난 모델에 새로운 입력을 주고 예측이나 생성 결과를 계산하는 단계다. 학습이 모델의 파라미터를 바꾸는 과정이라면, 추론에서는 보통 고정된 파라미터를 사용해 실제 요청을 처리한다.

서비스 환경

실제 서비스에서는 한 번의 추론만 빠르게 실행하는 것뿐 아니라 여러 사용자의 요청을 묶고, 메모리를 관리하고, 지연시간과 처리량을 함께 최적화해야 한다. MLPerf Inference는 다양한 배포 시나리오에서 학습된 모델을 얼마나 빠르게 실행하는지 비교하기 위한 표준화된 벤치마크를 제공한다.[1]

LLM 추론

LLM 서비스에서는 생성 과정에서 KV Cache가 큰 메모리를 차지할 수 있다. vLLM 연구는 이 캐시를 효율적으로 관리하는 PagedAttention을 제안해 같은 지연시간 수준에서 더 높은 처리량을 목표로 했다.[2] 실제 성능은 GPU, 배치 크기, 입력·출력 길이와 시스템 구현에 따라 달라진다.

SOURCES

출처

  1. MLPerf Inference Benchmark MLCommons / arXiv
    원문 보기 ↗
  2. 원문 보기 ↗