SEARCH
AI 지식 검색
RESULTS
#Inference 문서
개념·기술
Latency and Throughput
AI 서비스에서 한 요청의 응답 시간과 일정 시간 동안 처리할 수 있는 작업량을 구분해 보는 성능 지표.
개념·기술
GPU
많은 연산을 병렬로 처리하도록 설계된 프로세서로 현대 AI 학습과 추론의 핵심 가속 하드웨어 중 하나.
개념·기술
KV Cache
자동회귀 Transformer가 이전 토큰의 key·value 표현을 재사용하기 위해 저장하는 추론 메모리.
개념·기술
Inference
학습된 AI 모델에 새로운 입력을 넣어 예측이나 생성 결과를 계산하는 실행 단계.
개념·기술
Quantization
모델의 가중치나 연산 표현에 더 낮은 정밀도를 사용해 메모리와 계산 비용을 줄이는 모델 압축 기법 계열.