ORBiS Tree

SEARCH

AI 지식 검색

RESULTS

#Inference 문서

개념·기술

Latency and Throughput

AI 서비스에서 한 요청의 응답 시간과 일정 시간 동안 처리할 수 있는 작업량을 구분해 보는 성능 지표.

#Benchmark#Inference#Latency#Throughput
개념·기술

GPU

많은 연산을 병렬로 처리하도록 설계된 프로세서로 현대 AI 학습과 추론의 핵심 가속 하드웨어 중 하나.

#CUDA#GPU#Hardware#Inference
개념·기술

KV Cache

자동회귀 Transformer가 이전 토큰의 key·value 표현을 재사용하기 위해 저장하는 추론 메모리.

#Inference#KV Cache#LLM#Transformer
개념·기술

Inference

학습된 AI 모델에 새로운 입력을 넣어 예측이나 생성 결과를 계산하는 실행 단계.

#Deployment#Inference#LLM#Serving
개념·기술

Quantization

모델의 가중치나 연산 표현에 더 낮은 정밀도를 사용해 메모리와 계산 비용을 줄이는 모델 압축 기법 계열.

#Inference#LLM#Model Compression#Quantization