AI Training과 Inference의 차이

AI 시스템은 크게 학습(Training)과 추론(Inference) 단계로 나눌 수 있습니다. 두 단계는 같은 모델을 다루더라도 인프라 요구사항이 다릅니다.

Training

학습은 대량의 데이터를 사용해 모델의 가중치를 반복적으로 조정하는 과정입니다. 높은 GPU 연산 성능, 큰 메모리, 빠른 GPU 간 통신이 중요합니다.

Inference

추론은 학습이 끝난 모델에 새로운 입력을 넣어 결과를 얻는 과정입니다. 서비스에서는 응답 지연시간, 동시 요청 처리량, 비용 효율성이 핵심 지표가 됩니다.

인프라 관점의 차이

대규모 학습은 여러 GPU와 여러 서버를 묶어 실행하기 때문에 고속 네트워크와 집단 통신 성능이 중요합니다. 반면 추론은 사용자 요청 패턴에 맞춘 확장성과 안정성이 중요합니다.

Training은 모델을 만드는 과정, Inference는 만들어진 모델을 사용하는 과정입니다.