추론
Inference
다른 표기: 예측 · 서빙
학습을 끝낸 모델을 실제로 돌려 결과를 얻는 단계.
학습은 한 번 크게 하고, 추론은 사용자가 쓸 때마다 일어납니다. 그래서 서비스 비용은 대부분 추론에서 발생합니다.
체감 속도도 추론에서 결정됩니다. 사진 한 장을 몇 초에 처리하는지, 동시에 몇 명을 받을 수 있는지가 곧 사용자 경험입니다.
줄이는 방법은 모델을 작게 하거나, 계산을 가볍게 바꾸거나, 결과를 저장해 두는 것입니다. 다만 저장은 개인 사진처럼 남기면 안 되는 자료에서는 쓰지 않습니다.
- 비용사용자가 늘수록 추론 비용이 늘어납니다.
- 설계빠른 응답이 필요한 화면과 기다려도 되는 작업을 나눕니다.


