P1-5.2 모델 실행(inference)은 무엇을 실행하는가¶
Section ID:
P1-5.2Version:v2026.07.20
5.1에서는 학습(learning)과 훈련(training)을 구분했습니다. 훈련은 데이터를 사용해 모델 내부 값을 조정하는 절차이고, 학습은 그 결과 특정 과제의 성능이 개선되는 더 넓은 개념입니다.
이번 절에서는 그 다음 질문을 봅니다. 훈련이 끝난 모델을 사용할 때 실제로 실행되는 것은 무엇인지 묻습니다.
AI 문서에서는 이 과정을 보통 inference라고 부릅니다. 지역어로는 흔히 추론 계열 표현으로 옮겨지지만, 여기서는 영어 inference를 함께 둡니다. 번역어 하나가 reasoning, prediction, statistical inference까지 함께 떠올리게 만들 수 있기 때문입니다. 이 용어 혼동은 5.3에서 따로 다룹니다.
이 절에서는 inference를 학습된 값을 사용해 새 입력에서 출력을 만드는 단계로 두고, 그것을 서비스 전체 처리와 구분합니다. 학습, 훈련, 적합의 기본 구분은 5.1에서, reasoning 등 다른 추론 계열 용어와의 충돌은 5.3에서 이어집니다.
이 절에서는 어떻게 받아들이면 좋은가¶
inference는 번역어만 보면 사람의 사고 과정처럼 읽히기 쉽지만, 5.2에서는 다음처럼 풀어 읽습니다.
inference = 학습된 모델을 새 입력에 적용해 출력을 만드는 실행
이 절에서는 모델 실행, 모델 적용, 출력을 만드는 실행에 가깝게 이해합니다. 모델이 생각하거나 판단한다는 느낌을 붙이기보다, 이미 훈련된 계산 구조를 새 입력에 적용해 결과를 만드는 단계로 보는 것입니다.
훈련: 모델을 준비한다. inference: 준비된 모델을 실행한다. 후처리: 모델 출력을 사람이 쓰는 업무 결과로 연결한다.
이 세 줄은 모델이 결과를 계산하는 단계와 서비스가 그 결과를 사용해 일을 처리하는 단계를 나누기 위한 기준입니다. 여기서는 모델 실행과 업무 처리 전체가 같지 않다는 점이 중요합니다.
일상어의 추론 계열 표현과 AI 문서의 inference는 입력 단서에서 어떤 결과를 낸다는 점에서는 비슷합니다. 하지만 사람의 의미 이해, 논리적 reasoning, 통계학의 statistical inference와는 구분해야 합니다. 이 차이는 5.3에서 따로 정리합니다.
5.2는 inference를 수학적으로 설명하는 절이 아닙니다. 행렬 곱과 활성화 함수는 Part 5에서, attention 계산과 디코딩 알고리즘은 P1-11부터 P1-14와 Part 6에서 다룹니다.
또한 5.2는 AI 서비스 아키텍처를 설계하는 절도 아닙니다. API 서버, 캐시, RAG, 도구 호출, 권한 확인, 모니터링은 P1-14와 Part 7에서 다룹니다.
여기서는 더 작은 질문만 다룹니다.
학습된 모델이 새 입력을 받았을 때 어떤 값을 사용해 어떤 출력을 만드는가?
inference를 모델 실행으로 읽는 기준¶
- inference를 훈련된 모델을 사용하는 실행 과정으로 이해합니다.
- inference를
모델 실행,모델 적용,출력을 만드는 실행에 가깝게 풀어 읽습니다. - 훈련(training)과 inference의 차이를 구분합니다.
- inference가 보통 모델 파라미터를 바꾸지 않는다는 점을 이해합니다.
- 전통적 머신러닝의 예측(prediction)과 LLM의 응답 생성(response generation)을 연결해서 봅니다.
- inference 결과가 곧 업무 처리 전체가 아님을 구분합니다.
세 가지 기준¶
여기서는 어려운 계산보다 “지금 모델이 실제로 무엇을 하고 있는가”를 읽습니다. 아래 세 가지를 먼저 가릅니다.
| 기준 | 왜 중요한가 | 이 절에서 이해할 수준 |
|---|---|---|
| inference는 학습된 모델을 새 입력에 적용하는 실행이라는 점 | 추론이라는 번역이 주는 과한 의미를 줄여 줍니다. | 새 입력을 넣어 출력을 받는 단계라고 이해합니다. |
| training과 inference는 다른 단계라는 점 | 학습 중과 사용 중을 섞지 않게 해 줍니다. | training은 내부 값을 바꾸고, inference는 보통 바꾸지 않는다고 봅니다. |
| inference 결과는 서비스 전체 처리와 같지 않다는 점 | 모델 출력과 업무 결정의 차이를 이해하게 해 줍니다. | 모델이 점수나 문장을 만들고, 그 뒤에 정책과 사람 검토가 붙을 수 있다는 점을 봅니다. |
inference, prediction, response generation, 후처리는 초반에 비슷하게 들릴 수 있습니다. 아래처럼 자리만 짧게 구분해 두고 읽으면 됩니다.
| 용어 | 아주 짧은 뜻 | 이 절에서의 역할 |
|---|---|---|
| inference | 학습된 모델을 새 입력에 적용하는 실행 | 모델이 실제 출력을 만드는 중심 단계 |
| prediction | 분류나 점수 예측 같은 모델 출력 | 전통적 머신러닝 쪽 결과 표현 |
| response generation | 토큰을 이어 응답을 만드는 출력 | LLM 쪽 결과 표현 |
| 후처리 | 모델 출력을 사람이 쓰는 결과로 바꾸는 단계 | 라우팅, 정책 확인, 표시 형식 조정 같은 바깥 절차 |
여기서는 inference는 모델 실행, prediction은 예측 결과, response generation은 생성 결과, 후처리는 모델 밖 처리라는 자리 구분을 유지합니다.
inference는 학습된 모델을 적용하는 과정이다¶
Google의 머신러닝 용어집은 전통적인 머신러닝에서 inference를 학습된 모델을 라벨 없는 예시(unlabeled examples)에 적용해 예측(predictions)을 만드는 과정으로 설명합니다. LLM에서는 학습된 모델을 사용해 입력 프롬프트(prompt)에 대한 응답(response)을 생성하는 과정으로 설명합니다.
두 설명은 겉으로 달라 보이지만 공통 구조가 있습니다.
학습된 모델 + 새 입력 -> 출력
고객 문의 분류 모델을 예로 들면 다음과 같습니다.
| 단계 | 예시 |
|---|---|
| 학습된 모델 | 과거 문의와 라벨로 훈련된 분류 모델 |
| 새 입력 | “배송 조회가 안 됩니다.” |
| inference 결과 | 배송 |
LLM 예시로 바꾸면 다음과 같습니다.
| 단계 | 예시 |
|---|---|
| 학습된 모델 | 사전학습과 추가 조정을 거친 언어 모델 |
| 새 입력 | “이 문의에 대한 답변 초안을 작성해 줘.” |
| inference 결과 | 자연어 응답 초안 |
따라서 inference는 “모델을 새로 배우게 하는 과정”이 아니라, 이미 학습된 모델을 사용해 새 입력에 대한 출력을 만드는 과정입니다.
훈련과 inference는 실행 목적이 다르다¶
훈련과 inference는 같은 모델을 다룰 수 있지만 실행 목적이 다릅니다.
| 구분 | 훈련(training) | inference |
|---|---|---|
| 목적 | 모델 내부 값을 조정한다 | 학습된 값을 사용해 출력을 만든다 |
| 입력 | 훈련 데이터, 라벨 또는 학습 신호 | 새 입력, 프롬프트, 관측 데이터 |
| 주요 계산 | 손실 계산, 파라미터 갱신 | 출력 계산, 예측, 생성 |
| 내부 파라미터 | 바뀐다 | 보통 바뀌지 않는다 |
| 결과 | 학습된 모델 | 예측값, 점수, 분류, 응답 |
Google 용어집은 가중치(weight)를 설명하면서, training은 모델의 이상적인 가중치를 정하는 과정이고 inference는 학습된 가중치를 사용해 예측을 만드는 과정이라고 구분합니다.
이 구분이 중요한 이유는 다음과 같습니다.
훈련은 모델을 바꾸는 과정이다. inference는 바뀐 모델을 사용하는 과정이다.
입문자가 “AI가 답변할 때 계속 학습한다”고 생각하기 쉽습니다. 하지만 일반적인 배포 모델은 사용자의 입력을 받을 때마다 내부 파라미터를 즉시 바꾸지 않습니다. 사용자의 질문에 답하는 과정은 대부분 inference입니다.
물론 예외는 있습니다. 온라인 학습(online learning), 지속 학습(continual learning), 사용자 피드백 기반 재훈련, 메모리나 캐시를 사용하는 시스템은 더 복잡합니다. 하지만 이 절의 기본 구분은 여전히 유용합니다.
사용 중 출력 생성 = inference 데이터를 모아 모델을 다시 조정 = training 또는 재훈련
inference에서 실행되는 기본 흐름¶
inference는 모델 종류마다 내부 계산이 다릅니다. 그래도 여기서는 다음 흐름으로 볼 수 있습니다.
새 입력 -> 입력을 모델이 읽을 수 있는 표현으로 변환 -> 학습된 파라미터를 사용해 계산 -> 출력 후보, 점수, 확률, 토큰 등을 생성 -> 사람이 쓰는 형태의 결과로 변환
고객 문의 분류 예시를 조금 더 풀어 보겠습니다.
| 단계 | 설명 |
|---|---|
| 입력 받기 | “배송 조회가 안 됩니다.” |
| 표현 변환 | 문장을 토큰, 벡터, 특징 값 등으로 바꿈 |
| 모델 계산 | 학습된 파라미터를 사용해 각 문의 유형의 점수를 계산 |
| 출력 선택 | 가장 적절한 라벨을 고름 |
| 결과 반환 | 배송 |
이 흐름에서 중요한 점은 모델이 새 입력을 “그 자리에서 새로 학습”하는 것이 아니라는 점입니다. 이미 훈련된 내부 값이 있고, inference는 그 값을 사용해 입력을 출력으로 통과시킵니다.
딥러닝에서는 이런 계산을 순전파(forward pass)라고 부르는 경우가 많습니다. 입력이 모델의 여러 층을 지나 출력으로 계산되는 방향이기 때문입니다. 역전파(backpropagation)는 훈련 때 파라미터를 조정하기 위한 계산이므로, 일반적인 inference 설명에서는 중심이 아닙니다.
출력은 문제 정의에 따라 달라진다¶
inference 결과는 모델이 어떤 과제로 정의되었는지에 따라 달라집니다. Google 용어집은 prediction을 모델의 출력으로 설명하고, 이진 분류 모델의 prediction은 양성 또는 음성 클래스, 다중 분류 모델의 prediction은 하나의 클래스, 선형 회귀 모델의 prediction은 숫자라고 설명합니다.
4.4에서 본 것처럼 출력 정의가 모델링 과제를 결정합니다. inference는 그 정의된 출력을 실제로 만들어 내는 실행입니다.
| 과제 | 입력 | inference 결과 |
|---|---|---|
| 문의 유형 분류 | 문의 문장 | 환불, 배송, 교환 같은 라벨 |
| 배송 지연 예측 | 주문 정보 | 지연 가능성 점수 또는 예상 도착 시간 |
| 이상 거래 탐지 | 거래 정보 | 이상 가능성 점수 |
| 답변 초안 생성 | 문의 문장과 정책 | 자연어 답변 초안 |
| 이미지 분류 | 이미지 | 이미지 클래스 |
따라서 inference를 이해하려면 먼저 “모델이 어떤 출력을 만들도록 정의되었는가?”를 확인해야 합니다.
분류 모델의 inference는 라벨을 낸다. 회귀 모델의 inference는 숫자를 낸다. 생성 모델의 inference는 텍스트, 이미지, 음성 같은 결과를 만든다.
점수와 확률은 최종 결정과 다를 수 있다¶
모델의 inference 결과가 항상 하나의 라벨만은 아닙니다. 많은 모델은 내부적으로 여러 후보의 점수(score)나 확률(probability)을 계산한 뒤, 그중 하나를 선택하거나 사용자에게 보여 줄 형태로 바꿉니다.
예를 들어 문의 분류 모델이 다음 점수를 냈다고 하겠습니다.
| 후보 라벨 | 모델 점수 |
|---|---|
| 배송 | 0.72 |
| 환불 | 0.18 |
| 교환 | 0.07 |
| 기타 | 0.03 |
서비스는 이 결과를 그대로 보여 줄 수도 있고, 가장 높은 점수인 배송만 반환할 수도 있습니다. 또는 점수가 낮거나 애매하면 사람 검토로 넘길 수도 있습니다.
모델 출력: 배송 0.72, 환불 0.18, 교환 0.07, 기타 0.03 서비스 결정: 배송으로 라우팅
여기서 모델 출력과 업무 결정은 같지 않습니다. inference는 모델 출력을 만드는 과정이고, 그 출력을 어떻게 사용할지는 별도의 업무 규칙과 서비스 설계가 결정합니다. 이 경계는 P1-14와 Part 7에서 더 자세히 다룹니다.
사용자에게 보이는 최종 결과도 항상 모델 출력과 같지는 않습니다. 모델은 내부적으로 점수나 후보 라벨을 만들고, 서비스는 그중 하나를 선택해 버튼 문구, 안내 문장, 라우팅 결과처럼 다른 형태로 보여 줄 수 있습니다.
LLM inference는 응답을 만드는 실행이다¶
LLM에서 inference는 분류 모델보다 더 복잡해 보입니다. 사용자가 프롬프트를 입력하면 모델이 자연어 응답을 생성하기 때문입니다.
하지만 큰 틀은 같습니다.
프롬프트 -> 토큰화 -> 학습된 파라미터로 다음 토큰 후보 계산 -> 토큰 선택을 반복 -> 응답 생성
예를 들어 다음 프롬프트를 넣는다고 하겠습니다.
배송 지연 문의에 대한 정중한 답변 초안을 작성해 줘.
LLM은 이 입력을 토큰 단위로 바꾸고, 학습된 파라미터를 사용해 다음에 올 가능성이 높은 토큰 후보들을 계산합니다. 그런 다음 설정된 생성 방식에 따라 토큰을 선택하고, 이 과정을 반복해 문장을 만듭니다.
이 설명은 LLM의 내부 알고리즘을 자세히 설명하려는 것이 아닙니다. 핵심은 LLM에서도 inference가 “학습된 모델을 새 입력에 적용해 출력을 만드는 실행”이라는 점입니다. 토큰화, 디코딩, 샘플링, attention 계산은 P1-11부터 P1-14와 Part 6에서 다시 다룹니다.
이때 temperature, top-p, max tokens 같은 값은 모델이 학습한 내부 파라미터가 아니라 inference 중 출력을 고르는 방식을 조절하는 생성 설정값입니다. 4.3에서 본 것처럼 이 값을 모델 파라미터와 혼동하면 안 됩니다.
LLM inference는 “생각을 읽어 내는 과정”이라기보다, 학습된 모델과 입력 프롬프트, 생성 설정을 사용해 출력 토큰을 만들어 가는 실행 과정으로 보는 편이 안전합니다.
inference는 모델만 실행하는 것이 아닐 수 있다¶
엄밀히 말하면 실제 서비스의 요청 처리에는 모델 계산 외의 단계가 함께 들어갑니다.
요청 수신 -> 입력 검증 -> 전처리 -> 모델 inference -> 후처리 -> 정책 확인 -> 응답 반환
하지만 이 절에서 말하는 inference는 이 전체 서비스 흐름을 뜻하지 않습니다. 여기서는 그중 모델이 학습된 내부 값을 사용해 출력을 계산하는 부분을 가리킵니다.
예를 들어 고객 문의 자동 분류 시스템에서 다음 두 단계는 구분해야 합니다.
| 단계 | 설명 |
|---|---|
| 모델 inference | 문의 문장을 보고 배송 라벨과 점수를 계산 |
| 서비스 처리 | 배송팀으로 라우팅하고, 알림을 보내고, 로그를 남김 |
모델 inference는 서비스 처리의 한 부분일 수 있지만, 서비스 전체와 같지는 않습니다.
작은 예시로 다시 보기¶
5.1의 고객 문의 예시를 이어 보겠습니다.
훈련 데이터: - “환불하고 싶어요.” -> 환불 - “배송이 언제 오나요?” -> 배송 - “상품이 깨져서 왔어요.” -> 교환
훈련이 끝나면 모델 내부에는 입력 표현을 출력으로 바꾸는 값들이 조정되어 있습니다. 이제 새 문의가 들어옵니다.
새 입력: “어제 주문했는데 아직 배송 조회가 안 됩니다.”
inference는 이 입력을 학습된 모델에 적용합니다.
| 단계 | 결과 |
|---|---|
| 입력 표현 변환 | 배송, 조회, 안 됨 같은 단서가 계산 가능한 표현으로 바뀜 |
| 모델 계산 | 학습된 파라미터를 사용해 후보 라벨 점수를 계산 |
| 출력 생성 | 배송 라벨과 점수 반환 |
| 후처리 | 필요하면 배송팀 라우팅이나 사람 검토로 연결 |
여기서 모델은 이 새 문장을 보고 즉시 재훈련되는 것이 아닙니다. 일반적인 inference에서는 학습된 값을 사용해 출력을 만들 뿐입니다.
체크리스트¶
- inference를 학습된 모델을 새 입력에 적용해 출력을 만드는 과정으로 설명할 수 있다.
- 훈련(training)과 inference의 차이를 설명할 수 있다.
- inference 중에는 모델 파라미터가 보통 바뀌지 않는다는 점을 설명할 수 있다.
- 전통적 머신러닝의 prediction과 LLM의 response generation을 같은 큰 구조에서 볼 수 있다.
- 모델 출력과 서비스 결정을 구분할 수 있다.
- inference와 reasoning을 바로 같은 뜻으로 보지 않아야 함을 설명할 수 있다. 이 용어 차이는 5.3에서 따로 정리한다.
- inference는 학습된 모델을 실행해 새 입력에 대한 출력을 만드는 과정이며,
훈련은 내부 값을 바꾸고 inference는 바뀐 값을 사용한다는 점을 설명할 수 있다. - 모델이 훈련되는 시점, 모델이 inference로 실행되는 시점, 모델 출력이 서비스 결정으로 사용되는 시점을 구분할 수 있는가
출처와 참고 자료¶
- Google for Developers, Machine Learning Glossary, 확인 날짜: 2026-06-22.
- scikit-learn developers, Glossary of Common Terms and API Elements, 확인 날짜: 2026-06-22.