사전 학습(pre-training)을 마친 언어 모델은 백과사전식 지식만 가득하고 사회성은 전혀 없는 ’다음 토큰 예측기’에 불과하다. 질문에 어떻게 답해야 하는지, 유해한 요청을 어떻게 거절해야 하는지, JSON 포맷을 어떻게 맞춰야 하는지, 수학 문제를 어떻게 논리적으로 풀어야 하는지 전혀 알지 못한다. 그저 글을 그럴듯하게 이어 쓸 뿐이다.
그 상태를 바꾸어놓는 것이 바로 **사후 학습(post-training)**이다. 사전 학습을 거친 가공되지 않은 원초적 역량을 다듬어 인간의 의도에 부합(align)하고, 실질적으로 유용하며, 점진적으로 추론 능력까지 갖추도록 벼려내는 단계다. 그리고 이 단계에서 어떤 기법을 선택하느냐에 따라 단순한 챗봇이 될지, 뛰어난 코더가 될지, 자율적인 에이전트가 될지가 결정된다.
현대의 파이프라인은 각기 다른 병목을 해결하는 네 가지 기술군을 층층이 쌓아 올린다.
SFT: 말로 하지 말고 직접 보여주기
지도 미세조정(Supervised Fine-Tuning, SFT)은 모든 것의 기초다. 모델에게 수천, 수만 쌍의 (프롬프트, 이상적인 응답) 데이터를 제공하고 이를 모방하도록 훈련한다. 표준적인 크로스 엔트로피 손실(cross-entropy loss)을 사용하며, 특별히 이질적인 기법은 아니다.
SFT가 가르치는 것: 출력 포맷, 어조, 지시 따르기(instruction following), 특정 도메인의 문서 작성 방식이다. 깔끔한 JSON을 출력하거나, 올바른 규격에 맞추어 CAPA(시정 및 예방조치) 조사 보고서를 작성하거나, 폭탄 제조법을 묻는 위험한 요청을 단호히 거절하는 모델을 만들고 싶다면 SFT가 바로 그 출발점이다.
LIMA 논문은 놀라운 사실 하나를 보여주었다: 극도로 뛰어난 품질의 데이터 수천 개가 어중간한 데이터 수백만 개보다 훨씬 뛰어난 성능을 낸다는 점이다. 데이터의 품질이 모든 것을 압도한다.
한계점: SFT는 행동 복제(behavioral cloning)에 불과하다. 모델은 눈앞에 주어진 예시를 모방하는 법만 배울 뿐, 왜 특정 응답이 그럴듯해 보이는 다른 응답보다 더 나은지 그 ’이유’를 배우지는 못한다. “A가 B보다 낫다”는 상대적 비교 메커니즘이 없으며, 프롬프트당 오직 단 하나의 정답만을 볼 뿐이다.
신입 품질보증(QA) 담당자에게 이미 완료된 수백 건의 조사 보고서를 보여주며 교육하는 상황을 떠올려보자. 그들은 문서 양식을 배울 것이고 문장의 표현 방식을 그대로 따라 할 것이다. 하지만 만약 예시 문서들이 장비 결함이 명백한 상황에서도 하나같이 “근본 원인: 작업자 부주의”라고 적혀 있었다면, 모델 역시 그 오류를 아무런 의심 없이 그대로 재생산할 것이다. SFT는 라벨의 진위나 품질에 의문을 품지 않는다.
또한 치명적인 특성이 있다: SFT는 도메인 내부(in-domain)의 정확도는 끌어올리지만, 분포 밖(out-of-distribution)에 대한 일반화 능력은 오히려 떨어뜨릴 수 있다. 좁은 범위의 예시로 미세조정을 거듭할수록 모델은 낯선 입력을 처리하는 데 취약해진다. 이는 2026년 RL 사후 학습 서베이 논문들이 지목한 가장 중요한 발견 중 하나이며, 진지한 파이프라인들이 단순 SFT에 머무르지 않는 이유이기도 하다.
선호도 최적화: 취향을 가르치다
SFT가 무엇을 말할지 가르친다면, 선호도 최적화(Preference Optimization)는 무엇이 더 나은지를 가르친다.
전통적인 접근법은 인간 피드백 기반 강화학습(RLHF)이었다. 모델 출력물에 대한 인간의 선호도 순위를 수집하고, 보상 모델(reward model)을 훈련한 뒤, PPO(Proximal Policy Optimization)를 사용해 그 보상 모델에 맞추어 정책(policy)을 최적화하는 방식이다. 효과는 입증되었지만 구조가 극도로 복잡하다: 메모리에 네 개의 개별 모델(정책 모델, 참조 모델, 보상 모델, 크리틱 모델)을 동시에 올려야 하며, PPO는 악명 높을 정도로 학습이 불안정하다.
DPO와 ORPO는 이 복잡성을 단숨에 우회한다.
DPO: 보상 모델이 필요 없다
직접 선호도 최적화(Direct Preference Optimization, DPO)는 우아한 수학적 통찰에서 출발한다: 최적의 RLHF 정책과 보상 함수 사이에는 닫힌 형식(closed-form)의 수학적 관계가 존재한다는 점이다. 이를 이용하면 보상 모델을 통째로 생략하고, 선호/비선호 응답 쌍(chosen, rejected) 데이터 위에서 직접 정책을 최적화할 수 있다.
손실 함수는 다음과 같다:
$$\mathcal{L}{\text{DPO}} = -\log \sigma\left(\beta \log \frac{\pi\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)}\right)$$
쉽게 풀자면: 참조 모델(reference model) 대비 선호된 응답($y_w$)의 확률은 높이고, 거부된 응답($y_l$)의 확률은 낮춘다. 여기서 참조 모델(대개 직전 SFT 체크포인트)은 정책이 엉뚱한 방향으로 표류하거나 텍스트가 붕괴하지 않도록 붙잡아주는 닻(anchor) 역할을 한다.
DPO는 안정적이고 이론적 이해가 탄탄하여 2024~2025년 선호도 정렬의 사실상 표준(de facto standard)으로 자리 잡았다. 다만 “우도 변위(likelihood displacement)“라는 알려진 실패 모드가 있다. 선택된 응답과 거부된 응답 사이의 확률 비율은 의도한 대로 벌어지지만, 둘 다 절대적인 확률 측면에서는 높아지지 않는 현상이다. 모델이 텍스트 생성을 실제로 더 잘하게 되는 것이 아니라, 단지 두 답변의 순위를 맞히는 법만 학습하는 꼴이다.
ORPO: 단일 단계, 참조 모델 없는 최적화
ORPO(Odds Ratio Preference Optimization)는 한 걸음 더 나아간다. SFT와 선호도 정렬을 단 한 번의 학습 패스로 통합하고, 참조 모델조차 완전히 제거해 버렸다. 비결은 표준 SFT 손실 함수에 승산비(odds-ratio) 페널티 항을 결합한 것이다:
$$\mathcal{L}{\text{ORPO}} = \mathcal{L}{\text{SFT}} + \lambda \cdot \mathcal{L}_{\text{OR}}$$
SFT 항은 모델의 언어적 유창성을 유지하고, 오즈비 항은 선택된 응답을 밀어올리고 거부된 응답을 끌어내린다. 참조 모델이 필요 없으므로 DPO 대비 GPU 메모리를 절반만 사용하며, 두 단계로 나뉘던 학습을 하나로 압축할 수 있다.
트레이드오프: ORPO는 비교적 최신 기술이며 대규모 환경에서의 검증 이력이 DPO보다는 적다. 하지만 단일 GPU에서 7B 모델을 미세조정하는 등 자원이 제한된 환경에서는 압도적으로 효율적인 선택지다.
언제 무엇을 써야 하는가: 이미 탄탄한 SFT 모델이 있고 규제 문서 스타일처럼 검증된 행동 양식에서 크게 벗어나지 않기를 원한다면 참조 모델이라는 닻을 가진 DPO가 안전하다. 밑바닥부터 시작해 단 한 번의 학습으로 끝내고 싶다면 ORPO가 적합하다.
지식 증류: 모범생의 답안을 훔치다
지식 증류(Distillation)는 학습 알고리즘이라기보다는 데이터 확보 전략에 가깝다. 거대하고 값비싼 교사(Teacher) 모델을 활용하여, 작고 저렴한 학생(Student) 모델을 위한 학습 데이터를 생성하는 방식이다.
오늘날 가장 흔한 형태는 다음과 같다: 뛰어난 교사 모델(GPT-4, Claude, DeepSeek-R1 등)에 프롬프트를 넣어 수천, 수만 개의 고품질 응답이나 추론 과정(reasoning traces)을 생성한다. 그리고 학생 모델에게 이 출력물을 SFT 방식으로 학습시킨다. DeepSeek-R1-Distill-Qwen-7B가 바로 이런 방식으로 탄생했다. 오늘날 대부분의 오픈소스 모델들이 초기 역량을 확보하는 핵심 비결이다.
학생 모델이 직접 응답을 생성하고 교사 모델이 이를 첨삭 교정해 주는 온폴리시 증류(on-policy distillation) 기법도 있다. 이는 노출 편향(exposure bias) 문제를 해결해 준다. 일반적인 증류 과정에서 학생은 교사의 완벽한 모범 답안만 볼 뿐 자신의 실수 장면을 보지 못하기 때문에 실수로부터 회복하는 법을 배우지 못한다. 연구에 따르면 학생이 생성한 텍스트를 바탕으로 교사가 지도하는 방식(Distillation by Student)이 단순 교사 답안 복제 방식보다 최대 6% 더 높은 성능을 보였다.
물론 한계는 명확하다: 학생 모델이 교사의 실력을 안정적으로 뛰어넘을 수는 없다. 하지만 400B 이상의 거대 모델로부터 증류된 7B 모델은, 극히 일부에 불과한 추론 비용만으로도 교사 모델 역량의 놀라운 부분을 흡수해 낸다. 엣지 디바이스 배포나 로컬 환경에서의 실행을 고려한다면 지식 증류는 필수적인 경로다.
최근의 진화: 증류 기반 강화학습(Distilled RL) — 먼저 추론 과정을 SFT로 증류한 다음, 학생 모델 스스로 강화학습을 수행하도록 만드는 방식이다. 이는 둘 중 어느 하나만 단독으로 적용했을 때보다 훨씬 뛰어난 성능을 낸다.
강화학습: 시행착오를 통한 학습
진정한 마법이 시작되는 곳이 바로 여기다. SFT와 선호도 최적화는 고정된 정적 데이터(static data)를 다룬다. 반면 강화학습(RL)은 모델이 스스로 **탐색(explore)**하도록 만든다. 모델이 여러 응답을 자유롭게 생성해 보고, 점수를 받고, 보상을 극대화하는 방향으로 자신의 정책을 갱신해 나간다. 이를 통해 모델은 인간이 한 번도 보여준 적 없는 새로운 문제 해결 전략을 스스로 발견해 낼 수 있다.
LLM에 적용되는 RL 프레임워크: 모델은 에이전트(agent), 프롬프트는 환경(environment), 생성되는 토큰들은 행동(action), 그리고 보상 함수(reward function)는 그 결과물을 채점하는 심판이다.
PPO: 비싸고 다루기 힘든 고전
PPO는 초기 RLHF 시대를 이끈 핵심 주역이었다. 각 토큰 위치에서 기대되는 미래 보상을 추정하기 위해 별도의 크리틱(critic) 모델을 학습시키고, 클리핑된 중요도 샘플링(clipped importance sampling)을 통해 정책을 갱신한다. 효과는 뛰어나지만 네 개의 모델을 메모리에 동시에 올려야 하며, 학습 초기에는 크리틱 모델의 캘리브레이션이 엉망인 경우가 많다. 비용이 막대하고, 불안정하며, 조율해야 할 하이퍼파라미터가 너무 많다.
GRPO: 크리틱을 과감히 버리다
2024년 DeepSeek이 제안한 GRPO(Group Relative Policy Optimization)는 RLHF 이후 사후 학습 분야에서 가장 파급력 있는 혁신이다. 크리틱 모델을 완전히 제거해 버렸기 때문이다.
메커니즘은 단순하면서도 우아하다: 각 프롬프트에 대해 모델이 여러 개의 응답 그룹(8개~64개)을 샘플링한다. 보상 함수를 통해 각 응답에 점수를 매긴다. 그런 다음 **그룹 내 상대적 우위(advantage)**를 계산한다:
$$\hat{A}_i = \frac{r_i - \text{mean}(r)}{\text{std}(r)}$$
그룹 자체가 곧 베이스라인이 된다. 별도로 가치 함수(value function)나 크리틱 모델을 학습시킬 필요가 없다. 이로 인해 막대한 연산량을 절감할 수 있으며, 학습 불안정성의 주된 요인을 원천 제거했다.
결정적인 순간: DeepSeek-R1은 단순한 이진 보상(수학 문제 정답 여부)만을 부여한 GRPO를 통해, 모델이 스스로 생각의 사슬(Chain-of-Thought) 추론, 자체 수정, 되짚기(backtracking)를 자발적으로 터득한다는 사실을 증명해 보였다. 아무도 모델에게 “단계별로 생각하라”고 가르치지 않았다. 모델은 깊이 추론하는 것이 결과적으로 보상을 받는 데 유리하다는 사실을 스스로 발견하고 자발적으로 사고하기 시작한 것이다. 업계 전체에 강화학습이야말로 범용 추론으로 가는 길이라는 확신을 심어준 “유레카의 순간”이었다.
GSPO: GRPO의 불안정성을 잡다
그러나 GRPO에도 약점이 있다: 토큰 단위로 중요도 샘플링 비율을 계산한다는 점이다. 깊은 신경망이나 MoE(Mixture-of-Experts) 구조에서는 토큰 단위의 비율에 심한 노이즈가 낀다. 그래디언트 업데이트가 일어날 때마다 전문가 라우팅 경로가 흔들린다. 동일한 롤아웃에 대해서도 이전 정책과 새 정책 사이에 약 10%의 활성 전문가가 달라진다. 긴 추론 사슬에 걸쳐 이 노이즈가 누적되면 극심한 학습 불안정이 발생하고 모델이 붕괴하기에 이른다.
2025년 Qwen 팀이 제안한 GSPO는 이를 시퀀스 단위(sequence-level) 중요도 비율로 전환하여 해결했다:
$$\rho_{\text{seq}} = \exp\left(\frac{1}{|y|}\sum_t \log \frac{\pi_\theta(y_t|x,y_{<t})}{\pi_{\theta_{\text{old}}}(y_t|x,y_{<t})}\right)$$
이는 토큰별 비율의 기하평균으로, 전체 시퀀스가 이전 정책에 비해 얼마나 달라졌는지를 나타내는 단 하나의 단일 지표다. 클리핑, KL 발산, 최적화가 모두 시퀀스 단위에서 수행된다. 그 결과 특히 MoE 모델에서 학습 안정성이 비약적으로 향상되었다. “Routing Replay” 같은 복잡한 엔지니어링 꼼수를 부릴 필요가 없어졌다. Qwen3가 바로 이 GSPO를 통해 학습되었다.
DAPO 및 그 외의 발전들
DAPO(바이트댄스/칭화대, 2025)는 장기 추론을 위한 네 가지 보완책을 추가했다: 엔트로피 붕괴를 막기 위한 비대칭 클리핑, 각 프롬프트가 반드시 정답과 오답을 모두 포함하도록 만드는 동적 샘플링, 지나치게 긴 출력을 제어하는 보상 셰이핑 등이다. DAPO는 Qwen2.5-32B를 학습시켜 DeepSeek-R1-Zero를 50%나 적은 스텝만으로 뛰어넘었다.
사후 학습 기법의 거대한 진화 방향은 명확하다: 매 세대마다 중간 대리자(proxy)를 하나씩 제거해 나가고 있다. PPO는 크리틱과 보상 모델을 필요로 했다. DPO는 보상 모델을 없앴다. GRPO는 크리틱을 없앴다. ORPO는 참조 모델을 없앴다. GSPO는 복잡한 토큰별 샘플링을 단순화했다. 매 단계마다 인프라 복잡성은 줄어들면서 역량은 더욱 강력해지고 있다.
실무에서는 이들을 어떻게 쌓아 올리는가
현대의 사후 학습은 다단계 파이프라인으로 구성된다:
기반 모델 (Base Model)
→ SFT (형식, 스타일, 지시 따르기 확립)
→ 선호도 최적화 (DPO/ORPO를 통한 가치 정렬)
→ 강화학습 (GRPO/GSPO를 통한 추론 및 도구 사용 극대화)
→ [선택 사항] 효율적인 배포 모델로의 지식 증류
모든 파이프라인이 이 단계를 전부 거쳐야 하는 것은 아니다. 목표에 따라 선택이 달라진다:
| 목표 | 권장 기법 | 이유 |
|---|---|---|
| 지시 따르기 기본기 확립 | SFT | 단순하고 안정적이며 출력 형식을 확실히 잡아줌 |
| 인간 선호도에 맞춘 가치 정렬 | DPO | 별도 보상 모델 없이 오프라인 데이터로 안정적 정렬 |
| 적은 리소스로 단일 단계 정렬 | ORPO | SFT와 선호도 최적화를 한 번의 학습으로 해결 |
| 경량 모델로의 역량 이전 | 지식 증류 | 거대 모델 대비 10% 미만의 비용으로 유사 성능 달성 |
| 복잡한 추론, 수학, 코드 생성 | GRPO / GSPO | 훈련 데이터를 뛰어넘는 새로운 문제 해결 전략 발견 |
| MoE 구조에서의 극대화된 학습 안정성 | GSPO | 시퀀스 단위 최적화로 라우팅 드리프트 극복 |
AI 에이전트 구축에 시사하는 점
만약 당신이 AI 에이전트를 만들고 있다면—특히 생명과학이나 금융처럼 규제가 엄격한 도메인이라면—어떤 사후 학습 기법을 선택하느냐는 시스템 검증(validation)에 결정적인 영향을 미친다:
SFT와 지식 증류는 비교적 결정론적(deterministic)이며 문서화와 결과 재현이 용이하다. CSV나 GxP 규제 준수 관점에서 가장 방어하기 쉬운 방식이다.
DPO / ORPO는 버전 관리가 필요한 선호도 데이터셋과 참조 모델이 추가된다. 규제 검증 부담은 중간 수준이다.
**완전한 강화학습(GRPO / GSPO)**은 확률적 롤아웃과 보상 모델의 동작에 의존하기 때문에 검증하기가 가장 까다롭다. 추론 집약적 작업에는 필수적이지만 감사 추적(audit trail)을 입증하는 과정이 훨씬 복잡해진다.
실무적인 권장 사항: 먼저 철저히 검증된 문서를 바탕으로 RAG를 구축하라. 문서 구조와 전문 용어 정착을 위해 SFT를 적용하라. 리뷰어의 피드백 취향을 반영하기 위해 DPO를 거쳐라. 이를 효율적인 로컬 모델로 증류하라. 그리고 정답 여부가 자동으로 확실히 측정될 수 있는 명확한 문제에 한해서만 강화학습을 도입하라.
결론
사후 학습은 이제 모델의 역량을 좌우하는 가장 치열한 전장이 되었다. 메타를 비롯한 주요 연구진의 발표에 따르면, 사후 학습의 개선만으로도 벤치마크 성능을 20~40% 끌어올릴 수 있다. 사전 학습 단계에서 모델 스케일링만으로 이 정도 격차를 벌리려면 천문학적인 연산 비용이 추가로 투입되어야 한다.
기술의 최전선은 명확하다: 검증 가능한 보상과 결합된 강화학습은 SFT나 단순 선호도 정렬이 구조적으로 도달할 수 없는 깊은 추론의 영역을 열어젖히고 있다. 그렇다고 SFT나 선호도 최적화가 무용해진 것은 아니다. 그것들은 강화학습이라는 도약이 가능하도록 발판을 놓아주는 든든한 기초다. 2025~2026년 벤치마크를 장악하고 있는 모델들은 단순히 덩치만 큰 모델들이 아니다. 그들은 더 똑똑하고 정교하게 설계된 사후 학습 레시피를 통해 완성된 모델들이다.
대리자를 없애고 파이프라인을 단순화하는 진화의 흐름은 계속되고 있다. 이제 문제는 당신의 모델에 사후 학습이 필요한가가 아니다. 어떤 단계를, 어떤 순서로 배치할 것이며, 각 단계에 얼마만큼의 컴퓨팅 자원을 투입할 것인가의 문제다.