
알고리즘
정보 이론상 불가능해 보이는데 LLM 강화학습(RL)이 대체 왜 잘 돌아갈까?
- 수학적·정보이론적 관점에서 보면 LLM에 강화학습을 적용하는 건 데이터 효율이 극도로 떨어져서 말이 안 되어 보여.
- 그런데도 실제 강화학습을 돌리면 모델 성능이 미친 듯이 올라가는 기현상이 왜 일어나는지 심도 있게 분석한 칼럼이야.
- 사전 학습(Pre-training)으로 이미 확보한 미친 수준의 사전 지식 분포가 강화학습의 탐색 공간을 극단적으로 줄여주기 때문이라는 설명이지.
Hacker News - LLM원문 보기
