아키텍처
LLM 추론도 깃(Git)처럼 브랜치 딴다? 시간과 돈 아끼는 신박한 기술
- LLM 에이전트를 돌릴 때 똑같은 프롬프트를 반복 계산하는 낭비를 줄여주는 'Thaw'라는 기술이 나왔어.
- 실행 중인 상태를 스냅샷으로 찍어서 여러 갈래로 분산(Fork)시키는데, 중복 계산 없이 바로 다음 단계로 넘어가.
- 속도는 수백 배 빨라지고 비용은 획기적으로 줄어드니, 병렬 추론이 필요한 상황에선 거의 치트키급이야.
Hacker News - LLM원문 보기


