Chain of Thought (CoT) 단계별 추론
중간 풀이를 유도하는 CoT의 동작 방식과 모델 규모·과제에 따른 효과, 제거 연구의 해석 범위
Chain of Thought는 답에 이르는 중간 단계를 예시나 지시로 유도하는 프롬프팅 기법입니다.
개념
Chain of Thought(CoT)는 대규모 언어 모델(LLM)이 최종 답 전에 중간 추론 단계를 생성하도록 유도합니다. Wei 외(2022)는 예시에 풀이를 포함하는 few-shot CoT를 제안했습니다. Kojima 외(2022)는 "Let's think step by step"만 덧붙이는 zero-shot CoT를 보였습니다.
| 방식 | 프롬프트에 넣는 것 | 논문의 대표 설정 |
|---|---|---|
| 표준 프롬프팅 | 문제와 최종 답 | 직접 답변 기준선 |
| few-shot CoT | 문제, 중간 풀이, 최종 답 | Wei 외의 주요 실험 |
| zero-shot CoT | 단계별 풀이를 요구하는 짧은 지시 | Kojima 외의 실험 |
다단계 문제에서는 앞 단계의 결과가 다음 단계 입력이 됩니다. 예를 들어 식당에 18개 테이블마다 쟁반 6개가 있고 37개를 반납했다면, 전체 108개에서 37개를 빼 71개라는 순서가 필요합니다.
규모에 따른 효과
Wei 외의 실험에서 CoT 이득은 모델 규모가 커질수록 뚜렷해졌습니다. 작은 모델은 그럴듯하지만 논리적으로 이어지지 않는 풀이를 만들기도 했으므로, CoT를 모든 모델에 적용되는 보장으로 볼 수 없습니다.
| 모델 조건 | 관찰된 경향 | 해석 범위 |
|---|---|---|
| 작은 모델 | 성능 변화가 작거나 풀이 품질이 불안정함 | 단계 생성만으로 능력이 생기지 않음 |
| 큰 모델 | 복잡한 산술·상식 추론에서 성능이 개선됨 | 논문이 평가한 모델과 과제에 한정됨 |
실험과 제거 연구
Wei 외(arXiv:2201.11903)는 PaLM 540B의 GSM8K 성능이 표준 프롬프팅 17.9%에서 CoT 56.9%로 올랐다고 보고했습니다. StrategyQA에서는 75.6%를 기록했지만, 수치는 해당 모델과 few-shot 예시 조건의 결과입니다.
| 과제 | 표준 프롬프팅 | few-shot CoT | 출처 범위 |
|---|---|---|---|
| GSM8K | 17.9% | 56.9% | PaLM 540B, Wei 외 2022 |
| StrategyQA | 논문의 비교 기준선 | 75.6% | PaLM 540B, Wei 외 2022 |
제거 연구는 자연어 풀이의 역할을 과제별로 나눠 보여줍니다. 수식만 제시한 변형은 GSM8K에서 자연어 풀이보다 이득이 작았지만, 한두 단계 산술 데이터셋에서는 표준 프롬프팅보다 개선됐습니다.
| 변형 | 관찰 | 해석 |
|---|---|---|
| 수식만 제시 | GSM8K 이득은 작고, 짧은 산술 과제에서는 개선 | 자연어 설명의 필요성이 과제 복잡도에 따라 달라짐 |
| 의미 없는 토큰 추가 | CoT 수준의 개선을 재현하지 못함 | 출력 길이 증가만으로 설명되지 않음 |
| 답 뒤에 풀이 배치 | 풀이를 답 앞에 둔 조건보다 효과가 작음 | 중간 단계가 답 생성에 먼저 쓰여야 함 |
강건성과 일반화
저자들이 각각 작성한 예시와 GSM8K에서 무작위로 고른 예시도 성능 개선을 보였습니다. 마지막 글자 연결과 동전 뒤집기에서는 학습 예시보다 긴 입력으로 일반화했지만, 이는 논문이 고른 합성 과제의 결과입니다.
한계와 발전
CoT 출력은 그 자체로 정답 증명이 아닙니다. 모델이 잘못된 중간 단계를 유창하게 만들 수 있고, 긴 풀이에는 토큰 비용과 지연이 따릅니다.
| 한계 | 실무 대응 |
|---|---|
| 작은 모델과 단순 과제에서 이득이 제한됨 | 기준선과 CoT를 같은 평가 세트에서 비교 |
| 중간 단계가 사실이라는 보장이 없음 | 계산기·검색·코드 실행으로 검증 |
| 풀이가 길수록 비용과 지연이 증가함 | 문제 난이도에 따라 추론 예산 제한 |
CoT 이후 기법은 서로 다른 결함을 보완합니다. ReAct는 도구 행동을 결합하고, Tree of Thought는 여러 경로를 탐색하며, Reflexion은 실패 원인을 메모리에 남깁니다.
관련 개념
- Tree of Thought(ToT): 여러 추론 경로를 확장하고 평가합니다.
- ReAct: 추론 사이에 외부 도구 호출을 넣습니다.
- Reflexion: 실패에서 얻은 교훈을 다음 시도에 사용합니다.
정리
CoT는 중간 풀이를 먼저 생성해 다단계 문제의 부분 결과를 연결합니다. Wei 외의 결과는 큰 모델의 복잡한 추론 과제에서 효과를 보였으며, 수식만 제시한 제거 연구의 결과는 과제 길이에 따라 달랐습니다. 따라서 모델 규모와 문제 난이도를 기준선과 함께 평가해야 합니다. 생성된 풀이도 틀릴 수 있으므로 외부 도구나 테스트로 최종 답을 검증해야 합니다.