[2026-1] 이루가 - Improving Factuality and Reasoning in LanguageModels through Multiagent Debate
논문 링크: https://arxiv.org/abs/2305.14325
Improving Factuality and Reasoning in Language Models through Multiagent Debate
Large language models (LLMs) have demonstrated remarkable capabilities in language generation, understanding, and few-shot learning in recent years. An extensive body of work has explored how their performance may be further improved through the tools of p
arxiv.org
Abstract
- 연구 배경
- 최근 Large Language Models (LLMs)은 자연어 생성, 언어 이해, few-shot learning에서 뛰어난 성능을 보이고 있음
- 기존 연구들은 LLM의 성능을 향상하기 위해 다양한 prompting 기법을 활용함
- Verification
- Self-consistency
- Intermediate scratchpad
- 핵심 아이디어
- 본 논문은 기존 prompting 방식과 상호보완적인 방법으로 Multi-Agent Debate를 제안함
- 여러 개의 LLM 인스턴스가 각각 독립적으로 답변과 추론 과정을 생성함
- 이후 여러 라운드에 걸쳐 서로의 답변과 추론을 검토하고 토론함
- 토론 결과를 바탕으로 각 에이전트가 자신의 답변을 수정하며, 최종적으로 공통된 답에 도달함
- 주요 연구 결과
- 제안한 토론 방식은 다양한 과제에서 수학적 추론 능력을 크게 향상함
- 전략적 판단이 필요한 문제에서도 strategic reasoning 성능이 개선됨
- 생성된 답변의 사실적 정확성(factual validity)도 향상됨
- 기존 LLM에서 자주 발생하는 다음 문제를 감소시킴
- 잘못된 추론에 기반한 답변
- 사실과 다른 정보 생성
- Hallucination
- 방법의 장점
- 모델 내부 구조나 파라미터에 접근할 필요 없이 기존 black-box LLM에 바로 적용할 수 있음
- 논문에서 다룬 모든 과제에 대해 동일한 절차와 prompt를 사용함
- 특정 과제에 맞춘 별도의 모델 학습이나 복잡한 설계가 필요하지 않음
- 연구 의의
- 여러 모델이 서로 토론하는 “society of minds” 방식이 단일 LLM의 한계를 보완할 수 있음을 보여줌
- 이러한 접근법은 향후 LLM의 추론, 언어 생성, 언어 이해 능력을 더욱 발전시킬 가능성이 있음
1. Introduction
1.1 연구 배경
- 최근 Large Language Models (LLMs)은 다음과 같은 영역에서 뛰어난 성능을 보여줌
- 자연어 생성
- 언어 이해
- Few-shot learning
- LLM은 인터넷에서 수집된 방대한 텍스트 데이터를 기반으로 학습됨
- 그러나 인터넷 데이터의 품질과 사실적 정확성은 항상 보장되지 않음
- 이로 인해 현재의 LLM은 다음과 같은 문제를 보일 수 있음
- 사실이 아닌 내용을 확신 있게 생성하는 hallucination
- 추론 과정에서 근거 없이 비약하는 현상
- 논리적으로 타당하지 않은 답변 생성
1.2 기존 접근법의 한계
- 기존 연구들은 LLM의 사실성과 추론 능력을 향상하기 위해 다양한 방법을 제안함
- Few-shot 또는 zero-shot Chain-of-Thought
- Verification
- Self-consistency
- Intermediate scratchpad
- Reflection
- 그러나 이러한 방법들은 대부분 하나의 모델 인스턴스가 자신의 답변을 생성하고 검토하는 방식임
- 즉, 단일 모델이 처음부터 잘못된 추론 방향을 선택하면 자신의 오류를 충분히 발견하지 못할 가능성이 있음
1.3 제안 방법: Multi-Agent Debate
- 본 논문은 The Society of Mind와 multi-agent setting에서 영감을 받은 새로운 접근법을 제안함
- 핵심 아이디어
- 여러 개의 LLM 인스턴스를 각각 하나의 agent로 사용
- 각 에이전트가 독립적으로 답변과 추론 과정을 생성
- 서로의 답변을 읽고 비판하며 자신의 답변을 반복적으로 수정
- 여러 차례의 토론을 거쳐 하나의 공통된 최종 답변에 도달
- 기존 기법을 대체하는 것이 아니라, 기존 prompting 기법과 함께 사용할 수 있는 상호보완적인 접근법임
1.4 Debate 진행 과정
- 사용자로부터 하나의 query가 주어짐
- 여러 LLM 에이전트가 각각 독립적인 candidate answer를 생성함
- 각 에이전트가 다른 모든 에이전트의 답변과 추론 과정을 확인함
- 다른 에이전트의 답변에서 오류나 불일치하는 부분을 비판함
- 비판과 토론 내용을 바탕으로 자신의 답변을 수정함
- 이러한 과정을 여러 round에 걸쳐 반복함
- 에이전트들이 최종적으로 하나의 공통된 답변에 수렴함
- 이 과정에서 각 에이전트는 다음 두 가지 기준을 모두 만족하는 답변을 생성하게 됨
- 자신의 내부적인 검토 기준에서 타당한 답변
- 다른 에이전트의 답변과 비교했을 때도 합리적인 답변
- 여러 에이전트로 구성된 집단은 최종 답을 결정하기 전에
- 여러 개의 추론 경로
- 여러 개의 가능한 답변
- 서로 다른 관점
을 동시에 유지하고 비교할 수 있음
1.5 주요 실험 결과
- 제안한 Debate 방식은 총 6개의 reasoning, factuality, question-answering task에서 평가됨
- 다음과 같은 단일 모델 기반 baseline보다 높은 성능을 보임
- Zero-shot Chain-of-Thought
- Reflection
- 가장 좋은 성능을 얻기 위해서는 다음 두 요소가 모두 중요함
- 여러 개의 model agent 사용
- 여러 round의 debate 진행
- 동일한 종류의 모델을 여러 개 사용하더라도 초기에는 서로 다양한 답변을 생성함
- 즉, 같은 model class의 인스턴스라도 완전히 동일한 답변만 생성하지는 않음
- 논문에서는 서로 다른 종류의 모델을 함께 사용하는 경우도 분석함
- ChatGPT
- Bard
- 토론이 진행되면 에이전트들은 대부분 하나의 공통된 답변으로 수렴함
- 최종 합의된 답변은 초기 개별 답변보다 더 정확한 경향을 보임
1.6 Debate가 사실성을 향상하는 방식
- Debate를 통해 생성된 답변은 모델이 확신하지 못하는 잘못된 사실을 포함할 가능성이 낮아짐
- 에이전트들은 확실하지 않은 사실에 대해 서로 다른 내용을 생성하는 경향이 있음
- 한 에이전트는 특정 사실이 맞다고 주장
- 다른 에이전트는 다른 정보나 반대 의견을 제시
- 토론이 진행되면서 에이전트들은 서로 일치하지 않는 불확실한 사실을 발견함
- 그 결과 해당 정보는 다음과 같이 처리될 수 있음
- 최종 답변에서 제거됨
- 다른 에이전트의 지적을 통해 수정됨
- 따라서 Debate는 hallucination을 줄이고 답변의 factual validity를 향상함
- Figure 7 관련 핵심: 에이전트들이 확신하지 못하는 사실에 대해 서로 불일치하면, 토론 과정에서 해당 사실이 최종 답변에서 제거되는 경향이 나타남.
1.7 Debate는 단순한 다수결이 아님
- Debate는 처음부터 정답을 제시한 한 에이전트의 의견을 단순히 확대하거나 선택하는 방식이 아님
- 논문에서는 모든 에이전트가 처음에는 오답을 제시했지만, 토론을 거치면서 정답에 도달하는 사례도 발견함
- 즉, Debate 과정에서 새로운 추론이 발생할 수 있음
- 다른 에이전트의 풀이에서 모순 발견
- 자신의 계산이나 전제 재검토
- 여러 답변의 일부 정보를 결합
- 기존에 없었던 올바른 추론 경로 구성
- Figure 4, Figure 11 관련 핵심: 모든 에이전트가 초기에는 틀린 답변을 제시했지만, 서로의 답변을 비판하고 수정하면서 최종적으로 정답에 도달함.
- 따라서 Multi-Agent Debate의 효과는 단순한 majority voting보다 넓은 개념으로 볼 수 있음
1.8 방법의 실용적 장점
- 모든 실험 과제에 동일한 방법론과 prompt template을 사용함
- 모델 내부 정보에 접근할 필요가 없음
- Probability 또는 likelihood 불필요
- Gradient 불필요
- Model parameter 접근 불필요
- 모델이 생성한 텍스트만 사용할 수 있으면 적용 가능함
- 따라서 API 형태로 제공되는 일반적인 black-box LLM에도 적용할 수 있음
- 다른 LLM 성능 향상 기법과도 독립적으로 결합 가능함
- Retrieval
- Prompt engineering
- Chain-of-Thought
- 실제로 본 논문에서는 Debate와 zero-shot Chain-of-Thought를 함께 사용함
1.9 비용과 활용 가능성
- Debate 방식은 단일 모델을 한 번 호출하는 것보다 비용이 많이 듦
- 여러 model instance가 필요함
- 여러 round에 걸쳐 반복적으로 답변을 생성해야 함
- 토큰 사용량과 inference cost가 증가함
- 그러나 추가 비용을 통해 답변의 추론 정확도와 사실성을 크게 향상할 수 있음
- Debate를 통해 생성된 고품질 답변은 새로운 학습 데이터로 활용될 수도 있음
- 이를 통해 다음과 같은 self-improvement loop를 구성할 가능성이 있음
- 여러 모델이 토론하여 더 정확한 답변 생성
- 토론을 통해 생성한 답변을 새로운 training data로 사용
- 해당 데이터로 단일 모델의 성능 향상
- 향상된 모델을 다시 Debate에 활용
1.10 새로운 Factuality Benchmark
- 저자들은 Debate가 사실적 정확성에 미치는 영향을 평가하기 위해 새로운 benchmark와 dataset을 제안함
- 평가 과제
- 유명한 컴퓨터 과학자의 biography 생성
- 생성된 전기 내용의 사실적 정확성 평가
- 기존 LLM은 컴퓨터 과학자의 전기를 생성할 때 사실이 아닌 내용을 자주 만들어냄
- 소속 기관을 잘못 제시
- 활동 시기나 연도를 잘못 제시
- 실제 업적과 관련 없는 내용을 포함
- 동일한 질문에 대해서도 서로 다른 LLM 인스턴스가 서로 모순되는 사실을 생성함
- 여러 에이전트가 답변 간 합의를 시도하면 이러한 불일치가 발견됨
- 불일치하는 사실을 제거
- 토론을 통해 잘못된 사실을 수정
1.11 연구의 주요 기여
- Multi-Agent Debate 방법 제안
- 여러 LLM 에이전트가 서로의 답변과 추론을 비판하고 수정하는 과정을 통해 사실성과 추론 정확도를 향상함
- 새로운 Factuality Benchmark 제안
- 기존 LLM이 어려움을 겪는 유명 컴퓨터 과학자 biography 생성 과제를 구축함
- Debate 구성 요소에 대한 실험적 분석
- 서로 다른 6개의 reasoning 및 factuality task에서 성능을 평가함
- 다음 요소가 성능에 미치는 영향을 분석함
- 에이전트 수
- Debate round 수
- Prompt 구성
- 동일한 모델과 서로 다른 모델을 사용하는 경우
핵심 요약
여러 LLM 에이전트가 독립적으로 답을 생성한 뒤 서로의 추론을 반복적으로 검토하고 비판하게 하면, 단일 모델의 자기검토 방식보다 더 정확하고 사실적인 답변을 생성할 수 있다.
2. Language Generation through Multi-Agent Debate
- 본 논문은 여러 LLM 에이전트가 서로의 답변을 검토하고 토론하는 Multi-Agent Debate 기반 언어 생성 방법을 제안함
- 전체 방법은 다음 두 부분으로 구성됨
- Section 2.1: Multi-Agent Debate의 전체적인 진행 방식
- Section 2.2: 토론을 통해 여러 에이전트가 하나의 답변으로 수렴하는 과정
- 제안 방법의 전체적인 구조는 Figure 2에 제시되어 있음
Figure 2. Illustration of Debate

- Figure 2는 두 개의 에이전트가 수학 문제를 해결하면서 여러 라운드에 걸쳐 토론하는 과정을 보여줌
- 문제에 주어진 정보
- 다이아몬드: 175개
- 루비: 다이아몬드보다 35개 적음
- 에메랄드: 루비의 2배
- 전체 보석 개수를 계산해야 함
- 정확한 계산
- 루비: 175 - 35 = 140
- 에메랄드: 140 × 2 = 280
- 전체 보석: 175 + 140 + 280 = 595
Round 1: 독립적인 답변 생성
- 두 에이전트는 다른 에이전트의 답변을 보지 않고 각자 문제를 해결함
- Agent 1
- 루비의 수를 정확하게 계산하지 못함
- 문제에 주어진 관계를 잘못 해석하여 최종 답을 225개로 제시함
- 틀린 답변을 생성했지만, 자신의 계산 과정이 잘못되었다는 사실을 인식하지 못함
- Agent 2
- 루비를 175 - 35 = 140으로 정확히 계산함
- 에메랄드를 140 × 2 = 280으로 계산함
- 최종 답을 595개로 정확하게 제시함
- 첫 번째 라운드에서는 에이전트들이 서로 다른 답변을 제시함
- Agent 1: 225
- Agent 2: 595
Round 2: 다른 에이전트의 답변을 활용한 수정
- 각 에이전트는 다른 에이전트가 제시한 답변과 추론 과정을 읽음
- Agent 1
- Agent 2의 답변을 통해 루비가 140개라는 사실을 받아들임
- 그러나 에메랄드 계산에서 새로운 오류를 발생시킴
- 에메랄드 수를 2 × 140 - 35 = 245로 잘못 계산
- 수정된 답변으로 560개를 제시함
- 다른 에이전트의 정보를 참고했지만 아직 완전히 정확한 답에 도달하지 못함
- Agent 2
- 다른 에이전트의 답변을 검토한 뒤 자신의 기존 계산이 옳다고 판단함
- 답변을 595개로 유지함
- 이 단계는 Debate가 단순히 즉시 정답으로 수렴하는 과정이 아님을 보여줌
- 다른 에이전트의 정보를 활용하면서도 새로운 오류가 발생할 수 있음
- 여러 번의 검토와 수정이 필요함
Round 3: 최종 합의 도달
- Agent 1은 Agent 2의 계산을 다시 확인함
- 루비가 140개이고, 전체 보석이 595개라는 계산을 최종적으로 받아들임
- 두 에이전트가 모두 동일한 답을 제시함
- Agent 1: 595
- Agent 2: 595
- 최종적으로 에이전트들은 정확한 답변에 합의함
Figure 2가 보여주는 핵심
- Multi-Agent Debate는 다음 과정을 반복함
- 각 에이전트가 독립적으로 답변 생성
- 다른 에이전트의 답변과 추론 과정 확인
- 서로 다른 답변과 계산을 비교
- 자신의 오류를 수정하거나 기존 답변을 유지
- 여러 라운드 후 공통된 답변에 수렴
- 다른 에이전트의 답변은 단순한 최종 정답이 아니라 추가 정보와 검증 근거로 사용됨
- 틀린 답변을 생성한 에이전트도 다른 에이전트의 올바른 추론을 참고하여 자신의 오류를 수정할 수 있음
- 정답을 생성한 에이전트 역시 다른 답변을 검토하면서 자신의 계산이 타당한지 다시 확인함
- 토론 과정에서 모든 에이전트가 즉시 정답을 받아들이는 것은 아님
- 중간 라운드에서 불완전한 수정이나 새로운 오류가 나타날 수 있음
- 반복적인 토론을 통해 점진적으로 정확한 답에 가까워짐
핵심 한 문장: 각 에이전트가 독립적으로 생성한 답변을 서로 공유하고 반복적으로 수정하게 함으로써, 잘못된 답변을 교정하고 최종적으로 더 정확한 합의에 도달한다.
2.1 Multi-Agent Language Generation
2.1.1 인간의 다중 추론 과정에서 얻은 아이디어
- 사람은 하나의 문제를 해결할 때 반드시 하나의 추론 방식만 사용하는 것이 아님
- 동일한 문제를 여러 방식으로 해결한 뒤 결과를 비교하여 답의 신뢰도를 높일 수 있음
- 논문에서는 변의 길이가 3, 4, 5인 삼각형의 넓이를 구하는 문제를 예로 제시함
- 첫 번째 추론 방식
- 3-4-5 삼각형이 직각삼각형임을 인식
- 넓이를 0.5 × 3 × 4 = 6으로 계산
- 두 번째 추론 방식
- 코사인 법칙을 이용하여 두 변 사이의 각도 θ를 계산
- 0.5 × 3 × 4 × sin(θ)를 이용하여 넓이를 계산
- 참고: 원문에는 첫 번째 계산 결과가 64로 적혀 있지만, 실제 계산값은 6이므로 논문의 오탈자로 보임.
- 첫 번째 추론 방식
- 서로 다른 두 추론 과정이 동일한 답을 제시하면 결과에 대한 신뢰도가 높아짐
- 반대로 두 추론 결과가 다르면 다음 과정을 거치게 됨
- 각 추론 과정의 가정 확인
- 계산 과정 비교
- 잘못된 부분 검토
- 일관된 답이 나올 때까지 추론 수정
- 논문은 이러한 과정을 인간의 머릿속에서 이루어지는 mental debate로 설명함
2.1.2 여러 출처를 이용한 사실 검증
- 전기와 같은 사실 중심의 글을 작성할 때도 유사한 검증 과정이 사용됨
- 특정 역사적 인물의 전기를 작성한다고 가정하면
- 하나의 출처만 신뢰하지 않고 여러 자료에서 동일한 사실을 확인함
- 여러 출처에서 일치하는 정보는 신뢰도가 높아짐
- 출처마다 서로 다른 정보가 제시되면 추가적인 검토가 필요함
- 즉, 사실성 검증은 다음 과정으로 이루어질 수 있음
- 여러 출처에서 정보 수집
- 출처 간 내용 비교
- 일치하지 않는 사실 발견
- 각 정보의 근거를 재검토
- 최종적으로 일관된 사실 선택
- 본 논문은 이러한 multi-source factuality checking 과정도 Multi-Agent Debate로 구현하고자 함
2.1.3 Multi-Agent Debate의 기본 구성
- 인간의 다중 추론 및 여러 출처를 활용한 사실 검증 과정을 모방하기 위해 여러 LLM 인스턴스를 사용함
- 각 agent는 하나의 LLM 복사본으로 구성됨
- 동일한 언어 모델을 여러 번 독립적으로 실행
- 각 모델 인스턴스를 별도의 agent로 간주
- 하나의 질문이 주어지면 여러 agent가 각각 독립적인 답변을 생성함
- 각 agent의 답변은 다음 중 하나로 해석할 수 있음
- 하나의 가능한 추론 과정
- 하나의 후보 답변
- 하나의 독립적인 정보 출처
- 여러 답변을 동시에 유지함으로써 하나의 모델이 생성한 최초 답변에만 의존하지 않음
2.1.4 Debate 진행 과정
Step 1. 독립적인 초기 답변 생성
- 먼저 동일한 문제를 각 agent에게 독립적으로 제시함
- 각 agent는 다른 agent의 답변을 보지 않은 상태에서 자신의 답변을 생성함
- 따라서 초기 답변에서는 다음과 같은 다양성이 나타날 수 있음
- 서로 다른 최종 답
- 서로 다른 풀이 방식
- 서로 다른 가정
- 서로 다른 사실 정보
Step 2. 다른 Agent의 답변 공유
- 모든 agent의 초기 답변이 생성되면 토론을 시작함
- 각 agent에게 자신을 제외한 다른 agent들의 답변을 context로 제공함
- 다른 agent의 응답은 하나의 문자열로 연결되어 prompt 안에 삽입됨
Step 3. 답변 검증 및 수정
- 각 agent는 다른 agent들의 답변을 바탕으로 새로운 답변을 작성함
- 이때 각 agent는 두 가지 역할을 수행함
- 다른 agent들의 답변이 타당한지 검증
- 다른 답변을 참고하여 자신의 답변을 수정
- 다른 agent의 의견을 무조건 받아들이는 것은 아님
- 다른 답변에서 오류를 발견할 수 있음
- 자신의 기존 답변이 더 타당하다고 판단하면 유지할 수 있음
- 여러 답변의 일부를 결합하여 새로운 풀이를 만들 수도 있음
Step 4. 여러 Round 반복
- 수정된 답변들을 다시 각 agent에게 제공함
- 동일한 검토 및 수정 과정을 여러 round 반복함
- 반복적인 토론을 통해 성능을 향상하고 최종적인 합의에 가까워짐
2.1.5 각 Agent의 역할
- 각 agent는 단순히 새로운 답을 생성하는 역할만 수행하지 않음
- 구체적으로 다음 역할을 동시에 담당함
- Solver
- 주어진 문제에 대한 독립적인 답변 생성
- Critic
- 다른 agent의 추론과 답변 검토
- Verifier
- 여러 답변의 계산, 논리 및 사실적 일관성 확인
- Reviser
- 다른 의견을 반영하여 자신의 답변 수정
- Solver
핵심: 하나의 LLM 인스턴스가 문제 해결자이면서 동시에 다른 답변을 평가하는 검증자의 역할을 수행한다.
Figure 3. Debate Prompt

- Figure 3은 agent에게 다른 agent들의 답변을 전달하고 자신의 답변을 수정하도록 유도하는 consensus prompt를 보여줌
- [other answers] 위치에 다른 agent들이 이전 round에서 생성한 답변을 삽입함
- 논문은 두 종류의 debate prompt를 사용함
- Short-form debate prompt
- Long-form debate prompt
Short-form Debate Prompt
“These are the solutions to the problem from other agents: [other answers]. Based off the opinion of other agents, can you give an updated response …”
- 다른 agent들의 풀이를 제공한 뒤 이를 참고하여 답변을 수정하도록 요청함
- 비교적 짧고 직접적인 지시문으로 구성됨
- 모델이 다른 답변을 참고하되, 구체적으로 어떤 방식으로 검토해야 하는지는 상세히 지시하지 않음
Long-form Debate Prompt
“These are the solutions to the problem from other agents: [other answers]. Using the opinion of other agents as additional advice, can you give an updated response …”
- 다른 agent의 의견을 additional advice로 사용하도록 명시함
- 다른 답변을 절대적인 정답이 아니라 추가적인 참고 자료로 취급하도록 유도함
- agent가 자신의 판단을 유지하면서 다른 의견을 검토하도록 설계됨
Figure 3의 핵심 의미
- 별도의 복잡한 통신 구조를 설계하지 않고도 일반적인 text prompt만으로 agent 간 토론을 구현할 수 있음
- agent 사이에서 직접 메시지를 주고받는 별도 시스템이 필요한 것이 아님
- 이전 round의 다른 답변을 수집
- 해당 답변을 다음 prompt에 삽입
- 각 agent가 새로운 응답을 생성
- 따라서 제안 방법은 모델 내부에 접근하지 않고도 API 기반의 black-box LLM에 적용할 수 있음
- Figure 3은 Debate의 핵심 연산이 다음과 같이 단순하다는 점을 보여줌
다른 agent들의 답변을 context로 제공하고, 이를 참고하여 자신의 답변을 다시 생성하게 한다.
2.1.6 기존 Prompting 기법과의 관계
- Multi-Agent Debate는 기존 prompting 기법을 대체하는 방법이 아님
- 기존 기법과 독립적으로 적용되는 orthogonal approach임
- 즉, 각 agent가 초기 답변이나 수정된 답변을 생성할 때 다른 prompting 기법을 함께 사용할 수 있음
- Chain-of-Thought
- Retrieval
- Verification
- Self-consistency
- Prompt engineering
- 더 자세한 추론을 유도하는 prompting 기법을 적용하면 agent들이 서로 검토할 수 있는 정보도 풍부해질 수 있음
- 논문의 실제 평가에서는 각 agent에게 Zero-shot Chain-of-Thought를 적용함
- 단순히 최종 답만 생성하지 않음
- 문제를 단계별로 추론하도록 유도
- 다른 agent가 최종 답뿐 아니라 추론 과정의 오류까지 확인할 수 있도록 함
- 기존 prompting 방식과 Debate를 결합했을 때 나타나는 효과는 Figure 6에서 분석함
2.2 Consensus in Debates
2.2.1 핵심 질문
- 여러 LLM agent가 여러 round에 걸쳐 토론할 때, 최종적으로 하나의 공통된 답변에 도달할 수 있는가?
- Multi-Agent Debate는 일반적으로 multi-agent game으로 볼 수 있음
- 각 agent가 서로 다른 답변과 추론을 유지할 수 있음
- 이론적으로는 agent들이 반드시 하나의 답으로 수렴한다는 보장이 없음
- 토론이 계속되거나 서로 다른 의견을 끝까지 유지할 가능성도 존재함
- 그러나 실제 실험에서는 여러 round의 debate 이후 agent들이 대부분 하나의 공통된 답변으로 수렴함
- 이러한 현상은 Figure 4에서 확인할 수 있음
핵심: Debate의 수렴은 이론적으로 보장되지는 않지만, 실제 LLM 실험에서는 대부분 하나의 공유된 답변에 도달했다.
2.2.2 Debate 길이를 조절하는 방법
- 저자들은 prompt를 통해 debate가 지속되는 길이를 조절할 수 있음을 발견함
- 핵심 조절 요소는 다음과 같음
- agent가 자신의 기존 답변을 얼마나 신뢰하는가
- 다른 agent의 답변을 얼마나 쉽게 받아들이는가
- 자신의 답변보다 다른 agent의 의견을 더 강하게 신뢰하도록 유도하면
- 다른 의견을 빠르게 받아들임
- 적은 round 안에 합의에 도달함
- debate가 짧아짐
- 반대로 자신의 초기 풀이를 쉽게 포기하지 않도록 유도하면
- 다른 답변을 더 비판적으로 검토함
- 자신의 근거와 다른 agent의 근거를 비교함
- 합의에 도달하기까지 더 많은 round가 필요함
- debate가 길어짐
- 이러한 차이를 유도하기 위해 Figure 3의 두 가지 prompt를 사용함
- Short-form prompt
- Long-form prompt
- 서로 다른 prompt가 debate 길이에 미치는 영향은 Figure 12에서 분석함
2.2.3 “Stubborn” Agent의 효과
- 저자들은 자신의 답변을 어느 정도 고수하도록 유도된 agent를 stubborn agent로 표현함
- Stubborn prompt는 agent가 다른 의견을 즉시 받아들이지 않고 자신의 풀이를 재검토하도록 유도함
- 이 경우 agent는 다음과 같은 행동을 수행할 가능성이 높아짐
- 자신의 계산과 근거를 다시 확인
- 다른 agent의 논리적 오류 탐색
- 답변 간 불일치의 원인 분석
- 충분한 검증 이후에만 답변 수정
- 실험 결과, agent를 더 stubborn하게 만드는 prompt는
- Debate의 지속 시간을 증가시킴
- 더 많은 round의 논의를 유도함
- 최종 답변의 성능을 향상하는 경향을 보임
중요한 의미: 너무 빠른 합의보다, 일정 수준의 의견 충돌과 검증 과정이 더 정확한 답변을 만드는 데 도움이 될 수 있다.
2.2.4 빠른 합의의 문제점
- Agent가 다른 의견을 지나치게 쉽게 받아들이면 토론이 빠르게 종료될 수 있음
- 그러나 빠른 수렴이 항상 좋은 결과를 의미하는 것은 아님
- 정답을 충분히 검증하지 않고 다른 agent의 답을 따라갈 수 있음
- 한 agent의 잘못된 답변이 다른 agent들에게 빠르게 확산될 수 있음
- 실제 토론이 아니라 단순한 동조에 가까워질 수 있음
- 따라서 효과적인 Multi-Agent Debate를 위해서는 두 요소 사이의 균형이 필요함
- 다른 agent의 의견을 받아들일 수 있는 개방성
- 자신의 추론을 충분히 검증하는 비판성
2.2.5 LLM Agent의 Agreeableness
- 저자들은 전반적으로 LLM agent들이 비교적 agreeable, 즉 다른 의견에 쉽게 동의하는 성향을 보였다고 설명함
- 가능한 원인
- Instruction tuning
- Reinforcement Learning from Human Feedback, RLHF
- 이러한 학습 과정에서는 일반적으로 모델이 다음과 같이 행동하도록 조정됨
- 사용자의 지시를 따름
- 협조적인 답변을 생성함
- 대립하거나 고집하기보다 상대의 의견을 수용함
- 이러한 성향이 Multi-Agent Debate에서도 나타날 수 있음
- 다른 agent의 답을 쉽게 받아들임
- 자신의 기존 답변을 빠르게 포기함
- 예상보다 빠르게 consensus에 도달함
- 따라서 prompt를 통해 agent가 자신의 답을 비판적으로 유지하도록 유도할 필요가 있음
2.2.6 Consensus 형성 과정
- Multi-Agent Debate의 consensus는 다음과 같은 흐름으로 형성됨
- 각 agent가 독립적인 답변을 생성함
- Agent들이 서로 다른 답변과 추론을 확인함
- 각 agent가 자신의 풀이와 다른 풀이를 비교함
- 신뢰할 수 있는 근거는 수용하고, 잘못된 근거는 반박함
- 수정된 답변을 다시 공유함
- 이러한 과정을 여러 round 반복함
- 답변 간 차이가 점차 감소하며 하나의 공통된 답으로 수렴함
- 다만 consensus가 형성되었다는 사실만으로 최종 답변이 반드시 정답이라는 의미는 아님
- 모든 agent가 동일한 오답에 합의할 가능성도 존재함
- 따라서 중요한 것은 합의 자체가 아니라 충분한 비판과 검증을 거친 합의임
Figure 연결
Figure 3
- 서로 다른 prompt를 사용하여 agent가 다른 의견을 받아들이는 정도를 조절함
- Prompt의 표현 방식에 따라 debate의 지속 시간이 달라질 수 있음
Figure 4
- 여러 round의 debate를 통해 agent들이 서로 다른 초기 답변에서 하나의 답변으로 수렴하는 사례를 보여줌
Figure 12
- Prompt 구성에 따라 debate의 길이와 최종 성능이 어떻게 달라지는지 분석함
- 자신의 답을 더 강하게 유지하도록 유도한 prompt가 더 긴 debate와 더 나은 결과를 만드는 경향을 보여줌
핵심 요약
Multi-Agent Debate는 이론적으로 수렴이 보장되지는 않지만, 실제 실험에서는 대부분의 LLM agent가 여러 round 후 하나의 답변에 도달했다. 또한 agent들이 다른 의견에 즉시 동의하지 않고 자신의 추론을 어느 정도 고수하도록 유도하면 토론이 길어지지만, 더 충분한 검증을 거쳐 최종 성능이 향상되는 경향이 나타났다.
3. Experiments
3.1 실험 목적
- 실험에서는 Multi-Agent Debate에 관한 다음 세 가지 연구 질문을 검증함
- Multi-Agent Debate가 LLM의 추론 성능을 얼마나 향상하는가?
- Multi-Agent Debate가 생성된 답변의 사실적 정확성을 얼마나 향상하는가?
- 어떤 설계 요소가 Multi-Agent Debate의 성능 향상에 기여하는가?
- Section 3.1에서는 이 가운데 첫 번째 질문인 추론 능력 향상 효과를 평가함
3.1 Improving Reasoning with Multi-Agent Debate
3.1.1 실험 목적
- Multi-Agent Debate가 LLM의 기본적인 추론 능력을 실제로 향상하는지 확인함
- 난이도와 추론 유형이 서로 다른 세 가지 과제를 사용함
- 단순 계산
- 초등학교 수준의 수학 문장제
- 체스 수 예측을 통한 전략적 추론
3.1.2 Evaluation Tasks
1. Arithmetic
- 여섯 개의 서로 다른 두 자리 수로 구성된 산술식을 계산하는 과제
- 식에는 다음 연산이 포함됨
- 덧셈
- 뺄셈
- 곱셈
- 예시
What is the result of 12 + 15 × 21 + 0 − 3 × 27?
- 모델이 생성한 최종 답의 정확도를 평가함
- 비교적 단순한 계산 과제이지만, 연산 순서나 중간 계산에서 오류가 발생할 수 있음
2. GSM8K
- GSM8K 데이터셋의 초등학교 수준 수학 문장제를 사용함
- 단순히 식을 계산하는 것이 아니라 문제의 내용을 이해하고 적절한 계산식을 구성해야 함
- 필요한 능력
- 자연어 문제 이해
- 수치 간 관계 파악
- 여러 단계의 계산
- 최종 답 도출
- 모델이 생성한 최종 답의 정확도를 평가함
3. Chess Move Prediction
- 체스 경기에서 가장 좋은 다음 수를 예측하는 과제
- 두 명의 체스 그랜드마스터가 실제로 진행한 경기의 첫 14수를 PGN 표기법으로 제공함
- 모델은 현재 보드 상태를 추론하여 가장 적절한 다음 수를 제시해야 함
- 단순 계산이 아니라 다음과 같은 전략적 추론 능력을 요구함
- 현재 보드 상태 이해
- 후보 수 비교
- 장기적인 유불리 판단
- 상대의 대응 예측
- 모델이 제안한 수는 체스 엔진 Stockfish를 사용하여 평가함
- 평가 지표는 해당 수가 가져오는 우위를 나타내는 pawn score 또는 APS임
- 점수가 높을수록 더 좋은 수를 예측한 것으로 해석함
3.1.3 Baselines
- Multi-Agent Debate의 효과를 검증하기 위해 다음 네 가지 방법을 비교함
1. Single Agent
- 하나의 LLM agent가 문제를 한 번 해결함
- 다른 agent의 답변이나 추가적인 검토 과정이 없음
- 가장 기본적인 비교 기준임
2. Single Agent with Reflection
- 하나의 agent가 먼저 답변을 생성함
- 이후 자신의 기존 답변을 스스로 비판하고 수정함
- Debate와 달리 다른 agent의 의견은 제공되지 않음
- 단일 모델 내부의 self-reflection만 사용함
3. Multi-Agent with Majority Voting
- 여러 agent가 각각 독립적으로 답변을 생성함
- agent 간 토론이나 추론 공유 없이 가장 많이 나온 답을 최종 답으로 선택함
- 여러 모델의 다양성은 활용하지만, 서로의 오류를 직접 검토하거나 수정하지는 않음
4. Multi-Agent Debate
- 여러 agent가 독립적으로 답변을 생성함
- 이후 서로의 답변과 추론을 읽고 비판함
- 여러 round에 걸쳐 자신의 답변을 수정함
- Multi-Agent Generation과 Reflection을 결합한 방식으로 볼 수 있음
3.1.4 공정한 비교를 위한 실험 설정
- 모든 방법에 동일한 조건을 적용함
- 동일한 초기 prompt
- 동일한 language model
- 동일한 평가 데이터
- 실험은 별도의 예시를 제공하지 않는 zero-shot setting에서 진행함
- 대부분의 실험에서 ChatGPT 기반 언어 모델을 사용함
- 서로 다른 종류의 LLM을 비교하는 실험은 Figure 11에서 별도로 수행함
- 계산 비용을 고려하여 주요 실험에서는 다음 설정을 사용함
- Agent 수: 3개
- Debate round 수: 2회
- 다만 agent 수와 debate round를 더 늘렸을 때 추가적인 성능 향상이 나타났으며, 해당 결과는 Figure 10에서 분석함
Table 1. Multi-Agent Debate Improves Reasoning
MethodArithmetic Accuracy ↑GSM8K Accuracy ↑Chess APS ↑
| Single Agent | 67.0 ± 4.7 | 77.0 ± 4.2 | 91.4 ± 10.6 |
| Single Agent (Reflection) | 72.1 ± 4.5 | 75.0 ± 4.3 | 102.1 ± 11.9 |
| Multi-Agent (Majority) | 69.0 ± 4.6 | 81.0 ± 3.9 | 102.2 ± 6.2 |
| Multi-Agent (Debate) | 81.8 ± 2.3 | 85.0 ± 3.5 | 122.9 ± 7.6 |
- 모든 지표는 높을수록 좋은 성능을 의미함
- Multi-Agent Debate가 세 과제 모두에서 가장 높은 성능을 기록함
3.1.5 Quantitative Results
Arithmetic
- Single Agent: 67.0%
- Reflection: 72.1%
- Majority Voting: 69.0%
- Multi-Agent Debate: 81.8%
- Debate는 Single Agent보다 약 14.8%p 높은 정확도를 기록함
- 단순히 여러 답 중 다수결을 수행하는 것보다 agent들이 서로의 풀이를 검토하는 것이 훨씬 효과적이었음
GSM8K
- Single Agent: 77.0%
- Reflection: 75.0%
- Majority Voting: 81.0%
- Multi-Agent Debate: 85.0%
- Multi-Agent Debate가 가장 높은 **85.0%**의 정확도를 기록함
- Majority Voting도 Single Agent보다 성능이 향상되었지만, Debate보다는 낮았음
- Reflection은 오히려 Single Agent보다 약간 낮은 결과를 보임
- 자기검토가 항상 오류 수정으로 이어지는 것은 아님
- 모델이 자신의 기존 오답을 강화하거나 새로운 오류를 만들 가능성도 있음
Chess Move Prediction
- Single Agent: 91.4 APS
- Reflection: 102.1 APS
- Majority Voting: 102.2 APS
- Multi-Agent Debate: 122.9 APS
- 체스에서도 Debate가 가장 높은 성능을 보임
- 따라서 Multi-Agent Debate의 효과가 단순한 수학 계산에만 한정되지 않고, 전략적 추론 문제에도 적용될 수 있음을 보여줌
3.1.6 결과 해석
- 여러 agent를 사용하는 것만으로도 일부 과제에서 Single Agent보다 성능이 향상됨
- 여러 agent가 서로 다른 답변과 추론 경로를 생성하기 때문
- Single Agent Reflection도 일부 과제에서 일정한 성능 향상을 제공함
- 자신의 답변을 다시 확인하는 과정이 오류 수정에 도움이 될 수 있음
- 그러나 가장 큰 성능 향상은 Multi-Agent Debate에서 나타남
- 여러 agent가 제공하는 다양한 추론 경로
- 다른 답변에 대한 비판
- 자신의 답변을 수정하는 reflection
을 동시에 활용하기 때문
핵심 결과: 여러 답변 중 하나를 단순히 선택하는 것보다, agent들이 서로의 추론을 직접 검토하고 수정하도록 만드는 것이 더 효과적이다.
Figure 4. Illustration of Solving Math

- Figure 4는 산술 문제에서 agent들이 여러 round에 걸쳐 답변을 수정하는 사례를 보여줌
- 그림에서는 가독성을 위해 각 agent의 구체적인 추론 과정은 생략하고 최종 답만 표시함
주요 사례
- 일부 문제에서는 두 agent가 Round 1에서 모두 오답을 제시함
- 그러나 Round 2에서 서로의 풀이를 검토한 뒤 두 agent 모두 정답으로 수정함
- 또 다른 문제에서는
- 세 agent가 모두 서로 다른 오답을 생성함
- 이후 일부 agent가 정답에 도달함
- 추가적인 round를 거쳐 모든 agent가 동일한 정답으로 수렴함
Figure 4의 핵심 의미
- Debate는 처음부터 정답을 제시한 agent를 단순히 찾아내는 방식이 아님
- 모든 agent가 처음에 틀렸더라도, 서로의 추론을 비판하는 과정에서 정답을 새롭게 발견할 수 있음
핵심: Debate는 정답의 다수결이나 정답 agent의 의견 확산을 넘어, 토론 과정에서 새로운 올바른 추론을 만들어낼 수 있다.
Figure 5. Illustration of Solving Grade School Math

- Figure 5는 GSM8K 형태의 수학 문장제에서 Debate가 작동하는 사례를 보여줌
- 마찬가지로 구체적인 추론 과정은 생략하고 각 round의 답만 제시함
사례 1: 소설의 수 계산
- 문제
- Regina는 작년에 소설 9편을 집필함
- 올해는 작년의 3분의 1에 해당하는 수를 더 집필함
- 현재까지 집필한 전체 소설 수를 계산함
- Round 1
- Agent 1: 48이라는 오답
- Agent 2: 12라는 정답
- Round 2
- Agent 1이 답을 12로 수정
- 두 agent 모두 정답에 합의함
사례 2: 버터 가격 계산
- 문제
- Dennis는 크루아상 12개마다 버터 1파운드를 사용함
- 크루아상 6다스를 만들기 위해 필요한 버터의 비용을 계산함
- 버터는 1파운드에 4달러이며, 1파운드를 구매하면 절반 가격으로 1파운드를 추가 구매할 수 있음
- Round 1
- Agent 1: 18이라는 정답
- Agent 2: 30이라는 오답
- Round 2
- Agent 2가 자신의 답을 18로 수정
- 두 agent 모두 정답에 합의함
Figure 5의 핵심 의미
- 다른 agent의 풀이가 오답을 낸 agent에게 오류를 발견할 수 있는 외부 관점으로 작용함
- Debate를 통해 단순 계산 오류뿐 아니라 문장의 조건을 잘못 해석한 오류도 수정할 수 있음
3.1.7 Qualitative Results
- Figure 4와 Figure 5의 사례에서 다음과 같은 패턴이 확인됨
- 한 agent가 정답을 제시하고 다른 agent가 이를 참고해 오답을 수정함
- 처음에는 모든 agent가 오답을 제시했지만 토론 중 정답에 도달함
- 여러 round를 거치면서 agent들의 답변이 하나로 수렴함
- 특히 모든 agent가 처음부터 틀린 사례는 Debate의 중요한 차별점을 보여줌
- 만약 단순 다수결만 사용했다면
- 모든 agent가 오답일 경우 정답을 선택할 수 없음
- 가장 많이 나온 오답이 그대로 최종 답이 됨
- 반면 Debate에서는
- 서로의 계산과 전제를 검토함
- 오답 사이의 모순을 발견함
- 기존 답변에 없었던 새로운 추론을 수행함
- 최종적으로 정답을 도출할 수 있음
3.1.8 Compatibility with Other Reasoning Methods
- Multi-Agent Debate는 기존의 단일 agent prompting 기법과 독립적으로 결합할 수 있음
- 논문에서는 GSM8K 과제에서 다음 조건을 비교함
- Chain-of-Thought 없이 Multi-Agent Debate 적용
- Zero-shot Chain-of-Thought와 Multi-Agent Debate를 함께 적용
- 두 조건 모두에서 agent 간 토론이 성능을 향상함
- 이는 Debate의 효과가 특정 prompting 방식에만 의존하지 않는다는 것을 보여줌
- Chain-of-Thought와 결합하면 각 agent가 중간 추론 과정을 더 자세히 생성하므로, 다른 agent가 오류를 발견하고 비판하기 쉬워질 수 있음
- 구체적인 결과는 Figure 6에서 제시됨

핵심: Multi-Agent Debate는 Chain-of-Thought를 대체하는 것이 아니라, 함께 사용할 수 있는 보완적 방법이다.
3.1 핵심 요약
- Multi-Agent Debate는 산술, 수학 문장제, 체스의 세 가지 추론 과제 모두에서 가장 높은 성능을 기록함
- 단순한 self-reflection이나 majority voting보다 일관되게 좋은 결과를 보임
- 특히 모든 agent가 처음에 오답을 생성한 경우에도 서로의 추론을 검토하면서 정답에 도달할 수 있었음
- 따라서 Debate의 효과는 정답을 고르거나 확산시키는 데 그치지 않고, 상호 비판을 통해 새로운 올바른 추론을 형성하는 데 있음