본문 바로가기
  • 책상 밖 세상을 경험할 수 있는 Playground를 제공하고, 수동적 학습에서 창조의 삶으로의 전환을 위한 새로운 라이프 스타일을 제시합니다.
카테고리 없음

[2026-1] 이루가 - Improving Factuality and Reasoning in LanguageModels through Multiagent Debate

by wnfladl 2026. 7. 26.

논문 링크: https://arxiv.org/abs/2305.14325

 

Improving Factuality and Reasoning in Language Models through Multiagent Debate

Large language models (LLMs) have demonstrated remarkable capabilities in language generation, understanding, and few-shot learning in recent years. An extensive body of work has explored how their performance may be further improved through the tools of p

arxiv.org

 

Abstract

  • 연구 배경
    • 최근 Large Language Models (LLMs)은 자연어 생성, 언어 이해, few-shot learning에서 뛰어난 성능을 보이고 있음
    • 기존 연구들은 LLM의 성능을 향상하기 위해 다양한 prompting 기법을 활용함
      • Verification
      • Self-consistency
      • Intermediate scratchpad
  • 핵심 아이디어
    • 본 논문은 기존 prompting 방식과 상호보완적인 방법으로 Multi-Agent Debate를 제안함
    • 여러 개의 LLM 인스턴스가 각각 독립적으로 답변과 추론 과정을 생성함
    • 이후 여러 라운드에 걸쳐 서로의 답변과 추론을 검토하고 토론함
    • 토론 결과를 바탕으로 각 에이전트가 자신의 답변을 수정하며, 최종적으로 공통된 답에 도달함
  • 주요 연구 결과
    • 제안한 토론 방식은 다양한 과제에서 수학적 추론 능력을 크게 향상함
    • 전략적 판단이 필요한 문제에서도 strategic reasoning 성능이 개선됨
    • 생성된 답변의 사실적 정확성(factual validity)도 향상됨
    • 기존 LLM에서 자주 발생하는 다음 문제를 감소시킴
      • 잘못된 추론에 기반한 답변
      • 사실과 다른 정보 생성
      • Hallucination
  • 방법의 장점
    • 모델 내부 구조나 파라미터에 접근할 필요 없이 기존 black-box LLM에 바로 적용할 수 있음
    • 논문에서 다룬 모든 과제에 대해 동일한 절차와 prompt를 사용함
    • 특정 과제에 맞춘 별도의 모델 학습이나 복잡한 설계가 필요하지 않음
  • 연구 의의
    • 여러 모델이 서로 토론하는 “society of minds” 방식이 단일 LLM의 한계를 보완할 수 있음을 보여줌
    • 이러한 접근법은 향후 LLM의 추론, 언어 생성, 언어 이해 능력을 더욱 발전시킬 가능성이 있음

 

1. Introduction

1.1 연구 배경

  • 최근 Large Language Models (LLMs)은 다음과 같은 영역에서 뛰어난 성능을 보여줌
    • 자연어 생성
    • 언어 이해
    • Few-shot learning
  • LLM은 인터넷에서 수집된 방대한 텍스트 데이터를 기반으로 학습됨
    • 그러나 인터넷 데이터의 품질과 사실적 정확성은 항상 보장되지 않음
    • 이로 인해 현재의 LLM은 다음과 같은 문제를 보일 수 있음
      • 사실이 아닌 내용을 확신 있게 생성하는 hallucination
      • 추론 과정에서 근거 없이 비약하는 현상
      • 논리적으로 타당하지 않은 답변 생성

1.2 기존 접근법의 한계

  • 기존 연구들은 LLM의 사실성과 추론 능력을 향상하기 위해 다양한 방법을 제안함
    • Few-shot 또는 zero-shot Chain-of-Thought
    • Verification
    • Self-consistency
    • Intermediate scratchpad
    • Reflection
  • 그러나 이러한 방법들은 대부분 하나의 모델 인스턴스가 자신의 답변을 생성하고 검토하는 방식
  • 즉, 단일 모델이 처음부터 잘못된 추론 방향을 선택하면 자신의 오류를 충분히 발견하지 못할 가능성이 있음

1.3 제안 방법: Multi-Agent Debate

  • 본 논문은 The Society of Mind와 multi-agent setting에서 영감을 받은 새로운 접근법을 제안함
  • 핵심 아이디어
    • 여러 개의 LLM 인스턴스를 각각 하나의 agent로 사용
    • 각 에이전트가 독립적으로 답변과 추론 과정을 생성
    • 서로의 답변을 읽고 비판하며 자신의 답변을 반복적으로 수정
    • 여러 차례의 토론을 거쳐 하나의 공통된 최종 답변에 도달
  • 기존 기법을 대체하는 것이 아니라, 기존 prompting 기법과 함께 사용할 수 있는 상호보완적인 접근법

1.4 Debate 진행 과정

  1. 사용자로부터 하나의 query가 주어짐
  2. 여러 LLM 에이전트가 각각 독립적인 candidate answer를 생성함
  3. 각 에이전트가 다른 모든 에이전트의 답변과 추론 과정을 확인함
  4. 다른 에이전트의 답변에서 오류나 불일치하는 부분을 비판함
  5. 비판과 토론 내용을 바탕으로 자신의 답변을 수정함
  6. 이러한 과정을 여러 round에 걸쳐 반복함
  7. 에이전트들이 최종적으로 하나의 공통된 답변에 수렴함
  • 이 과정에서 각 에이전트는 다음 두 가지 기준을 모두 만족하는 답변을 생성하게 됨
    • 자신의 내부적인 검토 기준에서 타당한 답변
    • 다른 에이전트의 답변과 비교했을 때도 합리적인 답변
  • 여러 에이전트로 구성된 집단은 최종 답을 결정하기 전에
    • 여러 개의 추론 경로
    • 여러 개의 가능한 답변
    • 서로 다른 관점
      을 동시에 유지하고 비교할 수 있음

1.5 주요 실험 결과

  • 제안한 Debate 방식은 총 6개의 reasoning, factuality, question-answering task에서 평가됨
  • 다음과 같은 단일 모델 기반 baseline보다 높은 성능을 보임
    • Zero-shot Chain-of-Thought
    • Reflection
  • 가장 좋은 성능을 얻기 위해서는 다음 두 요소가 모두 중요함
    • 여러 개의 model agent 사용
    • 여러 round의 debate 진행
  • 동일한 종류의 모델을 여러 개 사용하더라도 초기에는 서로 다양한 답변을 생성함
    • 즉, 같은 model class의 인스턴스라도 완전히 동일한 답변만 생성하지는 않음
  • 논문에서는 서로 다른 종류의 모델을 함께 사용하는 경우도 분석함
    • ChatGPT
    • Bard
  • 토론이 진행되면 에이전트들은 대부분 하나의 공통된 답변으로 수렴함
    • 최종 합의된 답변은 초기 개별 답변보다 더 정확한 경향을 보임

1.6 Debate가 사실성을 향상하는 방식

  • Debate를 통해 생성된 답변은 모델이 확신하지 못하는 잘못된 사실을 포함할 가능성이 낮아짐
  • 에이전트들은 확실하지 않은 사실에 대해 서로 다른 내용을 생성하는 경향이 있음
    • 한 에이전트는 특정 사실이 맞다고 주장
    • 다른 에이전트는 다른 정보나 반대 의견을 제시
  • 토론이 진행되면서 에이전트들은 서로 일치하지 않는 불확실한 사실을 발견함
  • 그 결과 해당 정보는 다음과 같이 처리될 수 있음
    • 최종 답변에서 제거됨
    • 다른 에이전트의 지적을 통해 수정됨
  • 따라서 Debate는 hallucination을 줄이고 답변의 factual validity를 향상함
  • Figure 7 관련 핵심: 에이전트들이 확신하지 못하는 사실에 대해 서로 불일치하면, 토론 과정에서 해당 사실이 최종 답변에서 제거되는 경향이 나타남.

1.7 Debate는 단순한 다수결이 아님

  • Debate는 처음부터 정답을 제시한 한 에이전트의 의견을 단순히 확대하거나 선택하는 방식이 아님
  • 논문에서는 모든 에이전트가 처음에는 오답을 제시했지만, 토론을 거치면서 정답에 도달하는 사례도 발견함
  • 즉, Debate 과정에서 새로운 추론이 발생할 수 있음
    • 다른 에이전트의 풀이에서 모순 발견
    • 자신의 계산이나 전제 재검토
    • 여러 답변의 일부 정보를 결합
    • 기존에 없었던 올바른 추론 경로 구성
    • Figure 4, Figure 11 관련 핵심: 모든 에이전트가 초기에는 틀린 답변을 제시했지만, 서로의 답변을 비판하고 수정하면서 최종적으로 정답에 도달함.
  • 따라서 Multi-Agent Debate의 효과는 단순한 majority voting보다 넓은 개념으로 볼 수 있음

1.8 방법의 실용적 장점

  • 모든 실험 과제에 동일한 방법론과 prompt template을 사용함
  • 모델 내부 정보에 접근할 필요가 없음
    • Probability 또는 likelihood 불필요
    • Gradient 불필요
    • Model parameter 접근 불필요
  • 모델이 생성한 텍스트만 사용할 수 있으면 적용 가능함
  • 따라서 API 형태로 제공되는 일반적인 black-box LLM에도 적용할 수 있음
  • 다른 LLM 성능 향상 기법과도 독립적으로 결합 가능함
    • Retrieval
    • Prompt engineering
    • Chain-of-Thought
  • 실제로 본 논문에서는 Debate와 zero-shot Chain-of-Thought를 함께 사용함

1.9 비용과 활용 가능성

  • Debate 방식은 단일 모델을 한 번 호출하는 것보다 비용이 많이 듦
    • 여러 model instance가 필요함
    • 여러 round에 걸쳐 반복적으로 답변을 생성해야 함
    • 토큰 사용량과 inference cost가 증가함
  • 그러나 추가 비용을 통해 답변의 추론 정확도와 사실성을 크게 향상할 수 있음
  • Debate를 통해 생성된 고품질 답변은 새로운 학습 데이터로 활용될 수도 있음
  • 이를 통해 다음과 같은 self-improvement loop를 구성할 가능성이 있음
    1. 여러 모델이 토론하여 더 정확한 답변 생성
    2. 토론을 통해 생성한 답변을 새로운 training data로 사용
    3. 해당 데이터로 단일 모델의 성능 향상
    4. 향상된 모델을 다시 Debate에 활용

1.10 새로운 Factuality Benchmark

  • 저자들은 Debate가 사실적 정확성에 미치는 영향을 평가하기 위해 새로운 benchmark와 dataset을 제안함
  • 평가 과제
    • 유명한 컴퓨터 과학자의 biography 생성
    • 생성된 전기 내용의 사실적 정확성 평가
  • 기존 LLM은 컴퓨터 과학자의 전기를 생성할 때 사실이 아닌 내용을 자주 만들어냄
    • 소속 기관을 잘못 제시
    • 활동 시기나 연도를 잘못 제시
    • 실제 업적과 관련 없는 내용을 포함
  • 동일한 질문에 대해서도 서로 다른 LLM 인스턴스가 서로 모순되는 사실을 생성함
  • 여러 에이전트가 답변 간 합의를 시도하면 이러한 불일치가 발견됨
    • 불일치하는 사실을 제거
    • 토론을 통해 잘못된 사실을 수정

1.11 연구의 주요 기여

  1. Multi-Agent Debate 방법 제안
    • 여러 LLM 에이전트가 서로의 답변과 추론을 비판하고 수정하는 과정을 통해 사실성과 추론 정확도를 향상함
  2. 새로운 Factuality Benchmark 제안
    • 기존 LLM이 어려움을 겪는 유명 컴퓨터 과학자 biography 생성 과제를 구축함
  3. Debate 구성 요소에 대한 실험적 분석
    • 서로 다른 6개의 reasoning 및 factuality task에서 성능을 평가함
    • 다음 요소가 성능에 미치는 영향을 분석함
      • 에이전트 수
      • Debate round 수
      • Prompt 구성
      • 동일한 모델과 서로 다른 모델을 사용하는 경우

핵심 요약

여러 LLM 에이전트가 독립적으로 답을 생성한 뒤 서로의 추론을 반복적으로 검토하고 비판하게 하면, 단일 모델의 자기검토 방식보다 더 정확하고 사실적인 답변을 생성할 수 있다.

 

2. Language Generation through Multi-Agent Debate

  • 본 논문은 여러 LLM 에이전트가 서로의 답변을 검토하고 토론하는 Multi-Agent Debate 기반 언어 생성 방법을 제안함
  • 전체 방법은 다음 두 부분으로 구성됨
    • Section 2.1: Multi-Agent Debate의 전체적인 진행 방식
    • Section 2.2: 토론을 통해 여러 에이전트가 하나의 답변으로 수렴하는 과정
  • 제안 방법의 전체적인 구조는 Figure 2에 제시되어 있음

Figure 2. Illustration of Debate

  • Figure 2는 두 개의 에이전트가 수학 문제를 해결하면서 여러 라운드에 걸쳐 토론하는 과정을 보여줌
  • 문제에 주어진 정보
    • 다이아몬드: 175개
    • 루비: 다이아몬드보다 35개 적음
    • 에메랄드: 루비의 2배
    • 전체 보석 개수를 계산해야 함
  • 정확한 계산
    • 루비: 175 - 35 = 140
    • 에메랄드: 140 × 2 = 280
    • 전체 보석: 175 + 140 + 280 = 595

Round 1: 독립적인 답변 생성

  • 두 에이전트는 다른 에이전트의 답변을 보지 않고 각자 문제를 해결함
  • Agent 1
    • 루비의 수를 정확하게 계산하지 못함
    • 문제에 주어진 관계를 잘못 해석하여 최종 답을 225개로 제시함
    • 틀린 답변을 생성했지만, 자신의 계산 과정이 잘못되었다는 사실을 인식하지 못함
  • Agent 2
    • 루비를 175 - 35 = 140으로 정확히 계산함
    • 에메랄드를 140 × 2 = 280으로 계산함
    • 최종 답을 595개로 정확하게 제시함
  • 첫 번째 라운드에서는 에이전트들이 서로 다른 답변을 제시함
    • Agent 1: 225
    • Agent 2: 595

Round 2: 다른 에이전트의 답변을 활용한 수정

  • 각 에이전트는 다른 에이전트가 제시한 답변과 추론 과정을 읽음
  • Agent 1
    • Agent 2의 답변을 통해 루비가 140개라는 사실을 받아들임
    • 그러나 에메랄드 계산에서 새로운 오류를 발생시킴
      • 에메랄드 수를 2 × 140 - 35 = 245로 잘못 계산
    • 수정된 답변으로 560개를 제시함
    • 다른 에이전트의 정보를 참고했지만 아직 완전히 정확한 답에 도달하지 못함
  • Agent 2
    • 다른 에이전트의 답변을 검토한 뒤 자신의 기존 계산이 옳다고 판단함
    • 답변을 595개로 유지함
  • 이 단계는 Debate가 단순히 즉시 정답으로 수렴하는 과정이 아님을 보여줌
    • 다른 에이전트의 정보를 활용하면서도 새로운 오류가 발생할 수 있음
    • 여러 번의 검토와 수정이 필요함

Round 3: 최종 합의 도달

  • Agent 1은 Agent 2의 계산을 다시 확인함
  • 루비가 140개이고, 전체 보석이 595개라는 계산을 최종적으로 받아들임
  • 두 에이전트가 모두 동일한 답을 제시함
    • Agent 1: 595
    • Agent 2: 595
  • 최종적으로 에이전트들은 정확한 답변에 합의함

Figure 2가 보여주는 핵심

  • Multi-Agent Debate는 다음 과정을 반복함
    1. 각 에이전트가 독립적으로 답변 생성
    2. 다른 에이전트의 답변과 추론 과정 확인
    3. 서로 다른 답변과 계산을 비교
    4. 자신의 오류를 수정하거나 기존 답변을 유지
    5. 여러 라운드 후 공통된 답변에 수렴
  • 다른 에이전트의 답변은 단순한 최종 정답이 아니라 추가 정보와 검증 근거로 사용됨
  • 틀린 답변을 생성한 에이전트도 다른 에이전트의 올바른 추론을 참고하여 자신의 오류를 수정할 수 있음
  • 정답을 생성한 에이전트 역시 다른 답변을 검토하면서 자신의 계산이 타당한지 다시 확인함
  • 토론 과정에서 모든 에이전트가 즉시 정답을 받아들이는 것은 아님
    • 중간 라운드에서 불완전한 수정이나 새로운 오류가 나타날 수 있음
    • 반복적인 토론을 통해 점진적으로 정확한 답에 가까워짐

핵심 한 문장: 각 에이전트가 독립적으로 생성한 답변을 서로 공유하고 반복적으로 수정하게 함으로써, 잘못된 답변을 교정하고 최종적으로 더 정확한 합의에 도달한다.

 

2.1 Multi-Agent Language Generation

2.1.1 인간의 다중 추론 과정에서 얻은 아이디어

  • 사람은 하나의 문제를 해결할 때 반드시 하나의 추론 방식만 사용하는 것이 아님
  • 동일한 문제를 여러 방식으로 해결한 뒤 결과를 비교하여 답의 신뢰도를 높일 수 있음
  • 논문에서는 변의 길이가 3, 4, 5인 삼각형의 넓이를 구하는 문제를 예로 제시함
    • 첫 번째 추론 방식
      • 3-4-5 삼각형이 직각삼각형임을 인식
      • 넓이를 0.5 × 3 × 4 = 6으로 계산
    • 두 번째 추론 방식
      • 코사인 법칙을 이용하여 두 변 사이의 각도 θ를 계산
      • 0.5 × 3 × 4 × sin(θ)를 이용하여 넓이를 계산
      • 참고: 원문에는 첫 번째 계산 결과가 64로 적혀 있지만, 실제 계산값은 6이므로 논문의 오탈자로 보임.
  • 서로 다른 두 추론 과정이 동일한 답을 제시하면 결과에 대한 신뢰도가 높아짐
  • 반대로 두 추론 결과가 다르면 다음 과정을 거치게 됨
    • 각 추론 과정의 가정 확인
    • 계산 과정 비교
    • 잘못된 부분 검토
    • 일관된 답이 나올 때까지 추론 수정
  • 논문은 이러한 과정을 인간의 머릿속에서 이루어지는 mental debate로 설명함

2.1.2 여러 출처를 이용한 사실 검증

  • 전기와 같은 사실 중심의 글을 작성할 때도 유사한 검증 과정이 사용됨
  • 특정 역사적 인물의 전기를 작성한다고 가정하면
    • 하나의 출처만 신뢰하지 않고 여러 자료에서 동일한 사실을 확인함
    • 여러 출처에서 일치하는 정보는 신뢰도가 높아짐
    • 출처마다 서로 다른 정보가 제시되면 추가적인 검토가 필요함
  • 즉, 사실성 검증은 다음 과정으로 이루어질 수 있음
    1. 여러 출처에서 정보 수집
    2. 출처 간 내용 비교
    3. 일치하지 않는 사실 발견
    4. 각 정보의 근거를 재검토
    5. 최종적으로 일관된 사실 선택
  • 본 논문은 이러한 multi-source factuality checking 과정도 Multi-Agent Debate로 구현하고자 함

2.1.3 Multi-Agent Debate의 기본 구성

  • 인간의 다중 추론 및 여러 출처를 활용한 사실 검증 과정을 모방하기 위해 여러 LLM 인스턴스를 사용함
  • 각 agent는 하나의 LLM 복사본으로 구성됨
    • 동일한 언어 모델을 여러 번 독립적으로 실행
    • 각 모델 인스턴스를 별도의 agent로 간주
  • 하나의 질문이 주어지면 여러 agent가 각각 독립적인 답변을 생성함
  • 각 agent의 답변은 다음 중 하나로 해석할 수 있음
    • 하나의 가능한 추론 과정
    • 하나의 후보 답변
    • 하나의 독립적인 정보 출처
  • 여러 답변을 동시에 유지함으로써 하나의 모델이 생성한 최초 답변에만 의존하지 않음

2.1.4 Debate 진행 과정

Step 1. 독립적인 초기 답변 생성

  • 먼저 동일한 문제를 각 agent에게 독립적으로 제시함
  • 각 agent는 다른 agent의 답변을 보지 않은 상태에서 자신의 답변을 생성함
  • 따라서 초기 답변에서는 다음과 같은 다양성이 나타날 수 있음
    • 서로 다른 최종 답
    • 서로 다른 풀이 방식
    • 서로 다른 가정
    • 서로 다른 사실 정보

Step 2. 다른 Agent의 답변 공유

  • 모든 agent의 초기 답변이 생성되면 토론을 시작함
  • 각 agent에게 자신을 제외한 다른 agent들의 답변을 context로 제공함
  • 다른 agent의 응답은 하나의 문자열로 연결되어 prompt 안에 삽입됨

Step 3. 답변 검증 및 수정

  • 각 agent는 다른 agent들의 답변을 바탕으로 새로운 답변을 작성함
  • 이때 각 agent는 두 가지 역할을 수행함
    • 다른 agent들의 답변이 타당한지 검증
    • 다른 답변을 참고하여 자신의 답변을 수정
  • 다른 agent의 의견을 무조건 받아들이는 것은 아님
    • 다른 답변에서 오류를 발견할 수 있음
    • 자신의 기존 답변이 더 타당하다고 판단하면 유지할 수 있음
    • 여러 답변의 일부를 결합하여 새로운 풀이를 만들 수도 있음

Step 4. 여러 Round 반복

  • 수정된 답변들을 다시 각 agent에게 제공함
  • 동일한 검토 및 수정 과정을 여러 round 반복함
  • 반복적인 토론을 통해 성능을 향상하고 최종적인 합의에 가까워짐

2.1.5 각 Agent의 역할

  • 각 agent는 단순히 새로운 답을 생성하는 역할만 수행하지 않음
  • 구체적으로 다음 역할을 동시에 담당함
    • Solver
      • 주어진 문제에 대한 독립적인 답변 생성
    • Critic
      • 다른 agent의 추론과 답변 검토
    • Verifier
      • 여러 답변의 계산, 논리 및 사실적 일관성 확인
    • Reviser
      • 다른 의견을 반영하여 자신의 답변 수정

핵심: 하나의 LLM 인스턴스가 문제 해결자이면서 동시에 다른 답변을 평가하는 검증자의 역할을 수행한다.


Figure 3. Debate Prompt

  • Figure 3은 agent에게 다른 agent들의 답변을 전달하고 자신의 답변을 수정하도록 유도하는 consensus prompt를 보여줌
  • [other answers] 위치에 다른 agent들이 이전 round에서 생성한 답변을 삽입함
  • 논문은 두 종류의 debate prompt를 사용함
    • Short-form debate prompt
    • Long-form debate prompt

Short-form Debate Prompt

“These are the solutions to the problem from other agents: [other answers]. Based off the opinion of other agents, can you give an updated response …”

  • 다른 agent들의 풀이를 제공한 뒤 이를 참고하여 답변을 수정하도록 요청함
  • 비교적 짧고 직접적인 지시문으로 구성됨
  • 모델이 다른 답변을 참고하되, 구체적으로 어떤 방식으로 검토해야 하는지는 상세히 지시하지 않음

Long-form Debate Prompt

“These are the solutions to the problem from other agents: [other answers]. Using the opinion of other agents as additional advice, can you give an updated response …”

  • 다른 agent의 의견을 additional advice로 사용하도록 명시함
  • 다른 답변을 절대적인 정답이 아니라 추가적인 참고 자료로 취급하도록 유도함
  • agent가 자신의 판단을 유지하면서 다른 의견을 검토하도록 설계됨

Figure 3의 핵심 의미

  • 별도의 복잡한 통신 구조를 설계하지 않고도 일반적인 text prompt만으로 agent 간 토론을 구현할 수 있음
  • agent 사이에서 직접 메시지를 주고받는 별도 시스템이 필요한 것이 아님
    • 이전 round의 다른 답변을 수집
    • 해당 답변을 다음 prompt에 삽입
    • 각 agent가 새로운 응답을 생성
  • 따라서 제안 방법은 모델 내부에 접근하지 않고도 API 기반의 black-box LLM에 적용할 수 있음
  • Figure 3은 Debate의 핵심 연산이 다음과 같이 단순하다는 점을 보여줌

다른 agent들의 답변을 context로 제공하고, 이를 참고하여 자신의 답변을 다시 생성하게 한다.


2.1.6 기존 Prompting 기법과의 관계

  • Multi-Agent Debate는 기존 prompting 기법을 대체하는 방법이 아님
  • 기존 기법과 독립적으로 적용되는 orthogonal approach
  • 즉, 각 agent가 초기 답변이나 수정된 답변을 생성할 때 다른 prompting 기법을 함께 사용할 수 있음
    • Chain-of-Thought
    • Retrieval
    • Verification
    • Self-consistency
    • Prompt engineering
  • 더 자세한 추론을 유도하는 prompting 기법을 적용하면 agent들이 서로 검토할 수 있는 정보도 풍부해질 수 있음
  • 논문의 실제 평가에서는 각 agent에게 Zero-shot Chain-of-Thought를 적용함
    • 단순히 최종 답만 생성하지 않음
    • 문제를 단계별로 추론하도록 유도
    • 다른 agent가 최종 답뿐 아니라 추론 과정의 오류까지 확인할 수 있도록 함
  • 기존 prompting 방식과 Debate를 결합했을 때 나타나는 효과는 Figure 6에서 분석함

 

2.2 Consensus in Debates

2.2.1 핵심 질문

  • 여러 LLM agent가 여러 round에 걸쳐 토론할 때, 최종적으로 하나의 공통된 답변에 도달할 수 있는가?
  • Multi-Agent Debate는 일반적으로 multi-agent game으로 볼 수 있음
    • 각 agent가 서로 다른 답변과 추론을 유지할 수 있음
    • 이론적으로는 agent들이 반드시 하나의 답으로 수렴한다는 보장이 없음
    • 토론이 계속되거나 서로 다른 의견을 끝까지 유지할 가능성도 존재함
  • 그러나 실제 실험에서는 여러 round의 debate 이후 agent들이 대부분 하나의 공통된 답변으로 수렴함
    • 이러한 현상은 Figure 4에서 확인할 수 있음

핵심: Debate의 수렴은 이론적으로 보장되지는 않지만, 실제 LLM 실험에서는 대부분 하나의 공유된 답변에 도달했다.


2.2.2 Debate 길이를 조절하는 방법

  • 저자들은 prompt를 통해 debate가 지속되는 길이를 조절할 수 있음을 발견함
  • 핵심 조절 요소는 다음과 같음
    • agent가 자신의 기존 답변을 얼마나 신뢰하는가
    • 다른 agent의 답변을 얼마나 쉽게 받아들이는가
  • 자신의 답변보다 다른 agent의 의견을 더 강하게 신뢰하도록 유도하면
    • 다른 의견을 빠르게 받아들임
    • 적은 round 안에 합의에 도달함
    • debate가 짧아짐
  • 반대로 자신의 초기 풀이를 쉽게 포기하지 않도록 유도하면
    • 다른 답변을 더 비판적으로 검토함
    • 자신의 근거와 다른 agent의 근거를 비교함
    • 합의에 도달하기까지 더 많은 round가 필요함
    • debate가 길어짐
  • 이러한 차이를 유도하기 위해 Figure 3의 두 가지 prompt를 사용함
    • Short-form prompt
    • Long-form prompt
  • 서로 다른 prompt가 debate 길이에 미치는 영향은 Figure 12에서 분석함

2.2.3 “Stubborn” Agent의 효과

  • 저자들은 자신의 답변을 어느 정도 고수하도록 유도된 agent를 stubborn agent로 표현함
  • Stubborn prompt는 agent가 다른 의견을 즉시 받아들이지 않고 자신의 풀이를 재검토하도록 유도함
  • 이 경우 agent는 다음과 같은 행동을 수행할 가능성이 높아짐
    • 자신의 계산과 근거를 다시 확인
    • 다른 agent의 논리적 오류 탐색
    • 답변 간 불일치의 원인 분석
    • 충분한 검증 이후에만 답변 수정
  • 실험 결과, agent를 더 stubborn하게 만드는 prompt는
    • Debate의 지속 시간을 증가시킴
    • 더 많은 round의 논의를 유도함
    • 최종 답변의 성능을 향상하는 경향을 보임

중요한 의미: 너무 빠른 합의보다, 일정 수준의 의견 충돌과 검증 과정이 더 정확한 답변을 만드는 데 도움이 될 수 있다.


2.2.4 빠른 합의의 문제점

  • Agent가 다른 의견을 지나치게 쉽게 받아들이면 토론이 빠르게 종료될 수 있음
  • 그러나 빠른 수렴이 항상 좋은 결과를 의미하는 것은 아님
    • 정답을 충분히 검증하지 않고 다른 agent의 답을 따라갈 수 있음
    • 한 agent의 잘못된 답변이 다른 agent들에게 빠르게 확산될 수 있음
    • 실제 토론이 아니라 단순한 동조에 가까워질 수 있음
  • 따라서 효과적인 Multi-Agent Debate를 위해서는 두 요소 사이의 균형이 필요함
    • 다른 agent의 의견을 받아들일 수 있는 개방성
    • 자신의 추론을 충분히 검증하는 비판성

2.2.5 LLM Agent의 Agreeableness

  • 저자들은 전반적으로 LLM agent들이 비교적 agreeable, 즉 다른 의견에 쉽게 동의하는 성향을 보였다고 설명함
  • 가능한 원인
    • Instruction tuning
    • Reinforcement Learning from Human Feedback, RLHF
  • 이러한 학습 과정에서는 일반적으로 모델이 다음과 같이 행동하도록 조정됨
    • 사용자의 지시를 따름
    • 협조적인 답변을 생성함
    • 대립하거나 고집하기보다 상대의 의견을 수용함
  • 이러한 성향이 Multi-Agent Debate에서도 나타날 수 있음
    • 다른 agent의 답을 쉽게 받아들임
    • 자신의 기존 답변을 빠르게 포기함
    • 예상보다 빠르게 consensus에 도달함
  • 따라서 prompt를 통해 agent가 자신의 답을 비판적으로 유지하도록 유도할 필요가 있음

2.2.6 Consensus 형성 과정

  • Multi-Agent Debate의 consensus는 다음과 같은 흐름으로 형성됨
  1. 각 agent가 독립적인 답변을 생성함
  2. Agent들이 서로 다른 답변과 추론을 확인함
  3. 각 agent가 자신의 풀이와 다른 풀이를 비교함
  4. 신뢰할 수 있는 근거는 수용하고, 잘못된 근거는 반박함
  5. 수정된 답변을 다시 공유함
  6. 이러한 과정을 여러 round 반복함
  7. 답변 간 차이가 점차 감소하며 하나의 공통된 답으로 수렴함
  • 다만 consensus가 형성되었다는 사실만으로 최종 답변이 반드시 정답이라는 의미는 아님
    • 모든 agent가 동일한 오답에 합의할 가능성도 존재함
    • 따라서 중요한 것은 합의 자체가 아니라 충분한 비판과 검증을 거친 합의

Figure 연결

Figure 3

  • 서로 다른 prompt를 사용하여 agent가 다른 의견을 받아들이는 정도를 조절함
  • Prompt의 표현 방식에 따라 debate의 지속 시간이 달라질 수 있음

Figure 4

  • 여러 round의 debate를 통해 agent들이 서로 다른 초기 답변에서 하나의 답변으로 수렴하는 사례를 보여줌

Figure 12

  • Prompt 구성에 따라 debate의 길이와 최종 성능이 어떻게 달라지는지 분석함
  • 자신의 답을 더 강하게 유지하도록 유도한 prompt가 더 긴 debate와 더 나은 결과를 만드는 경향을 보여줌

핵심 요약

Multi-Agent Debate는 이론적으로 수렴이 보장되지는 않지만, 실제 실험에서는 대부분의 LLM agent가 여러 round 후 하나의 답변에 도달했다. 또한 agent들이 다른 의견에 즉시 동의하지 않고 자신의 추론을 어느 정도 고수하도록 유도하면 토론이 길어지지만, 더 충분한 검증을 거쳐 최종 성능이 향상되는 경향이 나타났다.

 

3. Experiments

3.1 실험 목적

  • 실험에서는 Multi-Agent Debate에 관한 다음 세 가지 연구 질문을 검증함
  1. Multi-Agent Debate가 LLM의 추론 성능을 얼마나 향상하는가?
  2. Multi-Agent Debate가 생성된 답변의 사실적 정확성을 얼마나 향상하는가?
  3. 어떤 설계 요소가 Multi-Agent Debate의 성능 향상에 기여하는가?
  • Section 3.1에서는 이 가운데 첫 번째 질문인 추론 능력 향상 효과를 평가함

3.1 Improving Reasoning with Multi-Agent Debate

3.1.1 실험 목적

  • Multi-Agent Debate가 LLM의 기본적인 추론 능력을 실제로 향상하는지 확인함
  • 난이도와 추론 유형이 서로 다른 세 가지 과제를 사용함
    • 단순 계산
    • 초등학교 수준의 수학 문장제
    • 체스 수 예측을 통한 전략적 추론

3.1.2 Evaluation Tasks

1. Arithmetic

  • 여섯 개의 서로 다른 두 자리 수로 구성된 산술식을 계산하는 과제
  • 식에는 다음 연산이 포함됨
    • 덧셈
    • 뺄셈
    • 곱셈
  • 예시

What is the result of 12 + 15 × 21 + 0 − 3 × 27?

  • 모델이 생성한 최종 답의 정확도를 평가함
  • 비교적 단순한 계산 과제이지만, 연산 순서나 중간 계산에서 오류가 발생할 수 있음

2. GSM8K

  • GSM8K 데이터셋의 초등학교 수준 수학 문장제를 사용함
  • 단순히 식을 계산하는 것이 아니라 문제의 내용을 이해하고 적절한 계산식을 구성해야 함
  • 필요한 능력
    • 자연어 문제 이해
    • 수치 간 관계 파악
    • 여러 단계의 계산
    • 최종 답 도출
  • 모델이 생성한 최종 답의 정확도를 평가함

3. Chess Move Prediction

  • 체스 경기에서 가장 좋은 다음 수를 예측하는 과제
  • 두 명의 체스 그랜드마스터가 실제로 진행한 경기의 첫 14수를 PGN 표기법으로 제공함
  • 모델은 현재 보드 상태를 추론하여 가장 적절한 다음 수를 제시해야 함
  • 단순 계산이 아니라 다음과 같은 전략적 추론 능력을 요구함
    • 현재 보드 상태 이해
    • 후보 수 비교
    • 장기적인 유불리 판단
    • 상대의 대응 예측
  • 모델이 제안한 수는 체스 엔진 Stockfish를 사용하여 평가함
  • 평가 지표는 해당 수가 가져오는 우위를 나타내는 pawn score 또는 APS
    • 점수가 높을수록 더 좋은 수를 예측한 것으로 해석함

3.1.3 Baselines

  • Multi-Agent Debate의 효과를 검증하기 위해 다음 네 가지 방법을 비교함

1. Single Agent

  • 하나의 LLM agent가 문제를 한 번 해결함
  • 다른 agent의 답변이나 추가적인 검토 과정이 없음
  • 가장 기본적인 비교 기준임

2. Single Agent with Reflection

  • 하나의 agent가 먼저 답변을 생성함
  • 이후 자신의 기존 답변을 스스로 비판하고 수정함
  • Debate와 달리 다른 agent의 의견은 제공되지 않음
  • 단일 모델 내부의 self-reflection만 사용함

3. Multi-Agent with Majority Voting

  • 여러 agent가 각각 독립적으로 답변을 생성함
  • agent 간 토론이나 추론 공유 없이 가장 많이 나온 답을 최종 답으로 선택함
  • 여러 모델의 다양성은 활용하지만, 서로의 오류를 직접 검토하거나 수정하지는 않음

4. Multi-Agent Debate

  • 여러 agent가 독립적으로 답변을 생성함
  • 이후 서로의 답변과 추론을 읽고 비판함
  • 여러 round에 걸쳐 자신의 답변을 수정함
  • Multi-Agent Generation과 Reflection을 결합한 방식으로 볼 수 있음

3.1.4 공정한 비교를 위한 실험 설정

  • 모든 방법에 동일한 조건을 적용함
    • 동일한 초기 prompt
    • 동일한 language model
    • 동일한 평가 데이터
  • 실험은 별도의 예시를 제공하지 않는 zero-shot setting에서 진행함
  • 대부분의 실험에서 ChatGPT 기반 언어 모델을 사용함
  • 서로 다른 종류의 LLM을 비교하는 실험은 Figure 11에서 별도로 수행함
  • 계산 비용을 고려하여 주요 실험에서는 다음 설정을 사용함
    • Agent 수: 3개
    • Debate round 수: 2회
  • 다만 agent 수와 debate round를 더 늘렸을 때 추가적인 성능 향상이 나타났으며, 해당 결과는 Figure 10에서 분석함

Table 1. Multi-Agent Debate Improves Reasoning

MethodArithmetic Accuracy ↑GSM8K Accuracy ↑Chess APS ↑

Single Agent 67.0 ± 4.7 77.0 ± 4.2 91.4 ± 10.6
Single Agent (Reflection) 72.1 ± 4.5 75.0 ± 4.3 102.1 ± 11.9
Multi-Agent (Majority) 69.0 ± 4.6 81.0 ± 3.9 102.2 ± 6.2
Multi-Agent (Debate) 81.8 ± 2.3 85.0 ± 3.5 122.9 ± 7.6
  • 모든 지표는 높을수록 좋은 성능을 의미함
  • Multi-Agent Debate가 세 과제 모두에서 가장 높은 성능을 기록함

3.1.5 Quantitative Results

Arithmetic

  • Single Agent: 67.0%
  • Reflection: 72.1%
  • Majority Voting: 69.0%
  • Multi-Agent Debate: 81.8%
  • Debate는 Single Agent보다 약 14.8%p 높은 정확도를 기록함
  • 단순히 여러 답 중 다수결을 수행하는 것보다 agent들이 서로의 풀이를 검토하는 것이 훨씬 효과적이었음

GSM8K

  • Single Agent: 77.0%
  • Reflection: 75.0%
  • Majority Voting: 81.0%
  • Multi-Agent Debate: 85.0%
  • Multi-Agent Debate가 가장 높은 **85.0%**의 정확도를 기록함
  • Majority Voting도 Single Agent보다 성능이 향상되었지만, Debate보다는 낮았음
  • Reflection은 오히려 Single Agent보다 약간 낮은 결과를 보임
    • 자기검토가 항상 오류 수정으로 이어지는 것은 아님
    • 모델이 자신의 기존 오답을 강화하거나 새로운 오류를 만들 가능성도 있음

Chess Move Prediction

  • Single Agent: 91.4 APS
  • Reflection: 102.1 APS
  • Majority Voting: 102.2 APS
  • Multi-Agent Debate: 122.9 APS
  • 체스에서도 Debate가 가장 높은 성능을 보임
  • 따라서 Multi-Agent Debate의 효과가 단순한 수학 계산에만 한정되지 않고, 전략적 추론 문제에도 적용될 수 있음을 보여줌

3.1.6 결과 해석

  • 여러 agent를 사용하는 것만으로도 일부 과제에서 Single Agent보다 성능이 향상됨
    • 여러 agent가 서로 다른 답변과 추론 경로를 생성하기 때문
  • Single Agent Reflection도 일부 과제에서 일정한 성능 향상을 제공함
    • 자신의 답변을 다시 확인하는 과정이 오류 수정에 도움이 될 수 있음
  • 그러나 가장 큰 성능 향상은 Multi-Agent Debate에서 나타남
    • 여러 agent가 제공하는 다양한 추론 경로
    • 다른 답변에 대한 비판
    • 자신의 답변을 수정하는 reflection
      을 동시에 활용하기 때문

핵심 결과: 여러 답변 중 하나를 단순히 선택하는 것보다, agent들이 서로의 추론을 직접 검토하고 수정하도록 만드는 것이 더 효과적이다.


Figure 4. Illustration of Solving Math

  • Figure 4는 산술 문제에서 agent들이 여러 round에 걸쳐 답변을 수정하는 사례를 보여줌
  • 그림에서는 가독성을 위해 각 agent의 구체적인 추론 과정은 생략하고 최종 답만 표시함

주요 사례

  • 일부 문제에서는 두 agent가 Round 1에서 모두 오답을 제시함
  • 그러나 Round 2에서 서로의 풀이를 검토한 뒤 두 agent 모두 정답으로 수정함
  • 또 다른 문제에서는
    • 세 agent가 모두 서로 다른 오답을 생성함
    • 이후 일부 agent가 정답에 도달함
    • 추가적인 round를 거쳐 모든 agent가 동일한 정답으로 수렴함

Figure 4의 핵심 의미

  • Debate는 처음부터 정답을 제시한 agent를 단순히 찾아내는 방식이 아님
  • 모든 agent가 처음에 틀렸더라도, 서로의 추론을 비판하는 과정에서 정답을 새롭게 발견할 수 있음

핵심: Debate는 정답의 다수결이나 정답 agent의 의견 확산을 넘어, 토론 과정에서 새로운 올바른 추론을 만들어낼 수 있다.


Figure 5. Illustration of Solving Grade School Math

  • Figure 5는 GSM8K 형태의 수학 문장제에서 Debate가 작동하는 사례를 보여줌
  • 마찬가지로 구체적인 추론 과정은 생략하고 각 round의 답만 제시함

사례 1: 소설의 수 계산

  • 문제
    • Regina는 작년에 소설 9편을 집필함
    • 올해는 작년의 3분의 1에 해당하는 수를 더 집필함
    • 현재까지 집필한 전체 소설 수를 계산함
  • Round 1
    • Agent 1: 48이라는 오답
    • Agent 2: 12라는 정답
  • Round 2
    • Agent 1이 답을 12로 수정
    • 두 agent 모두 정답에 합의함

사례 2: 버터 가격 계산

  • 문제
    • Dennis는 크루아상 12개마다 버터 1파운드를 사용함
    • 크루아상 6다스를 만들기 위해 필요한 버터의 비용을 계산함
    • 버터는 1파운드에 4달러이며, 1파운드를 구매하면 절반 가격으로 1파운드를 추가 구매할 수 있음
  • Round 1
    • Agent 1: 18이라는 정답
    • Agent 2: 30이라는 오답
  • Round 2
    • Agent 2가 자신의 답을 18로 수정
    • 두 agent 모두 정답에 합의함

Figure 5의 핵심 의미

  • 다른 agent의 풀이가 오답을 낸 agent에게 오류를 발견할 수 있는 외부 관점으로 작용함
  • Debate를 통해 단순 계산 오류뿐 아니라 문장의 조건을 잘못 해석한 오류도 수정할 수 있음

3.1.7 Qualitative Results

  • Figure 4와 Figure 5의 사례에서 다음과 같은 패턴이 확인됨
  1. 한 agent가 정답을 제시하고 다른 agent가 이를 참고해 오답을 수정함
  2. 처음에는 모든 agent가 오답을 제시했지만 토론 중 정답에 도달함
  3. 여러 round를 거치면서 agent들의 답변이 하나로 수렴함
  • 특히 모든 agent가 처음부터 틀린 사례는 Debate의 중요한 차별점을 보여줌
  • 만약 단순 다수결만 사용했다면
    • 모든 agent가 오답일 경우 정답을 선택할 수 없음
    • 가장 많이 나온 오답이 그대로 최종 답이 됨
  • 반면 Debate에서는
    • 서로의 계산과 전제를 검토함
    • 오답 사이의 모순을 발견함
    • 기존 답변에 없었던 새로운 추론을 수행함
    • 최종적으로 정답을 도출할 수 있음

3.1.8 Compatibility with Other Reasoning Methods

  • Multi-Agent Debate는 기존의 단일 agent prompting 기법과 독립적으로 결합할 수 있음
  • 논문에서는 GSM8K 과제에서 다음 조건을 비교함
    • Chain-of-Thought 없이 Multi-Agent Debate 적용
    • Zero-shot Chain-of-Thought와 Multi-Agent Debate를 함께 적용
  • 두 조건 모두에서 agent 간 토론이 성능을 향상함
  • 이는 Debate의 효과가 특정 prompting 방식에만 의존하지 않는다는 것을 보여줌
  • Chain-of-Thought와 결합하면 각 agent가 중간 추론 과정을 더 자세히 생성하므로, 다른 agent가 오류를 발견하고 비판하기 쉬워질 수 있음
  • 구체적인 결과는 Figure 6에서 제시됨

핵심: Multi-Agent Debate는 Chain-of-Thought를 대체하는 것이 아니라, 함께 사용할 수 있는 보완적 방법이다.


3.1 핵심 요약

  • Multi-Agent Debate는 산술, 수학 문장제, 체스의 세 가지 추론 과제 모두에서 가장 높은 성능을 기록함
  • 단순한 self-reflection이나 majority voting보다 일관되게 좋은 결과를 보임
  • 특히 모든 agent가 처음에 오답을 생성한 경우에도 서로의 추론을 검토하면서 정답에 도달할 수 있었음
  • 따라서 Debate의 효과는 정답을 고르거나 확산시키는 데 그치지 않고, 상호 비판을 통해 새로운 올바른 추론을 형성하는 데 있음