AI 에이전트를 늘리면 오히려 더 나빠질 수 있다
2026년 연구에 따르면 AI 에이전트에게 서로 다른 전문가 페르소나를 부여하면 테스트한 모든 구성 중 가장 다양성이 낮은 아이디어가 나올 수 있는 것으로 밝혀졌다. 그 원인과 방지책도 함께 밝혀졌다.
2026년 8월 22일 · 읽는 시간 약 8분
지금까지 이 시리즈의 모든 글은 같은 기본 주장을 해왔다: 독립적인 AI의 관점은 단일 모델이 놓치는 것을 잡아낸다는 것이다. 이번 글은 그 주장에 대한 꼭 필요한 검증이다. 2026년 싱가포르 국립대학교와 홍콩중문대학교(선전) 연구팀은 멀티 에이전트 AI가 실제로 그 약속된 다양성을 언제 제공하는지를 정확히 검증했고, 시도한 모든 구성 중 가장 다양성이 낮은 결과물을 만들어내는 특정하고 흔한 구성을 발견했다.
가장 다양한 아이디어가 나오기 어려운 구성: 전문가를 배정하는 것
Nuo Chen, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Qingyun Zou, Qian Wang, Bingsheng He 연구팀은 20개 주제에 걸쳐 1만 건이 넘는 연구 제안서를 생성해 AI 팀을 구성하는 다섯 가지 방식을 비교했다: 역할을 전혀 정의하지 않은 방식(Naive), 시니어 전문가가 주니어 에이전트를 지휘하는 방식(Leader-Led), 위계 없이 평평하게 구성된 초년차 페르소나 집단(Horizontal), 서로 다른 전문 분야의 패널(Interdisciplinary), 그리고 연차를 의도적으로 섞은 방식(Vertical). 이들은 단순히 출력 개수가 아니라 실질적으로 구별되는 아이디어 군집 수를 세는 Vendi Score라는 지표로 진짜 의미론적 다양성을 측정했으며, 이는 인간 판단과 87% 일치율로 검증됐다.
"주니어 중심의 수평적 협업이 가장 높은 다양성을 달성했고, 다학제적 전문가 팀이 가장 낮은 다양성을 보였다. 품질 차이는 미미했다."
직관에 반하는 부분은 실제 수치다:
- Horizontal(평평한 구조, 전문성 배정 없음): Vendi Score 8.08 — 가장 다양함
- Vertical(연차 혼합): 약 7.5
- Leader-Led(권위자 한 명): 5.6
- Interdisciplinary(서로 다른 분야의 전문가): 4.65 — 다섯 가지 중 가장 다양성이 낮음
에이전트에게 이름 붙은 전문성을 부여하는 것 — 언뜻 방 안의 관점 폭을 넓혀줄 것 같은 바로 그 조치가 — 가장 좁은 결과를 만들어냈다. 조건 간 전체적인 아이디어 품질은 거의 변하지 않았으므로 (10점 만점에 7.88~8.50), 이는 다양성과 품질 사이의 트레이드오프가 아니다. 다양성이 그냥 사라진 것이다.
원인: 판단이 아니라 "동의"가 기본값이 된다
논문은 그 메커니즘을 구체적으로 설명하는데, 모델의 무능함이 원인은 아니다:
"에이전트에게 다양한 관점을 이끌어내기 위해 서로 다른 페르소나나 역할이 부여되더라도, 이들은 여전히 공유된 귀납적 편향에 뿌리를 두고 있다. […] 상호작용은 에이전트들이 독립적인 비판보다 동의를 우선시하는 '에코 챔버 효과'로 변질된다."
중요한 것은, 이들이 전문가 프레이밍이 구체적으로 왜 해로운지를 밝혀냈다는 점이다: 원인은 전문성 그 자체가 아니라, 전문성과 암묵적 권위의 조합이다. 실제로 완전히 평평한 구조에서는 시니어 페르소나가 주니어 페르소나보다 더 높은 다양성을 만들어냈고, 이는 연차 자체를 원인에서 배제한다. 원인은 서로 다른 역할과, 하나의 관점이 다른 모두가 스스로를 견주는 기준점으로 작동하게 만드는 구조의 조합이다. Leader-Led 구성에서 주니어 에이전트들은 독립적인 반박을 내놓는 대신 리더의 답변에 맞춰 자신의 답을 조정했다.
같은 붕괴는 규모를 키워도 나타난다: 에이전트를 늘리면 총 다양성은 증가하지만, 추가되는 에이전트 한 명이 실제로 기여하는 양 — 에이전트 수로 나눈 Vendi Score — 은 3명일 때 1.03에서 7명일 때 0.47로 떨어진다. 새로운 에이전트는 새 영역을 여는 대신 그룹이 이미 다룬 영역을 대부분 되풀이한다. 그리고 더 강력하고 정렬(alignment)이 더 잘 된 모델일수록 이 문제는 개선되기는커녕 악화됐다. 논문은 이를 "컴퓨팅 효율 역설"이라 부른다 — 더 나은 모델은 개별 답변의 품질은 높이면서도 에이전트 간에는 더 비슷한 내용으로 수렴한다는 것이다.
실제로 이를 막는 방법
논문은 진단에서 멈추지 않는다. 개입 방안을 검증했고, 그중 두 가지가 효과가 있었다:
1. 논의 전에 독립적으로 생성하기
"블라인드 작성" 단계 — 다른 누구의 답변도 보기 전에 각 에이전트가 자기 답을 먼저 작성하는 방식 — 은 테스트한 모든 조건 중 가장 높은 의미론적 다양성으로 시작해 세션 내내 그 우위를 유지했다. 이 기법은 AI 연구 밖에서도 이름이 있다: 명목집단기법(Nominal Group Technique)으로, 프로덕션 블로킹에 관한 글에서 다룬 인간 브레인스토밍의 바로 그 실패 유형을 해결하기 위해 나온, 수십 년 된 기법이다. 인간 집단을 돕는 것과 같은 구조적 해법이, 관련은 있지만 다른 이유로 AI 집단에도 도움이 된다는 것이 밝혀졌다 — 인간은 자기 차례를 기다리는 동안 아이디어를 잃지만, AI 에이전트는 자기 생각을 형성하기 전에 다른 에이전트의 답을 읽어버림으로써 독립성을 잃는다.
2. 단순한 프롬프트 차이가 아니라 진짜로 다른 모델
"모델 이질성은 권위 구조 안에서도 다양성을 구해낸다."
여러 모델을 섞은 Horizontal 팀은 단일 모델로 구성된 모든 기준선을 능가했다. "당신은 면역학자입니다"라는 페르소나 프롬프트는 모델 자체 — 서로 다른 개발사, 서로 다른 학습 데이터, 서로 다른 정렬 방식 — 에 비하면 진짜 변이의 원천으로서는 훨씬 약하다. 같은 모델의 복제본 다섯 개에 다섯 개의 다른 직함을 부여하는 것은, 실제로 다른 다섯 개의 모델이 같은 질문에 답하는 것에 비하면 훨씬 얕은 형태의 다양성이다.
실무에서의 의미
이것은 이 시리즈의 다른 모든 글에 대한 솔직한 단서 조항이다: 여러 AI 에이전트를 한 방에 두는 것만으로는 당신이 원하는 독립적 사고가 자동으로 생기지 않는다. 이를 확실히 죽이는 구성이 두 가지 있다 — 모두가 자기 답을 내기 전에 다른 모든 사람의 답을 보게 되는, 이력이 밀접하게 공유되는 논의 구조. 그리고 한 참여자가 다른 모두가 수렴하는 권위로 작동하는 어떤 구조든. 둘 다 의도치 않게 만들어지기 쉽다.
논문 자체가 가리키는 해법은 우리가 Room을 구성하는 방식으로 제안하는 것과 일치한다: 초기의 발산 단계에서는 하나의 질문을 모든 모델에 동시에 던져라 — 정말로 독립적으로, 누구도 다른 사람의 답에 발이 묶이지 않도록. 그리고 하나의 모델이 여러 역할을 연기하게 하기보다는 실제로 서로 다른 프로바이더를 섞어라. 서로가 보이는 공유 논의는 독립적인 답이 이미 존재한 이후를 위해 남겨두고, 그 발산 단계 동안에는 어떤 참여자도 Room의 사실상 권위로 작동하지 않도록 의식적으로 신경 써라.
이 방식의 구체적인 적용법(ModelSight의 브로드캐스트가 비교를 요청하기 전까지 서로의 답을 전혀 보여주지 않도록 설계된 이유를 포함해)은 모범 사례 가이드를 참고하라.
참고문헌
- Chen, N., Tong, Y., Yang, Y., He, Y., Zhang, X., Zou, Q., Wang, Q., & He, B. (2026). Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation. arXiv:2604.18005.