ParleyParley

블로그

여러 AI 모델을 함께 사용해야 하는 이유를 실제 연구를 바탕으로 설명합니다.

AI가 자기 자신의 답변을 채점하면 안 되는 이유

2025년 연구에 따르면 GPT-4는 자기 자신의 답변을 인간보다 훨씬 후하게 평가하는 것으로 나타났다. 게다가 그 이유는 '정답이라서'가 아니었다.

2026년 8월 22일 · 읽는 시간 약 6분

AI 모델끼리 논쟁하게 하면 어떤 일이 일어날까

MIT와 Google Brain 연구팀은 언어 모델들이 서로 토론하게 하면 수학 정답률이 67%에서 82%로 오르고 사실 오류도 크게 줄어든다는 것을 발견했다. 다만 이 방식으로 고쳐지는 오류에는 조건이 있다.

2026년 8월 22일 · 읽는 시간 약 7분

AI에게 여러 번 묻는 것이 더 큰 모델보다 나을 수 있다

Tencent 연구팀은 작은 모델에 반복적으로 질문하고 답변에 다수결 투표를 적용하는 것만으로, 한 번만 질문한 훨씬 더 큰 모델과 맞먹거나 이를 뛰어넘는 정확도를 낼 수 있음을 발견했다.

2026년 8월 22일 · 읽는 시간 약 6분

그룹 브레인스토밍이 실패하는 이유, AI에는 같은 문제가 없는 이유

1987년 연구에 따르면 여럿이 함께 브레인스토밍하면 혼자 생각할 때보다 아이디어 수가 거의 절반으로 줄어드는 것으로 나타났다. 그 원인은 AI 참여자에게는 애초에 존재하지 않는 문제였다.

2026년 8월 22일 · 읽는 시간 약 7분

스탠퍼드 AI 연구팀에는 전담 '회의론자'가 있었다. 그리고 효과가 있었다

스탠퍼드 대학교와 Chan Zuckerberg Biohub가 서로 다른 전문 영역을 가진 AI 에이전트들(다른 에이전트를 비판하는 역할 포함)을 구성해 실제 COVID 나노바디를 설계했다. 실험실 테스트에서 90% 이상이 작동했다.

2026년 8월 22일 · 읽는 시간 약 6분

AI 에이전트를 늘리면 오히려 더 나빠질 수 있다

2026년 연구에 따르면 AI 에이전트에게 서로 다른 전문가 페르소나를 부여하면 테스트한 모든 구성 중 가장 다양성이 낮은 아이디어가 나올 수 있는 것으로 밝혀졌다. 그 원인과 방지책도 함께 밝혀졌다.

2026년 8월 22일 · 읽는 시간 약 8분