스탠퍼드 AI 연구팀에는 전담 '회의론자'가 있었다. 그리고 효과가 있었다

스탠퍼드 대학교와 Chan Zuckerberg Biohub가 서로 다른 전문 영역을 가진 AI 에이전트들(다른 에이전트를 비판하는 역할 포함)을 구성해 실제 COVID 나노바디를 설계했다. 실험실 테스트에서 90% 이상이 작동했다.

2026년 8월 22일 · 읽는 시간 약 6분

2024년 하반기, 스탠퍼드 대학교와 Chan Zuckerberg Biohub 팀은 여러 AI 에이전트에게 정말로 어려운, 정해진 답이 없는 연구 문제를 맡겼습니다. 기존 나노바디(항체와 비슷한 소형 단백질)가 코로나바이러스 원래 변이주에 결합하는 것과 같은 방식으로, 현재 유행 중인 변이주에 결합하는 새로운 나노바디를 설계하는 과제였습니다. 정답이 정해진 벤치마크 문제가 아니라 — 아직 아무도 풀지 못한 진짜 연구 문제였습니다. AI 팀은 92개의 후보를 설계했습니다. 연구자들은 이를 실제로 합성해 습식 실험실에서 검증했습니다. 90% 이상이 올바르게 발현되고 접혔으며, 그중 2개는 기존 항체가 설계될 당시에는 존재하지도 않았던 변이주에 대해 실제로 유용한 결합 프로파일을 보였습니다.

팀은 하나의 모델이 아니라, 전문가들의 '배역'이었다

Kyle Swanson, Wesley Wu, Nash Bulaong, John Pak, James Zou 는 그들이 Virtual Lab이라 부르는 시스템을 만들었습니다. 수석 연구원(PI) 에이전트가 면역학자, 머신러닝 전문가, 계산생물학자 같은 과학자 에이전트 팀을 구성하고 지휘합니다. 모두 동일한 기반 모델(GPT-4o)을 사용하지만, 각자 완전히 다른 직함과 전문성, 목표가 주어집니다. 결정적으로 이 팀에는 다른 에이전트들의 제안에서 문제를 찾아내는 것만을 임무로 하는 과학적 비평가(Scientific Critic) 에이전트도 포함되어 있습니다.

"우리는 다른 에이전트들의 오류와 실수를 잡아내고, 다른 에이전트가 내놓은 답변에 비판적인 피드백을 주기 위해 명시적인 비평 에이전트를 두는 것이 유용하다는 것을 발견했다."
Swanson, Wu, Bulaong, Pak & Zou, 2024/2025

이 연구는 단발성 프롬프트가 아니라 '회의'를 통해 진행됩니다 — 모든 에이전트가 하나의 질문을 두고 논의하고 PI가 라운드마다 그 의견을 종합하는 팀 회의, 그리고 한 명의 전문가가 특정 과제를 수행하는 동안 비평가가 최종 답변이 승인되기 전 매 초안마다 반박을 제기하는 개별 회의입니다. 반대 의견을 내는 전담 역할은 설계의 부산물이 아니라, 의도적으로 설계된 역할입니다.

결과: 누구도 미리 채점해 둔 적 없는 진짜 연구 문제

단백질 언어 모델 ESM, AlphaFold-Multimer, 모델링 소프트웨어 Rosetta를 결합한 이 팀의 계산 파이프라인 자체도, 미리 주어진 고정된 도구가 아니라 에이전트들이 협업해 만들어낸 것이었습니다. 코로나바이러스의 비교적 최근 변이주인 JN.1과 KP.3를 표적으로 한 나노바디에 적용한 결과:

  • 92개의 변이 나노바디가 설계되어 실제 실험실에서 실험적으로 검증되었다
  • 90% 이상이 성공적으로 발현되고 가용성을 보였다 — 설계된 단백질로서는 기본적이지만 결코 쉽지 않은 기준
  • 2개의 후보는 원래 변이주에 대한 강한 결합력을 유지하면서, 더 새로운 변이주에 대한 결합력이 개선되었다

비교할 벤치마크 점수는 존재하지 않습니다. 에이전트들이 이 문제를 풀기 전까지는 바로 이 문제에 대한 벤치마크 자체가 존재하지 않았기 때문입니다. 바로 그 점이 핵심입니다 — 이것은 객관식 정답률이 아니라, 실제로 결합하거나 하지 않는 진짜 분자를 실제 실험실에서 확인한 결과였습니다.

만든 사람 스스로가 그것을 예측했다

이 논문의 저자 중 한 명인 James Zou는 Stanford HAI의 2025년 예측에서 바로 이 프로젝트를 사례로 들며 다음과 같이 구체적으로 예측했습니다.

"2025년에는 개별 AI 모델에 의존하던 방식에서, 서로 다른 전문성을 가진 여러 AI 에이전트가 함께 작동하는 시스템을 사용하는 방식으로 큰 전환이 일어날 것이다 […] 이는 단일 모델보다 더 신뢰할 수 있고 효과적이다."
James Zou, Stanford HAI, 2024년 12월

Stanford HAI의 Russ Altman도 독립적으로 비슷한 예측을 내놓으며, 문제의 일부를 '전문가' LLM에 하청 주는 '종합건설사' LLM을 예로 들었습니다. 같은 스탠퍼드 소속인 Diyi Yang은 근본적인 목표를 이렇게 직접적으로 표현했습니다. "AI와 인간이 협력해 집단 지성을 달성하는 최선의 방법을 찾아내는 일이 점점 더 중요해질 것이다."

실제로 어떻게 적용되는가

여기서 진지하게 받아들여야 할 점은 추상적인 "AI 에이전트는 많을수록 좋다"는 이야기가 아닙니다 — 실제로 검증된 현실 세계의 성과를 만들어낸 팀이, '반대 의견을 내는 것'만을 임무로 하는 역할을 의도적으로 설계에 포함시켰다는 점입니다. 모델이 스스로를 의심하는 것이 아니라, 무언가가 승인되기 전 매 라운드마다 다른 에이전트들의 잘못을 찾아내도록 지시받은 별개의 에이전트가 있었던 것입니다. 이는 Brainstorming Room에 진짜 회의론자 역할과 전제 도전자 역할을 부여하고, 모든 참여자가 그저 동의하며 먼저 나온 의견 위에 쌓아 올리기만 하지 않도록 하는 것과 정확히 같은 원칙입니다.

Parley 자체의 역할 시스템이 어떻게 작동하는지는 모범 사례 가이드를, 전담 반대 의견 역할이 왜 자기 자신에게만 동의하는 단일 모델이 잡아내지 못하는 것을 잡아내는지에 대한 연구는 멀티에이전트 토론 자기 선호 편향 에 관한 글을 참고하세요.

참고 문헌

Back to Blog