같은 질문인데 ChatGPT와 Claude의 답이 다른 이유

둘 중 하나가 틀렸다고 생각하고 싶어집니다. 하지만 대개는 둘 다 틀리지 않았습니다.

2026년 9월 23일 · 읽는 시간 약 9분

한 번 더 확인하고 싶은 질문이 있었습니다. ChatGPT에 붙여넣어 답을 읽었고, 미심쩍어서 Claude에도 같은 것을 붙여넣었습니다. 그리고 돌아온 두 번째 답은 첫 번째 답이 아니었습니다. 표현만 다른 게 아니라 결론이 달랐습니다.

자연스러운 반응은 두 번 묻기 전보다 더 불안해지는 것입니다. 둘 중 하나는 틀렸을 텐데, 어느 쪽인지 가릴 근거가 없습니다. 결국 마음에 드는 쪽을 고르거나(그러면 물어본 의미가 없습니다) 둘 다 버리게 됩니다.

이 반응에는 따져볼 만한 전제가 깔려 있습니다. 질문에는 정답이 하나 있고, 모델은 그걸 알거나 모르거나 둘 중 하나다라는 전제입니다. 사실을 찾는 질문이라면 대체로 맞습니다. 하지만 사람들이 실제로 묻는 것의 상당수는 그렇지 않습니다. 그리고 답이 갈리는 방식은 어느 한쪽 답보다 더 유용한 것을 알려줍니다.

답이 갈리는 다섯 가지 이유

갈림에도 종류가 있고, 종류에 따라 대처가 달라집니다.

  • 학습한 텍스트가 다르고, 마감 시점도 다릅니다. 각 모델은 자기 말뭉치로, 자기 시점에 고정되었습니다. 최근에 바뀐 것을 건드리는 질문이라면 세계의 서로 다른 두 스냅숏을 듣고 있는 것일 수 있습니다. 둘 다 자기가 읽은 것에 대해 거짓말하지 않았습니다.
  • 무엇을 좋은 답으로 볼지에 대한 조정이 다릅니다. 날것의 학습 이후 각 모델은 사람의 선호 피드백으로 다듬어지는데, 그 작업을 한 사람들이 좋은 답에 대해 서로 다른 판단을 내렸습니다. 어떤 모델은 단정을 피하는 것이 정직하다고 배웠고, 다른 모델은 단정을 피하는 것이 불친절하다고 배웠습니다. 같은 모호한 질문을 던지면 한쪽에서는 분명한 권고가, 다른 쪽에서는 고려사항 목록이 돌아옵니다. 사실 인식은 조금도 어긋나지 않았는데도 말입니다.
  • 답은 조회된 것이 아니라 표집된 것입니다. 이 모델들은 확률 분포에서 표집하며 한 토큰씩 글을 생성합니다. 같은 모델에 같은 질문을 두 번 해도 다른 답이 나올 수 있습니다. 두 제품 사이의 이견으로 보이는 것의 일부는 어느 한쪽 안에서도 나타나는 평범한 편차입니다.
  • 한쪽은 검색했고 다른 쪽은 하지 않았습니다. 웹 접근이 있는 모델과 기억만으로 답하는 모델은 애초에 다른 질문에 답하고 있습니다. 밖에서는 보이지 않으며, 시의성 있는 주제에서 가장 큰 원인 중 하나입니다.
  • 질문에 두 가지 독해가 남아 있었습니다. 가장 흔한 원인이자 가장 덜 논의되는 원인입니다. "이 이직을 해야 할까"라는 물음에는 말해지지 않은 우선순위가 들어 있습니다. 각 모델은 그 빈칸을 조용히 다르게 채우고 각자의 해석에 답했습니다. 그리고 그 해석에 대해서는 둘 다 잘 답했습니다.

표현의 차이와 결론의 차이를 나누기

갈림을 문제로 다루기 전에 어느 쪽 갈림인지 확인하세요. 완전히 달라 보이는 두 답이 어조만 바꿔 같은 것을 권하고 있을 수 있습니다. 반대로 톤이 비슷한데 정반대를 가리킬 수도 있습니다.

물어야 할 것은 하나뿐입니다. 각각을 따랐을 때 나는 다른 행동을 하게 되는가. 아니라면 문체의 차이이니 신경 쓰지 않아도 됩니다. 그렇다면 무언가를 찾은 것이고, 어디서 갈렸는지 정확히 알 가치가 있습니다.

갈린 지점이 본론입니다

여러 사람에게 상담할 때 사람은 다수결을 하지 않습니다. 누군가 말을 머뭇거린 순간을 듣습니다. 진짜 쟁점이 거기 있기 때문입니다. 여기서도 같은 이치가 작동합니다. 두 모델이 한 지점만 빼고 일치한다면, 그 한 지점이 당신의 판단이 실제로 갈리는 곳이고, 어디에 주의를 쏟아야 할지 알게 된 것입니다.

이는 세컨드 오피니언의 목적을 다시 잡는 일이기도 합니다. 옳은 모델을 찾고 있는 게 아닙니다. 정말로 다툼이 있는 부분을 짚어내서, 자신감 있는 문단 하나를 읽고 전부 결론났다고 여기는 것을 그만두기 위해서입니다.

일치는 생각만큼의 의미가 없습니다

뒤집은 쪽에도 같은 만큼의 주의가 필요합니다. 둘 다 같은 말을 했다면, 그건 느껴지는 것보다 약한 증거입니다.

겹치는 텍스트로 학습한 모델은 널리 퍼진 같은 오류도 함께 흡수합니다. 충분히 많은 웹 페이지에서 반복된 오해는 그것을 읽은 모든 모델이 자신 있게 반복합니다. 그 상황에서의 일치는 독립적인 확인이 아닙니다. 같은 출처가 두 번 도착한 것입니다.

알아둘 만한 실패가 하나 더 있습니다. 모델은 자기 출력의 평가자로 신뢰할 수 없다는 연구 결과입니다. 의견이 갈렸을 때 참여자 중 하나에게 중재를 맡겨 정리하려 했다면 중요한 이야기입니다. 별도의 글로 다뤘습니다.

갈렸을 때 무엇을 할까

  • 둘 다에게 물은 뒤, 스스로 지정한 하나의 축으로 비교하세요. "어느 답이 더 나은가"보다 "틀렸을 때 손해가 큰 쪽은 어느 쪽인가"가 더 쓸모 있습니다.
  • 사실에서 갈렸다면 거기서 멈추고 그 한 가지만 AI 밖에서 확인하세요. 갈림이 확인할 대상을 정확하고 싸게 좁혀준 드문 경우입니다.
  • 판단에서 갈렸다면 트레이드오프를 건네받은 것입니다. 이건 누구도 조사로 벗어날 수 없고, 애초부터 당신이 정할 몫이었습니다.
  • 일치했다면 "이 답이 틀렸다면 무엇이 참이어야 하는가"를 물으세요. 일치는 출발점이지 결론이 아닙니다.

현실적인 수고에 대해

여기까지의 이야기는 실제로 탭을 두 개 열고, 같은 질문을 두 번 붙여넣고, 두 답을 머릿속에 나란히 놓고 비교하는 것을 전제합니다. 그걸 지속하는 사람은 거의 없습니다. 결국 비교는 머릿속에서 하게 되는데, 그게 바로 도움받고 싶었던 작업입니다.

Parley는 그 공정을 위한 도구입니다. 하나의 Room에 여러 AI 모델을 넣고 같은 질문을 동시에 건네, 일치점과 차이점을 직접 재구성하지 않아도 보이게 합니다. 질문을 세우는 것도, 마지막에 정하는 것도 사람입니다.

분명히 해두자면, 찾아보면 아는 정답이 하나 있는 질문에는 과합니다. 진짜 트레이드오프가 든 질문에서 값을 합니다. 어느 쪽이 어느 쪽인지는 모범 사례 가이드에 정리해 두었습니다.

함께 읽어볼 글

Back to Blog