두 AI가 같은 답에 도달했지만 틀렸다
세탁기 사진 판독 사례로 살펴본 교차 검토와 Ground Truth의 중요성
두 AI 모델이 같은 사진을 각각 분석한 뒤 서로의 판단을 검토했습니다.
처음에는 서로 다른 답을 내놓았지만, 교차 검토를 거치면서 마침내 동일한 결론에 도달했습니다. 일반적으로 두 분석 결과가 하나로 수렴하면 판단의 신뢰도가 높아졌다고 생각하기 쉽습니다.
그러나 이번에는 두 모델이 함께 도달한 결론이 틀렸습니다.
최종적으로 정확한 답을 확인할 수 있었던 근거는 모델 간의 합의가 아니라, 촬영 당시 실제 수행한 조작을 확인한 기록이었습니다.
이 글에서는 세탁기 프로그램 다이얼 사진을 판독하는 과정에서 ChatGPT와 Gemini가 각각 어떤 판단을 내렸고, 두 모델의 교차 검토가 어떻게 동일한 오답으로 수렴했으며, 마지막으로 Ground Truth를 통해 어떻게 사실관계가 확정되었는지 정리합니다.
1. 사진만 보고 프로그램을 판독하다
분석 대상은 세탁기의 프로그램 다이얼과 화면에 표시된 시간이 담긴 세 장의 사진이었습니다.
각 사진의 화면에는 다음 시간이 표시되어 있었습니다.
3:511:120:52
실제 목표는 최적의 세탁 프로그램을 찾는 것이었습니다. 각 시간과 다이얼 위치가 어떤 프로그램에 해당하는지 식별하는 일은 ChatGPT와 Gemini가 그 목표를 해결하기 위해 수행한 중간 작업이었습니다.
사진에는 다이얼의 위치, 프로그램 이름, 화면의 시간이 함께 나타나 있었지만, 촬영 각도와 다이얼 표시 위치를 해석해야 했기 때문에 이미지 판독만으로 프로그램을 확정하는 과정에는 불확실성이 있었습니다.
ChatGPT와 Gemini는 같은 사진을 보고 각각 독립적으로 분석을 시작했습니다.
2. 처음부터 서로 다른 답이 나왔다
ChatGPT의 최초 판단
ChatGPT는 처음 사진을 다음과 같이 판독했습니다.
- Cotton =
3:51 - Mix =
0:52 - Synthetics =
1:12
이 판단 가운데 Cotton과 Mix는 나중에 확인된 실제 결과와 일치했습니다.
문제는 1:12였습니다. ChatGPT는 이를 Synthetics 프로그램으로 보았지만, 실제로는 Allergy Care 프로그램이었습니다.
즉, 세 개 중 두 개는 맞았지만 하나는 잘못 판독했습니다.
Gemini의 최초 판단
Gemini는 사진 간의 관계를 다르게 해석했습니다.
3:51= Allergy Care1:12= Allergy Care에서 Dry 옵션을 해제한 상태0:52= Mix
Gemini는 3:51과 1:12를 서로 다른 프로그램으로 보지 않았습니다. 같은 Allergy Care 프로그램에서 Dry 옵션의 적용 여부가 달라져 시간이 변경된 것으로 해석했습니다.
이 판단은 사진에서 직접 확인되지 않은 설정 변경을 가정한 것이었습니다.
실제 촬영 당시에는 Dry 버튼을 변경하지 않았으며, 두 시간은 동일 프로그램의 옵션 차이가 아니라 서로 다른 프로그램에서 표시된 시간이었습니다.
초기 분석 단계에서 두 모델은 0:52 = Mix에는 동의했지만, 3:51과 1:12의 프로그램에 대해서는 서로 다른 설명을 내놓았습니다.
3. 교차 검토가 시작되다
서로 다른 결과가 나온 뒤 ChatGPT는 Gemini의 해석을 다시 검토했습니다.
이 과정에서 ChatGPT는 최초 판단을 일부 변경해 다음과 같이 재판독했습니다.
3:51= Synthetics1:12= Allergy Care0:52= Mix
여기서 1:12 = Allergy Care와 0:52 = Mix는 실제 결과와 일치했습니다.
그러나 ChatGPT는 처음에 맞게 판독했던 3:51 = Cotton을 오히려 3:51 = Synthetics로 변경했습니다.
Gemini의 후속 분석에서도 3:51 = Synthetics로 판단이 수정되었습니다.
결과적으로 두 모델의 판단은 다음과 같이 수렴했습니다.
3:51 = Synthetics
두 모델이 서로 다른 출발점에서 검토를 진행한 뒤 같은 결론에 도달한 것입니다.
표면적으로 보면 독립적인 두 분석이 서로를 교정하면서 하나의 답을 찾아낸 것처럼 보일 수 있습니다. 하지만 두 모델이 합의했다는 사실만으로 그 결론이 실제 사실이 되는 것은 아니었습니다.
4. 동일한 결론이 반드시 정확한 결론은 아니다
두 모델이 함께 선택한 3:51 = Synthetics는 실제 촬영 내용과 달랐습니다.
판단의 변화 과정을 단순화하면 다음과 같습니다.
| 모델 | 최초 판단 | 교차 검토 후 판단 | 최종 Ground Truth |
|---|---|---|---|
| ChatGPT | Cotton | Synthetics | Cotton |
| Gemini | Allergy Care | Synthetics | Cotton |
ChatGPT는 최초에는 정답을 골랐지만, 다른 모델의 분석을 재검토하는 과정에서 정답을 오답으로 바꾸었습니다.
Gemini는 최초에도 오답을 냈고, 수정 후에도 다른 오답을 선택했습니다.
두 모델의 의견이 동일해지면서 불일치는 사라졌지만, 사실과의 불일치는 그대로 남았습니다.
이 사례에서 교차 검토는 오류를 제거하지 못했고, 두 모델은 같은 오답에 도달했습니다.
합의가 형성되었다는 사실과 판단이 검증되었다는 사실은 구분해야 합니다.
5. 실제로 선택한 프로그램을 확인하다
최종 Ground Truth는 마지막 피드백에서 3:51이 Cotton 프로그램이었음이 확인되면서 확정되었습니다. 이는 사진을 다시 조사해 발견한 새로운 사실이 아니라, 촬영 당시 실제로 선택했던 프로그램이었습니다.
촬영 당시에는 세탁기의 옵션 버튼을 변경하지 않았습니다.
- Dry 버튼 변경 없음
- Temp 변경 없음
- 다른 옵션 변경 없음
- 다이얼만 순차적으로 돌려 각 프로그램을 촬영
실제 확인한 프로그램과 시간은 다음과 같습니다.
| 프로그램 | 표시 시간 |
|---|---|
| Cotton | 3:51 |
| Allergy Care | 1:12 |
| Mix | 0:52 |
따라서 최종 Ground Truth는 다음과 같습니다.
3:51사진은 Cotton 프로그램1:12사진은 Allergy Care 프로그램0:52사진은 Mix 프로그램- 세 사진 모두 각 프로그램의 기본 설정
- Dry 및 Temp 옵션 변경 없음
Gemini가 제안했던 “같은 Allergy Care 프로그램에서 Dry 옵션을 해제해 시간이 3:51에서 1:12로 바뀌었다”는 설명은 실제 촬영 당시의 선택과 일치하지 않았습니다.
두 모델이 교차 검토 후 합의했던 3:51 = Synthetics 역시 실제 확인 결과와 일치하지 않았습니다.
최종 판단은 촬영 당시 실제 수행한 조작을 다시 확인하면서 확정되었습니다.
6. 왜 두 모델은 같은 오답에 도달했을까
이번 사례만으로 각 모델 내부의 정확한 판단 과정을 모두 재구성할 수는 없습니다. 초기 분석의 전체 원문과 각 검토 단계의 세부 기록이 모두 남아 있지 않기 때문입니다.
다만 확인된 흐름에서는 몇 가지 특징을 발견할 수 있습니다.
확인되지 않은 설명이 판단에 포함되었다
Gemini는 3:51과 1:12의 차이를 설명하기 위해 Dry 옵션의 ON/OFF 관계를 제시했습니다.
그러나 실제로 Dry 버튼이 변경되었다는 정보는 제공되지 않았습니다.
사진에서 직접 확인할 수 없는 설정 변경을 하나의 가능성으로 제시할 수는 있지만, 이를 확인된 사실처럼 사용하면 이후의 분석 전체가 잘못된 전제 위에서 진행될 수 있습니다.
재검토 과정에서 기존의 정답이 유지되지 않았다
ChatGPT의 최초 판단 중 3:51 = Cotton은 정확했습니다.
그러나 Gemini의 분석을 검토한 뒤 이 판단은 3:51 = Synthetics로 변경되었습니다.
새로운 증거가 추가되지 않은 상태에서 기존 판단이 변경되었습니다.
교차 검토는 기존 답을 반드시 바꾸는 과정이 아닙니다. 기존 판단과 새로운 주장 각각의 근거를 독립적으로 비교해야 합니다.
합의가 검증처럼 작동했다
Gemini의 후속 분석에서도 3:51 = Synthetics라는 결론이 나오면서 두 모델의 판단은 같아졌습니다.
하지만 두 모델이 같은 답을 선택했다는 것은 그 답이 외부 사실과 대조되었다는 뜻이 아닙니다.
이번 사례에서는 같은 사진과 앞선 해석을 바탕으로 교차 검토한 두 모델이 동일한 오류에 도달했습니다.
독립적인 근거 없이 형성된 합의는 정확성을 높이는 검증이라기보다 하나의 판단을 반복하는 과정이 될 수 있습니다.
7. 이번 사례에서 얻은 교훈
모델 간 합의와 사실 확인을 구분해야 한다
두 모델이 같은 답을 냈다는 것은 참고할 만한 신호입니다.
그러나 그것만으로 정답이 확정되지는 않습니다.
특히 이번 사례는 해석의 여지가 있는 시각적 정보를 여러 모델이 동일하게 오해할 가능성이 있음을 보여주었습니다.
추론과 확인된 사실을 분리해야 한다
이번 분석에서 확인된 사실은 화면에 표시된 시간과 실제 수행한 조작입니다.
반면 Dry 옵션 변경이나 특정 프로그램 선택에 관한 일부 설명은 사진을 바탕으로 만들어진 추론이었습니다.
분석 결과에는 다음 항목이 구분되어야 합니다.
- 사진에서 직접 확인되는 정보
- 모델이 해석한 정보
- 확인되지 않은 가정
- 실제 확인한 조작
- 최종 확정된 Ground Truth
이 구분이 명확하면 추론이 사실로 굳어지는 것을 방지할 수 있습니다.
새로운 증거 없이 판단을 변경할 때는 주의해야 한다
다른 모델이 다른 답을 냈다는 이유만으로 기존 판단을 변경해서는 안 됩니다.
판단을 수정하려면 어떤 새로운 근거가 기존 근거보다 강한지 설명할 수 있어야 합니다.
이번 사례에서 ChatGPT는 최초에 맞게 판단한 Cotton을 Synthetics로 변경했지만, 실제 촬영 기록이라는 새로운 증거가 추가된 것은 아니었습니다.
실제 촬영 맥락이 가장 강한 증거일 수 있다
사진만 분석하는 모델은 촬영 당시 어떤 버튼이 눌렸는지 직접 알 수 없습니다.
반면 촬영자는 다이얼만 돌렸는지, 옵션 버튼도 변경했는지 직접 확인할 수 있습니다.
현실 세계의 선택이나 사건을 판독하는 작업에서는 실제 촬영 당시의 현장 정보가 모델의 추론보다 강한 증거가 될 수 있습니다.
8. 더 안전한 검증 방법
비슷한 사례를 다시 검토한다면 다음과 같은 순서가 적절합니다.
첫째, 각 모델이 다른 모델의 답을 보지 않은 상태에서 독립적으로 사진을 판독합니다.
둘째, 단순한 결론뿐 아니라 다이얼의 표시 위치, 프로그램 이름과의 정렬, 화면의 옵션 상태 등 판단 근거를 함께 기록합니다.
셋째, 사진에서 직접 확인되는 내용과 모델이 추론한 내용을 분리합니다.
넷째, 두 모델의 답이 다를 경우 어느 한쪽의 판단을 바로 채택하지 않고 각 판단의 근거를 원본 사진과 다시 대조합니다.
다섯째, 모델 간 합의가 이루어지더라도 가능한 경우 실제 조작 기록, 제품 설명서, 추가 사진 또는 직접 확인한 내용과 비교합니다.
마지막으로 외부 증거와 대조된 결과만 최종 사실로 확정합니다.
이 절차의 목적은 여러 모델 가운데 다수의 선택을 찾는 것이 아닙니다. 각 판단이 실제 증거와 일치하는지 검증하는 것입니다.
결론
이번 사례에서 ChatGPT와 Gemini는 세탁기 프로그램 사진을 서로 다르게 판독한 뒤 교차 검토를 거쳐 3:51 = Synthetics라는 동일한 결론에 도달했습니다.
하지만 촬영 당시 실제 수행한 조작을 확인한 결과, 3:51은 Cotton 프로그램이었습니다.
최종적으로 확인된 결과는 다음과 같습니다.
- Cotton =
3:51 - Allergy Care =
1:12 - Mix =
0:52 - Dry 버튼 변경 없음
- Temp 변경 없음
- 다이얼만 순차적으로 돌림
두 모델의 합의는 분석 과정의 한 단계였지만 최종적인 검증 수단은 아니었습니다.
이번 사례의 핵심은 AI 모델이 서로 같은 답을 내놓았는지가 아니라, 그 답이 실제 사건을 확인할 수 있는 Ground Truth와 일치하는지를 끝까지 확인해야 한다는 점입니다.
여러 AI가 동일한 결론에 도달하더라도, 합의는 사실의 대체물이 아니다. 최종 판단은 확인 가능한 실제 증거와의 대조를 통해 확정해야 한다.