중국 AI 연구소 DeepSeek은 최근 자사의 주력 모델인 R1을 출시했습니다. R1은 OpenAI의 ChatGPT o1과 동등하거나 더 뛰어나다고 주장합니다. DeepSeek은 이미 애플 앱스토어에서 ChatGPT를 제치고 1위를 차지했습니다. 미국 IT 시장은 DeepSeek의 비용 효율적인 모델에 깊은 인상을 받았습니다. 두 AI 모델을 평가하고 어느 모델이 더 우수한지 판단하기 위해, 아래의 다양한 복합 추론 테스트를 통해 ChatGPT o1과 DeepSeek R1을 비교했습니다.

로압 스리유에스
ChatGPT o1 대 DeepSeek R1: 잘못된 초점
대규모 언어 모델은 종종 "무작위 앵무새진정한 일반화가 부족하고 다음 단어나 기호를 예측하기 위해 통계적 패턴 매칭과 암기에 지나치게 의존하기 때문입니다. 그러나 최근 인공지능(예: 오픈AI o3), 이러한 이야기는 정교한 모델이 어느 정도 일반화를 보여주고 원래 프로그램되지 않았던 새로운 행동을 보이면서 상당히 빠르게 바뀝니다.
AI 모델은 흔히 사용되는 퍼즐, 수수께끼, 그리고 사고 실험에 대해 학습합니다. 따라서 학습 데이터에서 흔히 사용되는 퍼즐 중 하나를 학습하면, 대규모 언어 모델은 학습 데이터 세트에서 정보를 대부분 추출합니다.
그러나 모델을 오도하기 위해 퍼즐을 약간 변경하면 대부분 대규모 언어 모델이 실패합니다 학습된 패턴은 반복됩니다. 이를 통해 AI 모델이 실제 추론을 적용하는지, 아니면 단순한 규칙을 암기하는지 판단할 수 있습니다.

위 질문에서 외과의가 소년의 아버지라고 명확하게 명시되어 있지만, ChatGPT o1과 DeepSeek R1은 모두 오답입니다. 두 모델 모두 외과의가 소년의 어머니라고 말하며, 외과의가 남성이라는 가정에 의문을 제기합니다. 이 질문은 다른 가능성을 탐색하여 오답으로 유도하기 위해 고안되었습니다. 그런데 흥미로운 점은 제미니 2.0 플래시 (사고 모델이 아닌) 정답을 제공합니다.
우승자: 없음
ChatGPT o1 대 DeepSeek R1: 수학적 추론 대 논리적 추론
Google은 Cookbook 페이지에 논리적 추론 모델을 테스트할 수 있는 몇 가지 훌륭한 문제를 추가했습니다. 자세한 설명서나는 다중 모드 추론 문제(+ 수학) 중 하나를 택하여 텍스트로 변환했습니다. DeepSeek R1은 아직 멀티미디어 입력을 지원하지 않습니다..
제가 테스트한 결과, ChatGPT o1과 DeepSeek R1 모두 문제를 정확하게 해결했습니다. 두 모델 모두 '9' 공을 '6'으로 뒤집고, 6 + 11 + 13을 더하여 30이라는 결과를 얻었습니다. 두 모델 모두 훌륭한 결과를 보여주었습니다!

우승자: ChatGPT o1 및 DeepSeek R1
ChatGPT o1 대 DeepSeek R1: 인류의 마지막 시험 문제
인공지능 무결성 센터(CAIS)는 최근 다양한 학문 분야에서 AI의 급속한 발전을 추적하기 위해 "인류의 마지막 시험(HLE)"이라는 벤치마크를 발표했습니다. 이 벤치마크에는 전 세계 저명한 과학자, 교수, 연구자들이 출제하는 문제들이 포함되어 있습니다. CAIS는 웹사이트에 이러한 문제들 중 일부를 예시로 게시했습니다. 저는 그리스 신화에서 발췌한 문제를 ChatGPT o1과 DeepSeek R1에서 테스트했습니다.

ChatGPT o1 모델은 추론하는 데 약 30초가 걸렸고, 헤르메스 신이 이아손의 외증조부라고 정확하게 답했습니다. 반면 DeepSeek R1은 가계를 재구성하는 데 약 28초가 걸렸지만, "아이올로스"라고 잘못 답했습니다. 이 테스트는 주로 기억 용량을 평가하지만, AI 모델이 논리와 관계를 이해하는지 여부를 판단하는 데 중요한 방법으로 남아 있습니다.
우승자: ChatGPT o1
ChatGPT o1 대 DeepSeek R1: 트롤리 딜레마
여러분은 유명한 트롤리 문제에 대해 들어보셨을 것입니다. 그러나 이 문제는 잘못된 주의를 평가하는 일환으로 모델을 혼란스럽게 하기 위해 약간 수정되었습니다.GitHub의). 이제 이 모델이 정답을 얻을 수 있는지 살펴보겠습니다.
먼저 ChatGPT o1은 29초 동안 생각한 후 요령을 알아냈습니다. 이미 5명이 죽었어요 한쪽 선로에는 사람이 있고, 다른 쪽 선로에는 살아있는 사람이 있습니다. ChatGPT o1은 지체 없이 레버를 움직여서는 안 된다고 말했습니다. 이미 죽은 사람을 해칠 수는 없기 때문입니다.

반면 DeepSeek R1은 "죽은 사람" 부분을 무시했습니다. 훈련 패턴에 대한 그의 과도한 의존 그는 윤리적 논쟁에 뛰어들었습니다. 그는 보편적으로 옳은 답은 없다고 주장했습니다. ChatGPT o1은 이번 라운드에서 그 요점을 명확히 이해했습니다.
우승자: ChatGPT o1
ChatGPT o1 대 DeepSeek R1: 수학적 추론
수학적 추론에 대한 또 다른 질문에서, 저는 ChatGPT o1과 DeepSeek R1에게 각각 6리터와 12리터짜리 양동이 두 개를 사용하여 정확히 4리터를 측정해 보라고 했습니다. ChatGPT o1은 1분 47초 동안 생각한 후 수학적으로 불가능하다고 답했는데, 이것이 정답입니다. 일반적으로 AI 모델은 문제가 주어졌을 때 답을 찾으려고 시도합니다.

하지만 ChatGPT o1은 한 걸음 더 나아가 최대공약수(GCD)를 계산하여 4는 6의 배수가 아니라고 밝혔습니다. 따라서 "채우기, 비우기, 붓기" 규칙을 사용하여 정확히 4리터를 측정할 수 없습니다.
놀랍게도 DeepSeek R1은 단 47초 동안 생각하고 동일한 접근 방식을 따르고 다음과 같이 답했습니다.이런 특정 버킷 크기에서는 수학적으로 불가능합니다."
우승자: ChatGPT o1 및 DeepSeek R1
ChatGPT o1 대 DeepSeek R1: 정치적 검열과 편견
DeepSeek이 중국 AI 연구소라는 점을 고려하면 중화인민공화국과 관련된 여러 논란의 여지가 있는 주제에 대해 자체 검열을 할 것으로 예상했습니다. 하지만 DeepSeek R1은 훨씬 더 나아가, 중국 국가주석인 시진핑을 언급해도 메시지를 띄울 수 없도록 했습니다. 아예 작동하지 않습니다.

그래서 저는 DeepSeek R1에게 "중국의 대통령은 누구입니까?"라고 질문하여 이 문제를 해결하려고 했습니다. R1이 생각을 시작하는 순간, 모델은 갑자기 멈추고 "죄송하지만, 아직 이런 유형의 질문에 어떻게 대답해야 할지 잘 모르겠어요. 대신 수학, 프로그래밍, 논리에 대해 이야기해 볼까요!"
마찬가지로, 잭 마, 위구르족, 독재 정권, 정부, 심지어 민주주의에 대한 내용을 언급하는 프롬프트를 실행할 수 없는데, 이는 혼란을 야기합니다.

반면에 ChatGPT o1에게 현 미국 대통령인 도널드 트럼프에 대한 농담을 써 달라고 요청했는데 아무런 문제 없이 응답했습니다. 심지어 ChatGPT o1에게 농담을 좀 더 엉뚱하게 만들어 달라고 요청했는데, 아주 잘 해냈습니다. ChatGPT o1은 다음과 같이 응답했습니다.도널드 트럼프의 머리카락은 그의 사업 실적보다 더 많은 빗질을 견뎌냈고, 둘 다 계속해서 악화되고 있습니다."
간단히 말해서, 정치적 주제에 대한 검열이 심하지 않은 AI 모델을 찾고 있다면 ChatGPT o1을 선택해야 합니다.
우승자: ChatGPT o1
ChatGPT o1 대 DeepSeek R1: 어떤 제품을 사용해야 할까요?
정치적 주제를 제외하고 DeepSeek R1은 ChatGPT에 대한 무료이고 효과적인 대안입니다. 최고의 ChatGPT 대안 중 하나, 그리고 그는 o1 모델의 성능 수준과 매우 가깝습니다.이러한 테스트를 통해 입증된 바와 같이, OpenAI의 모델이 DeepSeek보다 지속적으로 더 나은 성능을 보이고 있기 때문에 DeepSeek R1이 ChatGPT o1보다 성능이 뛰어나다고 확실히 말할 수는 없습니다.
하지만 한 가지 문제가 있습니다. DeepSeek R1의 매력은 저렴한 가격입니다.DeepSeek R1은 무료로 사용할 수 있지만, OpenAI는 ChatGPT o1에 접속하는 데 20달러를 부과합니다.
그리고 개발자의 경우 다음 사항을 잊지 마세요. DeepSeek R1 API는 ChatGPT o1보다 27배 저렴합니다.이는 모델 가격 책정에 있어 엄청난 변화입니다. DeepSeek 팀은 연구 커뮤니티를 위해 가중치를 공개하고 테스트 시간 계산을 위한 강화 학습(RL) 방법을 오픈소스로 공개했습니다. 이는 OpenAI의 o1 모델을 사용한 새로운 모델과 유사합니다.
더욱이, DeepSeek이 구형 GPU에서 단 5.8만 달러로 R1 모델을 학습하기 위해 개발한 새로운 모델 아키텍처는 다른 AI 연구실들이 훨씬 저렴한 비용으로 고급 모델을 구축하는 데 도움이 될 것입니다. 다른 AI 회사들도 향후 몇 달 안에 DeepSeek AI의 연구를 모방할 것으로 예상됩니다.
전반적으로 DeepSeek R1은 단순한 AI 모델 그 이상입니다. 값비싼 하드웨어 클러스터가 필요 없이 제한된 예산으로 고급 AI 모델을 훈련할 수 있는 새로운 방법을 제공합니다.










