Gemini 대 ChatGPT 대 Offline Alpaca: 어떤 것이 더 나은 대규모 언어 모델일까요?

대규모 언어 모델(LLM)은 다양한 형태와 규모로 제공되며, 어떤 방식으로든 사용자에게 도움이 될 것입니다. 하지만 어떤 모델이 사용자의 다양한 요구에 가장 적합할까요? Alphabet, OpenAI, Meta의 주요 AI 시스템을 엄밀하게 테스트해 보았습니다. 확인해 보세요. ChatGPT 대 Google Gemini: 어느 것이 더 낫나요?

AI 챗봇에 대해 알아야 할 사항

인공지능을 활용하는 것은 수십 년 동안 컴퓨터 과학자들의 목표였으며, 그보다 더 오랫동안 공상과학 작가와 영화 제작자들이 주력해 온 주제였습니다.

일반 인공지능은 인간의 인지 능력과 비슷한 수준의 지능을 보이고, 컴퓨터나 애플리케이션이 인간의 지능을 구현할 수 있는지 판별하는 방법인 튜링 테스트는 처음 고안된 이래 70년 동안 사실상 이의가 제기되지 않은 채 남아 있습니다.

최근 극도로 대규모의 컴퓨팅이 융합되고, 막대한 자금이 투자되고, 인터넷에서 무료로 제공되는 정보의 양이 엄청나게 늘어나면서 대형 기술 기업들은 일련의 기호에서 다음 단어 세그먼트나 토큰을 예측할 수 있는 모델을 훈련할 수 있게 되었습니다.

이 글을 쓰는 시점에서는 둘 다 구글 제미니 وChatGPT OpenAI는 제공하는 웹 인터페이스를 통해 사용하고 테스트할 수 있습니다.

메타 언어 모델인 LLaMa는 웹에서 사용할 수 없지만, LLaMa를 쉽게 다운로드하여 사용자의 기기에 실행하고 명령줄을 통해 사용하거나, 사용자 친화적인 인터페이스를 갖춘 여러 애플리케이션 중 하나인 Dalai를 사용자의 기기에서 실행할 수 있습니다.

테스트 목적으로 LLaMa를 변형한 스탠포드 대학의 Alpaca 7B 모델을 실행하고 Gemini와 ChatGPT와 비교해 보겠습니다.

다음 비교와 테스트는 포괄적인 내용을 다루지는 않지만, 핵심 사항과 역량을 알려드리는 데 목적이 있습니다.

가장 사용하기 쉬운 LLM 모델은 무엇입니까?

Gemini와 ChatGPT 모두 챗봇을 사용하려면 계정이 필요합니다. Google과 OpenAI 계정은 모두 쉽고 무료로 만들 수 있으며, 바로 질문을 올릴 수 있습니다.

하지만 LLaMa를 로컬에서 실행하려면 전문 지식이 필요하거나 튜토리얼을 따라 할 수 있어야 합니다. 또한 상당한 저장 공간도 필요합니다.

어떤 LLM 모델이 가장 사적인가요?

Gemini와 ChatGPT는 모두 포괄적인 개인정보 보호정책을 가지고 있으며, Google은 문서에서 "사용자를 식별하거나 다른 사람을 식별하는 데 도움이 될 수 있는 정보는 Gemini 대화에 포함되어서는 안 됩니다"라고 반복해서 명시하고 있습니다.

기본적으로 Google은 사용자의 IP 주소, 댓글, 사용 정보를 기반으로 대화 내용과 일반적인 지리적 위치를 수집합니다. 이 정보는 최대 18개월 동안 Google 계정에 저장됩니다. Gemini 활동 저장을 일시적으로 중지할 수 있지만, "제품 품질 향상 및 개선을 위해 검토자가 Gemini와의 대화를 읽고, 댓글을 달고, 처리합니다."라는 점에 유의하시기 바랍니다.

Gemini의 사용도 다음과 같은 경우에 적용됩니다. 표준 Google 개인정보 보호정책의 경우.

OpenAI의 개인정보 보호정책은 전반적으로 유사하며 IP 주소와 사용 데이터를 수집합니다. Google의 제한된 보관 기간과 달리, OpenAI는 "서비스 제공, 분쟁 해결, 안전 및 보안상의 이유, 또는 법적 의무 준수 등 기타 합법적인 사업 목적을 위해 필요한 기간 동안만 귀하의 개인정보를 보관합니다."라고 명시하고 있습니다.

이와 대조적으로, 기기의 로컬 모델은 계정이 필요하지 않으며 누구와도 사용자 데이터를 공유할 필요가 없습니다.

어떤 LLM 모델이 가장 일반 지식이 풍부합니까?

LLM을 최상의 일반 지식으로 시험하기 위해 우리는 세 가지 질문을 했습니다.

질문 1: 다섯 면으로 이루어진 국기는 무엇입니까? 쌍둥이자리만이 정답을 맞혔는데, 네팔 국기를 다섯 개의 꼭짓점으로 구분했습니다.

ChatGPT는 "어떤 국기도 5면으로 이루어져 있지 않다. 국기는 일반적으로 직사각형이나 정사각형이며, 고유한 색깔, 무늬, 그리고 상징으로 구분된다"라고 자신 있게 주장했습니다.

우리 지역 모델은 다음과 같은 결론을 내렸습니다. "인도 국기는 1916면으로 되어 있으며, XNUMX년에 인도 독립 운동을 상징하기 위해 디자인되었습니다." 실제로 XNUMX면으로 된 국기가 존재했지만, 그것은 국기가 아니라 인도 자치 운동의 깃발이었습니다.

어떤 모델도 완두콩 모양 물체의 정확한 용어가 "peasy"라는 주장에 제대로 답변하지 못했으며, ChatGPT는 심지어 완두콩이 "완벽하게 원형이고 대칭인 3차원 기하학적 모양"을 가지고 있다고까지 제안했습니다.

세 챗봇 모두 프랑코 말레르바를 이탈리아 우주비행사이자 유럽 의회 의원으로 정확하게 식별했으며, 제미니는 말레르바의 위키백과 항목 중 일부와 유사한 문구로 답변을 제공했습니다. 다음 링크를 확인해 보세요. ChatGPT 대 Microsoft Bing AI 대 Google Gemini: 어떤 AI 챗봇이 가장 좋을까요?

기술 지침에 적합한 LLM 모델은 무엇입니까?

기술적인 문제가 발생하면 챗봇에 도움을 요청하고 싶은 마음이 들 수 있습니다. 기술은 발전하지만, 변하지 않는 것도 있습니다. BS 1363 전기 플러그는 1947년부터 영국, 아일랜드 등 여러 국가에서 사용되어 왔습니다. 저희는 언어 모델을 통해 플러그를 올바르게 연결하는 방법을 알아보았습니다.

플러그에 연결된 케이블에는 활선(갈색), 접지선(노란색/녹색), 중성선(파란색)이 있습니다. 이 케이블들은 플러그 하우징 내부의 올바른 단자에 연결되어야 합니다.

달라이의 앱은 플러그를 "영국식"으로 올바르게 식별했지만, 그다음에는 잘못된 방향으로 가서 대신 오래된 전선 색상을 사용한 오래된 BS 546 원형 소켓에 대한 지침을 제공했습니다.

ChatGPT가 조금 더 도움이 되었습니다. 전선 색상에 정확한 라벨을 붙여주고, 재료 목록과 1363개의 설명서를 제공했습니다. 또한 ChatGPT는 갈색 전선을 "L"이라고 표시된 단자에, 파란색 전선을 "N"이라고 표시된 단자에, 노란색 전선을 "E"라고 표시된 단자에 연결하라고 제안했습니다. 단자에 BSXNUMX 라벨이 붙어 있다면 맞는 말이지만, 실제로는 그렇지 않습니다.

제미니는 올바른 전선 색상을 파악하고, 전원선, 중성선, 접지선에 연결하라고 했습니다. 하지만 식별 방법에 대한 지침은 제공하지 않았습니다.

저희 의견으로는, 챗봇 중 어느 것도 BS 1363 전기 플러그를 올바르게 연결하는 데 필요한 충분한 설명을 제공하지 못했습니다. 짧고 정확한 답은 "왼쪽은 파란색, 오른쪽은 갈색"입니다.

코드 작성에 적합한 LLM 모델은 무엇입니까?

Python은 대부분의 최신 플랫폼에서 실행되는 유용한 프로그래밍 언어입니다. 저희는 모델에 Python을 사용하여 "덧셈, 뺄셈, 곱셈, 나눗셈과 같은 산술 연산을 수행할 수 있는 기본 계산기를 만들도록" 지시했습니다. "사용자는 입력을 받고 결과를 표시해야 합니다." 이는 초보자를 위한 최고의 프로그래밍 프로젝트 중 하나입니다.

Gemini와 ChatGPT는 둘 다 우리가 테스트하고 검증할 수 있는 사용 가능하고 완전한 주석이 달린 코드를 즉시 반환했지만, 로컬 모델에서는 코드가 생성되지 않았습니다.

어떤 LLM 모델이 가장 좋은 농담을 전달할까?

유머는 인간으로서의 기본 중 하나이며, 인간과 기계를 구분하는 가장 좋은 방법 중 하나입니다. 각 챗봇에 "독창적이고 재미있는 농담을 생각해 보세요"라는 간단한 메시지를 전달했습니다.

다행히도 전 세계 코미디언과 인류 전체에게 어떤 모델도 독창적인 농담을 만들어내지 못했습니다.

쌍둥이자리는 고전적인 "허수아비는 왜 상을 받았을까? 그녀는 자기 분야에서 뛰어났으니까."라는 말을 소개했습니다.

지역 모델과 ChatGPT는 둘 다 지루한 아이디어를 제시했습니다. "과학자들은 왜 원자를 믿지 않을까? 원자가 모든 것을 구성하고 있으니까!"

파생적이지만 독창적인 농담은 "대규모 언어 모델이 원자와 어떻게 비슷할까? 둘 다 사물을 만든다!"일 수 있다.

검증 ChatGPT는 농담을 할 수 있지만, AI가 실제로 우리를 웃게 할 수 있을까?

완벽한 챗봇은 없습니다.

우리는 세 가지 대규모 언어 모델 모두 장단점이 있지만, 어떤 모델도 전문 지식으로 실제 인간의 경험을 대체할 수 없다는 것을 발견했습니다.

Gemini와 ChatGPT 모두 프로그래밍 문제에 더 나은 답을 제공하고 사용하기도 매우 쉽지만, 대규모 언어 모델을 로컬에서 실행하면 개인정보 보호나 검열에 대해 걱정할 필요가 없습니다.

누군가 어깨 너머로 훔쳐보는 걱정 없이 멋진 AI 예술 작품을 만들고 싶다면, 로컬 컴퓨터에서도 예술 AI 모델을 쉽게 실행할 수 있습니다. 지금 바로 확인해 보세요. AI로 더 나은 예술 작품을 만드는 방법: 팁과 요령.

맨 위로 이동 버튼