ChatGPT에 대한 지불을 중단하고 자체 AI 시스템을 구축했습니다.

최근 들어 대규모 언어 모델(LLM)을 로컬에서 실행하는 데 푹 빠졌는데, 여러 가지 사례를 보고 나니 더욱 흥미로워졌습니다. MCP 도구로 할 수 있는 멋진 일들내 개인 설정도 조금 업그레이드해야 할 때가 되었다는 것을 깨달았습니다.

ChatGPT에 대한 지불을 중단하고 자체 AI 시스템을 구축했습니다.

처음에 DeepSeek R1이 출시되었을 때 저도 그 열풍에 휩쓸려 사용해 봤지만, 그 이후로 많은 새로운 모델들이 등장했습니다. 모든 것이 너무 빠르게 변화하는 만큼, 제 작업 흐름도 최적화하는 것이 좋겠다고 생각했습니다.

LM Studio는 제가 사용해 본 로컬 LLM 앱 중 최고입니다(지금까지는).

올라마도 좋지만, 난 이게 더 좋아.

저는 작년에 Ollama를 사용하여 로컬 대규모 언어 모델(LLM)을 처음 실험해 보기 시작했습니다.그럭저럭 작동은 잘 됐지만, 8GB 램밖에 없는 제 맥북 에어는 그런 작업량을 감당하도록 설계된 건 아니었어요. 그래도 호기심도 있었고, 성능을 더 끌어낼 수 있을지 확인해보고 싶어서 다른 방법을 시도해 보고 싶었습니다.

그래서 LM Studio를 사용해 보기로 했습니다. LM Studio는 대규모 언어 모델(LLM)을 다운로드하여 로컬 컴퓨터에서 실행할 수 있게 해주는 애플리케이션이며, 깔끔한 사용자 인터페이스를 제공합니다. 저는 Mac을 사용하기 때문에 MLX 지원이 매우 중요했습니다. MLX는 Apple Silicon에 맞춰 특별히 설계된 Apple의 머신 러닝 프레임워크입니다.

기본적으로 그래픽 처리 장치(GPU)를 사용하여 모델을 더욱 효율적으로 실행할 수 있도록 해줍니다. 하지만 저는 이러한 설명을 수치로 보여주고 싶었기에, 동일한 모델을 사용하여 Ollama와 LMStudio를 직접 비교해 보았습니다.

LM Studio와 Ollama의 초당 토큰 수 비교

LM Studio를 사용했을 때 초당 입력되는 기호 수가 더 많았지만, 그 차이가 미미해서 전반적인 사용 경험에는 큰 변화가 없었습니다. 하지만 성능 향상이라면 어떤 것이든 환영입니다.

하지만 Ollama를 선택하든 LM Studio를 선택하든 큰 차이는 없을 것 같습니다. 두 프로그램 모두 로컬에서 모델을 실행하기 위한 유사한 기본 프레임워크를 사용하기 때문입니다.

처음 시작했을 때 가장 큰 불만은 멀티미디어 지원 부족이었습니다. 하지만 이제는 더 이상 큰 문제가 아닙니다. Ollama와 LM Studio 모두 멀티미디어 템플릿을 지원하며, 로컬 기기에서 텍스트와 이미지를 효과적으로 처리할 수 있는 강력한 옵션들이 몇 가지 있습니다.

적합한 모델을 고르는 것은 다소 어려울 수 있습니다.

꽤 비싼 취미일 수 있습니다.

LM 스튜디오 템플릿 검색 목록

LM Studio를 처음 설치하면 가장 먼저 템플릿을 선택해야 합니다. 처음 사용하는 사용자에게는 다소 혼란스러울 수 있는데, "이 템플릿을 사용하세요"라고 명확하게 답할 수 있는 단 하나의 정답이 없기 때문입니다. 어떤 템플릿을 선택해야 할지는 사용자의 하드웨어 사양에 따라 달라집니다.

LM Studio에서 모델 검색 메뉴를 열면 가장 인기 있는 모델 목록이 표시됩니다. 모델의 인기를 알아보는 간단한 방법은 이름에서 "B" 바로 앞에 있는 숫자를 확인하는 것입니다.

"B"는 수십억 개의 파라미터를 의미합니다. 일반적으로 이 숫자가 높을수록 모델의 성능이 향상되지만, 그만큼 더 많은 리소스가 필요합니다. 8GB VRAM을 탑재한 Mac에서는 3억에서 4억 개의 파라미터가 적절하다고 생각합니다. PC에서는 상황이 조금 더 복잡해집니다. 시스템의 일반 RAM 대신 VRAM 용량이 가장 중요한 요소가 되기 때문입니다.

8GB의 VRAM이 있다면, 특히 양자 컴퓨팅 구성이 가벼운 경우 7B 파라미터를 사용하는 모델로 충분히 실험해 볼 수 있습니다. 제 경험상 가장 좋은 방법은 작은 모델부터 시작해서 점차 파라미터를 늘려가며 적합한 모델을 찾는 것입니다.

개인적으로는 구글의 제미니 모델과 동일한 기반 위에 만들어진 젬마 3 4B 모델에 더 끌렸습니다. 하지만 큐웬 모델도 한번 사용해 보시길 추천합니다. 어떤 용도로 사용하느냐에 따라 큐웬 모델이 훨씬 더 적합할 수도 있습니다.

지역 LLM에 웹 검색 기능을 추가할 수도 있습니다.

DuckDuckGo가 구원투수로 나섰습니다

LM Studio의 DuckDuckGo 추가 기능 페이지

네이티브 대규모 언어 모델(LLM)에 대한 가장 큰 불만 중 하나는 웹 검색 기능에 있어 ChatGPT와 같은 클라우드 기반 모델에 비해 한계가 있다는 점입니다. 최신 아이폰에 대해 물어봤는데 LLM이 아이폰 14에 대해 이야기하기 시작한다면 그다지 도움이 되지 않겠죠. 바로 이 부분에서 클라우드 기반 모델이 우월합니다.

LM Studio에는 내장 플러그인 시스템이 있어 웹 검색 기능을 추가하는 것이 매우 간단합니다. 다음 경로로 이동하세요. DuckDuckGo 추가 기능 페이지그리고 LM Studio에서 실행하도록 지정하십시오.

이 기능을 활성화하면 양식을 실행할 때 채팅창 아래에 DuckDuckGo를 사용하여 검색어를 입력할지 묻는 옵션이 표시됩니다. 이 옵션을 선택하면 LM Studio는 실시간 검색 결과를 가져와 응답을 생성하기 전에 양식에 반영합니다.

LM Studio는 DuckDuckGo를 통해 웹을 검색합니다.

플러그인으로 할 수 있는 일은 이게 전부가 아닙니다. LM Studio 팀은 매우 유용한 플러그인을 몇 가지 개발했습니다. 예를 들어, 대규모 언어 모델이 위키피디아의 문서를 읽고 검색할 수 있도록 해주는 위키피디아 플러그인이 있습니다.

자바스크립트 샌드박스 플러그인도 있는데, 바이브 코딩에 관심이 있고 어떤 결과물이 나올지 빠르게 파악하고 싶을 때 매우 유용합니다. 하지만 상용으로 사용할 수 있는 수준의 결과물을 만들기 위해 그만한 노력을 들일 가치는 없다고 생각합니다.

대기업들을 없애버리자

LM Studio를 설정하면 휴대폰에서 대규모 언어 모델에 액세스할 수 있지만, 모든 추론 결과를 휴대폰으로 직접 전송하는 것도 가능합니다. 안드로이드 폰에서 더 작거나 더 큰 언어 모델 실행하기맥만큼 강력하지는 않겠지만요.

이러한 경량 모델의 ​​개선은 놀랍도록 빠른 속도로 계속되고 있습니다. 하드웨어 비용이 상승할 것으로 예상되는 만큼, OpenAI나 Google 같은 회사들이 구독료를 인상하더라도 놀라지 않을 것입니다. 하지만 이러한 변화에 전혀 영향을 받지 않는 환경을 갖추고 있다는 점은 매우 고무적입니다.

맨 위로 이동 버튼