Mac에서 로컬 LLM은 뭘 써야 할까? MLX vs Ollama vs LM Studio 비교
프로그래밍 이야기/Mac에서 로컬 AI 또는 LLM 활용하기 2026. 10. 6. 16:52Mac에서 로컬 LLM을 사용하려고 검색하다 보면 거의 반드시 만나게 되는 이름이 있다.
MLX, Ollama, LM Studio
처음 로컬 LLM을 접하면 이 세 가지 가운데 하나를 선택해야 하는 것처럼 느껴진다.
나 역시 M4 Mac mini 24GB와 M1 Max 64GB MacBook Pro에서 로컬 LLM을 사용해보려고 관련 자료를 찾아보면서 자연스럽게 이 세 가지를 비교하게 됐다.
그런데 자료를 정리하다 보니 중요한 사실이 하나 있었다.
MLX와 Ollama, LM Studio는 사실 완전히 같은 종류의 프로그램이 아니다.
그래서 단순히
MLX가 빠른가?
Ollama가 빠른가?
LM Studio가 빠른가?
라고 비교하는 것부터 조금 잘못된 질문일 수 있다.
이번 글에서는 Apple Silicon Mac에서 로컬 LLM을 사용할 때 MLX, Ollama, LM Studio가 각각 어떤 역할을 하는지, 그리고 어떤 사용자에게 어떤 선택이 적합한지 정리해봤다.
먼저 결론부터
아주 간단하게 정리하면 다음과 같다.
목적추천
| 로컬 LLM을 처음 사용 | LM Studio |
| 터미널에서 간단하게 사용 | Ollama |
| Claude Code / Codex 연동 | Ollama 또는 LM Studio |
| 모델 성능 테스트 | MLX / MLX-LM |
| Apple Silicon을 직접 활용한 개발 | MLX |
| API 서버로 사용 | Ollama / LM Studio |
| 모델 다운로드부터 GUI로 관리 | LM Studio |
| 자동화·스크립트·서버 | Ollama |
| Fine-tuning / 모델 실험 | MLX-LM |
결국 하나가 무조건 다른 두 개보다 좋은 것은 아니다.
사용 목적이 다르다.
MLX는 정확히 무엇일까?
MLX는 Apple의 Machine Learning Research 팀이 만든 머신러닝 프레임워크다.
NumPy나 PyTorch와 비슷한 개념으로 볼 수 있다.
MLX의 가장 중요한 특징은 Apple Silicon의 Unified Memory, 통합 메모리 구조를 적극적으로 활용한다는 점이다.
Apple Silicon에서는 CPU와 GPU가 동일한 메모리 공간에 접근할 수 있다.
MLX에서는 배열 데이터를 CPU 메모리에서 GPU 메모리로 계속 복사할 필요 없이 같은 메모리를 CPU와 GPU가 사용할 수 있도록 설계되어 있다.
이 때문에 Apple Silicon과 굉장히 잘 맞는다.
MLX 자체는 단순한 LLM 실행 프로그램이 아니다.
머신러닝 모델을 만들고 실행하고 학습할 수 있는 프레임워크다.
그럼 MLX-LM은 무엇일까?
로컬 LLM 사용자 입장에서는 순수 MLX보다 MLX-LM을 접하게 될 가능성이 더 높다.
MLX-LM은 MLX를 이용해서 LLM을 실행하고 Fine-tuning하기 위한 패키지다.
모델 생성, 채팅, 양자화, LoRA 학습, 평가, 서버 실행 등의 기능을 제공한다. 공식 CLI에도 generate, chat, server, lora, benchmark, quant 관련 기능들이 포함돼 있다.
따라서
MLX = 기반 프레임워크
MLX-LM = MLX 기반 LLM 도구
라고 생각하면 이해하기 쉽다.
설치도 비교적 간단하다.
pip install mlx-lm
형태로 설치할 수 있다.
Apple Silicon에서 MLX 자체를 설치하려면 현재 공식 요구사항은 Apple Silicon, native Python 3.10 이상, macOS 14 이상이다.
MLX의 장점
MLX의 가장 큰 장점은 역시 Apple Silicon에 직접 접근한다는 것이다.
특히 다음과 같은 경우에 매력적이다.
- 모델별 성능 측정
- Prompt Processing 속도 측정
- Token 생성 속도 측정
- Peak Memory 측정
- 직접 Python 코드에서 모델 제어
- 양자화
- Fine-tuning
- LoRA
- 모델 구조 실험
MLX-LM의 생성 API에서는 실제로 Prompt TPS, Generation TPS, Peak Memory 같은 값도 얻을 수 있다.
즉 내가 가지고 있는
M4 Mac mini 24GB
와
M1 Max MacBook Pro 64GB
에서 동일한 모델의 성능을 제대로 비교하려면 MLX-LM이 상당히 좋은 도구가 된다.
MLX의 단점
반면 처음 사용하는 사람에게는 가장 진입장벽이 높다.
Python 환경을 구성해야 하고 터미널 명령어나 코드를 어느 정도 이해해야 한다.
또 모델을 그냥 다운받아 채팅해보고 싶은 사용자에게는 기능이 지나치게 전문적이다.
즉,
“로컬 AI 한번 써보고 싶다.”
라는 목적이라면 굳이 MLX부터 시작할 필요는 없다.
Ollama는 무엇이 다른가?
Ollama는 로컬 모델을 쉽게 다운로드하고 실행하고 API로 사용할 수 있게 만들어주는 도구다.
예를 들어 모델을 실행할 때 기본적으로
ollama run 모델명
정도의 명령으로 시작할 수 있다.
Mac뿐 아니라 Windows와 Linux에서도 사용할 수 있으며 현재 macOS 버전은 macOS 14 Sonoma 이상을 요구한다.
Ollama의 장점은 복잡한 모델 실행 환경을 사용자가 직접 구성하지 않아도 된다는 것이다.
모델 다운로드, 실행, 관리와 API 서버 역할까지 상당 부분 Ollama가 처리한다.
2026년에는 Ollama와 MLX의 관계도 달라졌다
예전에는
Ollama vs MLX
라는 비교가 비교적 자연스러웠다.
하지만 2026년에는 상황이 달라졌다.
Ollama가 Apple Silicon에서 MLX 엔진을 사용하기 시작했기 때문이다.
Ollama는 2026년 3월 Apple Silicon용 MLX 엔진을 공개했고, 6월에는 MLX 엔진의 추가 최적화를 통해 출력 속도와 메모리 효율을 개선했다고 발표했다.
즉 현재 Apple Silicon에서는
Ollama냐 MLX냐
라기보다는
MLX를 직접 사용할 것인가, Ollama를 통해 편하게 사용할 것인가
라는 질문에 가까워지고 있다.
이게 상당히 중요한 변화다.
Ollama의 가장 큰 장점은 개발 도구 연결
개발자 입장에서 현재 Ollama의 가장 흥미로운 기능 가운데 하나는 Coding Agent 연동이다.
2026년에는 ollama launch 명령이 추가됐다.
이를 이용하면 Claude Code, OpenCode, Codex 등의 Coding Agent를 Ollama의 로컬 또는 클라우드 모델과 연결할 수 있다.
예를 들어 Claude Code를 실행할 수 있고,
Codex 역시 Ollama의 OpenAI 호환 환경을 통해 로컬 모델을 사용할 수 있다.
이 기능 때문에
개발 머신 + 로컬 LLM
환경에서는 Ollama가 상당히 매력적이다.
Ollama의 장점
내가 개발용 Mac에서 사용할 목적이라면 다음이 가장 큰 장점이라고 생각한다.
첫째, 명령이 간단하다.
터미널 몇 줄만으로 모델을 설치하고 실행할 수 있다.
둘째, API 서버로 사용하기 쉽다.
로컬 앱이나 개발 프로젝트에서 LLM을 호출하기 편하다.
셋째, Agent 연동이 쉽다.
Claude Code, Codex 등과 연결하기가 상당히 간단해졌다.
넷째, Apple Silicon에서는 MLX 엔진까지 사용할 수 있다.
즉 편의성과 Apple Silicon 최적화를 어느 정도 동시에 얻을 수 있다.
Ollama의 단점
GUI 중심 사용자에게는 LM Studio만큼 직관적이지 않을 수 있다.
물론 Ollama도 macOS와 Windows용 앱을 제공하고 있으며 모델 채팅과 파일 입력 등의 기능을 사용할 수 있다.
하지만 모델을 검색하고
양자화 방식
모델 파일 크기
메모리 사용량
Context
런타임
등을 화면에서 하나씩 확인하면서 사용하는 경험은 LM Studio가 더 직관적인 편이다.
LM Studio는 무엇인가?
LM Studio는 세 제품 중 일반 사용자에게 가장 친숙한 형태다.
쉽게 말하면
로컬 LLM용 데스크톱 앱 + 모델 관리자 + 채팅 앱 + API 서버
라고 생각하면 된다.
앱 안에서 Hugging Face 기반 모델을 검색하고 다운로드하고 메모리에 올린 뒤 바로 채팅할 수 있다.
현재 Apple Silicon Mac에서는 GGUF 기반 llama.cpp뿐 아니라 MLX 모델도 직접 실행할 수 있다.
즉 LM Studio 역시 이제 단순한 llama.cpp GUI라고만 보기는 어렵다.
LM Studio의 가장 큰 장점은 GUI다
로컬 LLM을 처음 접한다면 LM Studio가 가장 이해하기 쉽다.
앱을 실행한 후
모델 검색
↓
다운로드
↓
모델 선택
↓
Load
↓
Chat
순서로 진행하면 된다.
터미널 환경이나 Python을 몰라도 된다.
이건 상당히 큰 장점이다.
24GB Mac에서는 LM Studio의 메모리 예측 기능이 특히 유용하다
M4 Mac mini 24GB 같은 시스템에서는 모델이 메모리에 들어갈지 여부가 상당히 중요하다.
LM Studio에서는 모델을 실제로 로딩하기 전에 메모리 요구량을 추정할 수 있다.
CLI에서는
lms load --estimate-only 모델명
형태로 사용할 수 있다.
이 기능은 Context Length와 GPU Offload, Flash Attention, Vision Model 여부 등을 고려해서 예상 메모리 사용량을 계산한다.
24GB나 32GB Mac에서 큰 모델을 시험할 때 상당히 유용하다.
LM Studio도 API 서버로 사용할 수 있다
GUI 프로그램이라고 해서 채팅용으로만 사용하는 것은 아니다.
LM Studio는 로컬 REST API 서버를 실행할 수 있다.
현재
OpenAI 호환 API
Anthropic 호환 API
LM Studio 자체 REST API
TypeScript SDK
Python SDK
등을 제공한다.
기존 OpenAI API 기반 프로그램이라면 Base URL을 LM Studio의 localhost 주소로 변경해서 로컬 모델을 사용할 수도 있다.
즉 GUI 프로그램이면서 동시에 개발용 서버 역할도 한다.
Claude Code도 LM Studio와 연결할 수 있다
이 부분도 흥미롭다.
LM Studio는 2026년부터 Anthropic 호환 /v1/messages API를 제공하면서 Claude Code와 직접 연결할 수 있게 됐다.
예를 들어 LM Studio의 로컬 서버를 실행하고 Claude Code의 ANTHROPIC_BASE_URL을 localhost로 바꾸면 로컬 모델을 Claude Code에서 사용할 수 있다.
Codex 역시 LM Studio의 OpenAI-compatible Responses API를 사용할 수 있다.
따라서
Claude Code → Ollama
만 가능한 것은 아니다.
Claude Code → LM Studio
구성도 충분히 가능하다.
LM Studio도 내부적으로 MLX를 사용한다
여기까지 보면 재미있는 관계가 만들어진다.
Apple Silicon 환경에서는
MLX
라는 기반 기술이 있고,
그 MLX를
Ollama
도 사용하고,
LM Studio
도 사용할 수 있다.
LM Studio는 자체 mlx-engine을 개발해서 MLX-LM과 MLX-VLM을 기반으로 Apple Silicon용 추론 엔진을 제공한다.
2026년에는 장시간 Agent 작업에서 KV Cache를 체크포인트하는 방식으로 MLX 엔진을 개선하기도 했다. LM Studio가 공개한 자체 테스트에서는 일부 Agent 워크로드에서 추가 RAM 사용량 감소와 처리량 개선 효과가 보고됐다.
따라서 단순히
MLX = 빠름
LM Studio = 느린 GUI
라고 구분하는 것도 현재는 정확하지 않다.
LM Studio 자체가 MLX를 사용할 수 있기 때문이다.
결국 셋의 관계는 이렇게 보는 게 가장 정확하다
개인적으로는 다음과 같이 이해하는 것이 가장 쉬웠다.
MLX / MLX-LM
엔진룸을 직접 여는 방식
직접 모델을 제어하고 측정하고 실험한다.
Ollama
개발자를 위한 편한 실행기
명령어와 API 중심으로 모델을 빠르게 실행한다.
LM Studio
GUI와 개발 기능을 함께 제공하는 통합 도구
모델 검색부터 채팅, API 서버까지 화면에서 관리한다.
세 가지를 다시 비교하면
항목MLX / MLX-LMOllamaLM Studio
| 설치 편의성 | ★★★ | ★★★★☆ | ★★★★★ |
| GUI | ❌ | △ | ★★★★★ |
| CLI | ★★★★★ | ★★★★★ | ★★★★ |
| 모델 검색/관리 | ★★ | ★★★★ | ★★★★★ |
| Apple Silicon 최적화 | ★★★★★ | ★★★★★ | ★★★★★ |
| Python 개발 | ★★★★★ | ★★★★ | ★★★★ |
| REST API | △ | ★★★★★ | ★★★★★ |
| Claude Code 연동 | 가능하지만 직접 구성 | ★★★★★ | ★★★★★ |
| Codex 연동 | 직접 구성 필요 | ★★★★★ | ★★★★★ |
| Fine-tuning | ★★★★★ | 제한적 | 제한적 |
| 성능 분석 | ★★★★★ | ★★★★ | ★★★★ |
| 초보자 추천 | ★★ | ★★★★ | ★★★★★ |
중요한 것은 Apple Silicon 성능 항목이다.
현재 Ollama와 LM Studio 모두 MLX 기반 엔진을 사용할 수 있기 때문에 단순히 제품 이름만 가지고 어느 것이 무조건 더 빠르다고 말하기 어렵다.
모델 형식, 양자화, Context Length, 런타임 버전과 설정에 따라 결과가 달라질 수 있다.
M4 Mac mini 24GB에서는 무엇을 사용할까?
내가 현재 사용하고 있는 M4 Mac mini 24GB를 기준으로 생각하면 목적별로 선택할 것 같다.
모델을 처음 찾아볼 때
LM Studio
GUI에서 모델 크기와 정보를 확인하기 편하고 메모리 사용량도 예측할 수 있기 때문이다.
개발하면서 로컬 API가 필요할 때
Ollama
CLI와 API가 단순하고 개발 도구 연결이 편하다.
Claude Code / Codex에서 로컬 모델을 사용할 때
Ollama 또는 LM Studio
둘 다 현재 상당히 잘 지원한다.
M4와 M1 Max 성능을 직접 비교할 때
MLX-LM
Prompt TPS, Generation TPS, Peak Memory 같은 데이터를 직접 측정하기에 적합하다.
하나만 설치한다면?
이것도 사용자에 따라 다르다.
일반 사용자라면
LM Studio
가장 쉽게 시작할 수 있다.
개발자라면
나는 Ollama부터 설치할 것 같다.
모델 실행부터 API, Coding Agent 연결까지 활용 범위가 상당히 넓다.
Apple Silicon의 성능 자체를 연구하고 싶다면
MLX-LM
이 가장 적합하다.
그런데 사실 하나만 선택할 필요가 없다
이게 최종적으로 내린 결론이다.
MLX, Ollama, LM Studio는 서로 완전히 대체하는 프로그램이 아니다.
Mac에
Ollama + LM Studio + MLX-LM
을 모두 설치해서 목적에 따라 사용해도 된다.
예를 들어
LM Studio에서 모델을 찾아보고,
Ollama에서 개발 프로젝트에 연결하고,
MLX-LM에서 정확한 성능을 측정하는 식이다.
각각의 역할이 다르기 때문에 의외로 이 방식이 가장 자연스럽다.
2026년에는 차이가 점점 줄어들고 있다
특히 흥미로운 것은 Ollama와 LM Studio가 모두 Apple MLX를 적극적으로 활용하기 시작했다는 점이다.
Ollama는 Apple Silicon MLX 엔진을 제공하고 있고, 2026년 6월 업데이트에서는 추가적인 Metal 커널 최적화와 Agent용 캐시 개선을 발표했다.
LM Studio 역시 자체 MLX Engine을 제공하며 Agentic Workflow를 위한 KV Cache 개선 등을 진행하고 있다.
결국 앞으로는
어떤 프로그램이 MLX를 쓰느냐
보다
어떤 인터페이스와 개발 환경이 나에게 편한가
가 더 중요한 선택 기준이 될 가능성이 높아 보인다.
내 경우에는 이렇게 사용할 것 같다
현재 가지고 있는 장비는
M4 Mac mini 24GB
와
M1 Max MacBook Pro 64GB
다.
두 장비에서 로컬 LLM을 계속 테스트한다면 다음처럼 사용할 생각이다.
LM Studio
모델 탐색과 빠른 테스트
Ollama
개발 프로젝트와 Claude Code, Codex 연동
MLX-LM
M4와 M1 Max의 직접적인 성능 비교
이렇게 역할을 나누면 상당히 효율적일 것 같다.
특히 다음에는 같은 모델을
MLX-LM
Ollama MLX
LM Studio MLX
환경에서 각각 실행해서 실제 Token 생성 속도와 메모리 사용량 차이가 얼마나 나는지도 한번 비교해보고 싶다.
결론
처음에는 MLX, Ollama, LM Studio 가운데 무엇이 가장 좋은지 선택해야 하는 문제라고 생각했다.
하지만 자료를 정리해보니 질문 자체가 조금 달랐다.
MLX는 Apple Silicon에 최적화된 머신러닝 프레임워크다.
그리고
Ollama와 LM Studio는 로컬 모델을 훨씬 쉽게 사용하는 환경이다.
더구나 2026년에는 Ollama와 LM Studio 모두 MLX를 활용하고 있다.
따라서 단순하게
MLX vs Ollama vs LM Studio
의 승자를 고르는 것보다는
무엇을 하려는가
를 먼저 정하는 것이 맞다.
로컬 LLM을 처음 경험해보고 싶다면 LM Studio.
개발과 자동화, API, Coding Agent가 목적이라면 Ollama.
Apple Silicon에서 모델을 직접 다루고 분석하거나 Fine-tuning까지 하고 싶다면 MLX-LM.
현재로서는 이렇게 구분하는 것이 가장 현실적이라고 생각한다.
참고자료
이 글을 작성하면서 다음 공식 자료를 참고했다.
1. Apple MLX 공식 문서 — Unified Memory
Apple Silicon에서 CPU와 GPU가 동일한 메모리 풀에 접근하고 MLX가 이 구조를 활용하는 방식을 참고했다.
2. Apple MLX 공식 문서 — 설치 및 시스템 요구사항
Apple Silicon에서 MLX를 사용하기 위한 macOS와 Python 요구사항 및 설치 방법을 참고했다.
3. MLX-LM 공식 프로젝트
MLX를 이용한 LLM 생성, Fine-tuning, 양자화, 서버 및 성능 측정 기능을 참고했다.
4. Ollama — Apple Silicon MLX Engine
Ollama가 2026년부터 Apple Silicon에서 MLX를 활용하는 구조와 성능 개선 내용을 참고했다.
5. Ollama — ollama launch
Claude Code, OpenCode, Codex 등 Coding Agent를 로컬 또는 클라우드 모델에 연결하는 기능을 참고했다.
6. Ollama — Claude Code 및 Codex 연동
Anthropic 호환 API와 OpenAI Codex를 로컬 모델에 연결하는 방법을 참고했다.
7. LM Studio 공식 문서
LM Studio가 GGUF 기반 llama.cpp와 Apple Silicon용 MLX 모델을 모두 실행할 수 있다는 내용을 참고했다.
8. LM Studio — 로컬 API 서버
REST API, OpenAI 호환 API, Anthropic 호환 API 및 SDK 기능을 참고했다.
9. LM Studio — 메모리 사용량 예측
모델을 로딩하기 전 lms load --estimate-only를 이용해 메모리 요구량을 추정할 수 있는 기능을 참고했다.
10. LM Studio — Claude Code / Codex 연동
LM Studio의 Anthropic 호환 Messages API와 OpenAI-compatible Responses API를 통한 Coding Agent 연결 방법을 참고했다.
※ 각 도구의 성능은 사용 모델, 모델 형식, 양자화 방식, Context Length, 런타임 버전과 하드웨어에 따라 달라질 수 있다. 따라서 특정 도구가 항상 가장 빠르다고 단정하기보다는 같은 모델과 동일한 조건에서 직접 비교하는 것이 가장 정확하다.





