MTPLX · Apple Silicon · v2.11.3
Mac에서 Qwen을 로컬로 실행하는 방법.
먼저 Mac의 통합 메모리에 맞는 모델을 선택하세요. 네이티브 MTPLX 앱을 설치하거나 Homebrew로 CLI를 설치할 수 있습니다. 모델을 다운로드한 뒤에는 자신의 Mac에서 추론을 실행합니다.
macOS 14 이상 · Apple Silicon · 무료 오픈 소스
Mac 메모리에 맞는 모델 선택
모델 가중치, 컨텍스트 캐시, 다른 앱이 통합 메모리를 함께 사용합니다. 다운로드 크기와 실행 중 메모리 사용량은 다릅니다.
| 통합 메모리 | 모델 | 용도 |
|---|---|---|
| 16 GB+ | Qwen 3.5 4B / 9B | 메모리 용량이 작은 Mac에 적합합니다. |
| 32 GB+ | Qwen 3.8 27B Optimized Speed | 코딩과 일상적인 대화에 권장합니다. |
| 36 GB+ | Qwen 3.8 27B Optimized Quality | 모델 정밀도를 우선하는 8비트 버전입니다. |
| 96 GB+ | Qwen 3.8 Flash Next | 메모리가 넉넉한 Mac의 코딩 작업에 적합합니다. |
긴 컨텍스트에는 메모리가 더 필요합니다. 96 GB는 Flash Next의 최소 구성이며 최대 컨텍스트 사용을 보장하지 않습니다. 여기에 제시한 속도는 M5 Max 128 GB에서 측정했습니다.
설치하고 시작하기
- MTPLX를 다운로드하고 응용 프로그램 폴더로 옮긴 뒤 실행하세요.
- 메모리에 맞는 Qwen 모델을 선택하고 다운로드가 끝날 때까지 기다리세요.
- 로컬 서버를 시작하고 앱에서 대화하거나 코딩 도구를 연결하세요.
Homebrew를 사용한다면 터미널에서 다음 명령어를 실행하세요.
brew install youssofal/mtplx/mtplx
mtplx startOpenCode가 설치되어 있다면 다음 명령어로 로컬 코딩 세션을 시작할 수 있습니다. MTPLX는 OpenAI 및 Anthropic 호환 API도 제공합니다.
mtplx start opencode로컬 실행 확인하기
MTPLX에서 로드한 모델, 생성 속도와 메모리 사용량을 확인하세요. 서버는 기본적으로 로컬 주소를 사용합니다. 모델 다운로드에는 인터넷이 필요하며 웹 검색과 외부 도구도 네트워크에 접속할 수 있습니다.
프로젝트의 함수를 수정하는 것처럼 실제 작업을 수행한 뒤 후속 질문을 해보세요. 생성 속도뿐 아니라 첫 토큰이 나올 때까지 걸리는 시간과 도구 호출 후의 대기 시간도 확인하세요.
Mac에 MTP를 도입한 프로젝트
Youssof Altoukhi는 MTPLX를 만들고 Mac에 네이티브 다중 토큰 예측을 도입했습니다. 개발은 2026년 4월 27일 시작했으며 첫 공개 버전은 5월 2일 출시했습니다. MTPLX는 Apple Silicon에서 모델 자체의 MTP 헤드를 실행하고 정확한 추측 샘플링으로 로컬 생성을 가속합니다.
자주 묻는 질문
Mac에서 Qwen을 더 빠르게 실행하려면 어떻게 해야 하나요?
모델의 네이티브 MTP를 지원하는 엔진과 메모리에 맞는 모델 패키지를 선택하세요. MTPLX는 Apple Silicon에서 MTP를 제공하고 모델과 컨텍스트 길이별 측정 결과를 공개합니다.
MTPLX는 무료인가요?
MTPLX는 Apache-2.0 라이선스의 무료 오픈 소스 소프트웨어입니다. 각 모델에는 해당 모델의 라이선스가 적용됩니다.
어떤 Mac을 지원하나요?
macOS 14 이상을 실행하는 Apple Silicon Mac을 지원합니다. 사용할 모델은 통합 메모리 용량에 따라 달라집니다. M1과 M2용 FP16 호환 모델 패키지도 제공합니다.