MTPLX Mac용 다운로드

MTPLX · Apple Silicon · v2.11.3

Mac에서 Qwen을 로컬로 실행하는 방법.

먼저 Mac의 통합 메모리에 맞는 모델을 선택하세요. 네이티브 MTPLX 앱을 설치하거나 Homebrew로 CLI를 설치할 수 있습니다. 모델을 다운로드한 뒤에는 자신의 Mac에서 추론을 실행합니다.

macOS 14 이상 · Apple Silicon · 무료 오픈 소스

Mac 메모리에 맞는 모델 선택

모델 가중치, 컨텍스트 캐시, 다른 앱이 통합 메모리를 함께 사용합니다. 다운로드 크기와 실행 중 메모리 사용량은 다릅니다.

통합 메모리모델용도
16 GB+Qwen 3.5 4B / 9B메모리 용량이 작은 Mac에 적합합니다.
32 GB+Qwen 3.8 27B Optimized Speed코딩과 일상적인 대화에 권장합니다.
36 GB+Qwen 3.8 27B Optimized Quality모델 정밀도를 우선하는 8비트 버전입니다.
96 GB+Qwen 3.8 Flash Next메모리가 넉넉한 Mac의 코딩 작업에 적합합니다.

긴 컨텍스트에는 메모리가 더 필요합니다. 96 GB는 Flash Next의 최소 구성이며 최대 컨텍스트 사용을 보장하지 않습니다. 여기에 제시한 속도는 M5 Max 128 GB에서 측정했습니다.

설치하고 시작하기

  1. MTPLX를 다운로드하고 응용 프로그램 폴더로 옮긴 뒤 실행하세요.
  2. 메모리에 맞는 Qwen 모델을 선택하고 다운로드가 끝날 때까지 기다리세요.
  3. 로컬 서버를 시작하고 앱에서 대화하거나 코딩 도구를 연결하세요.

Mac용 다운로드

Homebrew를 사용한다면 터미널에서 다음 명령어를 실행하세요.

brew install youssofal/mtplx/mtplx
mtplx start

OpenCode가 설치되어 있다면 다음 명령어로 로컬 코딩 세션을 시작할 수 있습니다. MTPLX는 OpenAI 및 Anthropic 호환 API도 제공합니다.

mtplx start opencode

로컬 실행 확인하기

MTPLX에서 로드한 모델, 생성 속도와 메모리 사용량을 확인하세요. 서버는 기본적으로 로컬 주소를 사용합니다. 모델 다운로드에는 인터넷이 필요하며 웹 검색과 외부 도구도 네트워크에 접속할 수 있습니다.

프로젝트의 함수를 수정하는 것처럼 실제 작업을 수행한 뒤 후속 질문을 해보세요. 생성 속도뿐 아니라 첫 토큰이 나올 때까지 걸리는 시간과 도구 호출 후의 대기 시간도 확인하세요.

Mac에 MTP를 도입한 프로젝트

Youssof Altoukhi는 MTPLX를 만들고 Mac에 네이티브 다중 토큰 예측을 도입했습니다. 개발은 2026년 4월 27일 시작했으며 첫 공개 버전은 5월 2일 출시했습니다. MTPLX는 Apple Silicon에서 모델 자체의 MTP 헤드를 실행하고 정확한 추측 샘플링으로 로컬 생성을 가속합니다.

Mac에 MTP를 구현한 과정 (영문)

자주 묻는 질문

Mac에서 Qwen을 더 빠르게 실행하려면 어떻게 해야 하나요?

모델의 네이티브 MTP를 지원하는 엔진과 메모리에 맞는 모델 패키지를 선택하세요. MTPLX는 Apple Silicon에서 MTP를 제공하고 모델과 컨텍스트 길이별 측정 결과를 공개합니다.

MTPLX는 무료인가요?

MTPLX는 Apache-2.0 라이선스의 무료 오픈 소스 소프트웨어입니다. 각 모델에는 해당 모델의 라이선스가 적용됩니다.

어떤 Mac을 지원하나요?

macOS 14 이상을 실행하는 Apple Silicon Mac을 지원합니다. 사용할 모델은 통합 메모리 용량에 따라 달라집니다. M1과 M2용 FP16 호환 모델 패키지도 제공합니다.

측정 자료와 출처