MTPLX · Apple Silicon · v2.11.3
Qwen 3.8 Flash Next를 Mac에서 빠르게 실행하세요.
Qwen3.8-Flash-Next는 125B 파라미터의 전문가 혼합 모델입니다. MTPLX는 네이티브 MTP 헤드를 유지하고 샘플링 분포를 보존하는 추측 디코딩으로 생성을 가속합니다. 통합 메모리 96 GB 이상인 Mac에 적합하며 OpenCode 같은 개발 도구에 연결할 수 있습니다.
macOS 14 이상 · Apple Silicon · 무료 오픈 소스
Flash Next의 실측 생성 속도
MTPLX 2.11.3, MacBook Pro M5 Max, 128 GB, Optimized Speed. 샘플링 설정은 temperature 1.0, top-p 0.95, top-k 20입니다.
| 작업 | tok/s | 측정 조건 |
|---|---|---|
| 단일 OpenCode 요청 | 125.8 | 1,301토큰 생성. 프롬프트 18,539토큰 중 18,364토큰을 캐시에서 재사용. MTP 깊이 3. |
| 약 9K토큰의 코드 프롬프트 | 79.3 | 1,500토큰 생성. 같은 Mac에서 번갈아 측정. 2.11.2에서는 62.5 tok/s. |
| 109K토큰 OpenCode 턴 | 61.8 | 두 번 측정한 평균값. |
| 200K토큰 후속 턴 | 50.3 | 캐시가 준비된 상태에서 두 번 측정한 평균값. |
125.8 tok/s는 2026년 9월 16일의 단일 요청에서 측정한 결과입니다. 실제 속도는 칩, 모델 버전, 컨텍스트 길이와 캐시 상태에 따라 달라집니다.
2.11.3 릴리스 노트 (영문)모델 버전과 메모리 요구 사항
권장 버전인 Optimized Speed는 동적 4비트 양자화를 사용하며 Qwen Sparse Attention 투영을 8비트로 유지합니다. Bare Speed는 일괄 4비트 양자화를 사용해 생성 속도를 우선합니다.
Optimized Speed 다운로드는 약 115.1 GB이며 SSD에서 읽는 32 GB n-gram 테이블을 포함합니다. 약 83 GB의 모델 가중치가 메모리에 상주하고 컨텍스트와 계산에도 여유 공간이 필요합니다. Bare Speed는 다운로드 약 106.3 GB, 상주 가중치 약 74 GB입니다.
Hugging Face: Optimized Speed설치하고 시작하기
- MTPLX를 다운로드하고 응용 프로그램 폴더로 옮긴 뒤 실행하세요.
- 메모리에 맞는 Qwen 모델을 선택하고 다운로드가 끝날 때까지 기다리세요.
- 로컬 서버를 시작하고 앱에서 대화하거나 코딩 도구를 연결하세요.
Homebrew를 사용한다면 터미널에서 다음 명령어를 실행하세요.
brew install youssofal/mtplx/mtplx
mtplx startOpenCode가 설치되어 있다면 다음 명령어로 로컬 코딩 세션을 시작할 수 있습니다. MTPLX는 OpenAI 및 Anthropic 호환 API도 제공합니다.
mtplx start opencodeMac에 MTP를 도입한 프로젝트
Youssof Altoukhi는 MTPLX를 만들고 Mac에 네이티브 다중 토큰 예측을 도입했습니다. 개발은 2026년 4월 27일 시작했으며 첫 공개 버전은 5월 2일 출시했습니다. MTPLX는 Apple Silicon에서 모델 자체의 MTP 헤드를 실행하고 정확한 추측 샘플링으로 로컬 생성을 가속합니다.
자주 묻는 질문
32 GB Mac에서 Flash Next를 실행할 수 있나요?
현재 MTPLX 모델 패키지는 96 GB 이상 Mac을 대상으로 합니다. 32 GB Mac에는 Qwen 3.8 27B Optimized Speed를 권장합니다.
Flash Next와 Flash-Next는 같은 모델인가요?
네. 모두 Qwen3.8-Flash-Next를 의미합니다. 모델 저장소 이름은 하이픈이 포함된 공식 표기를 따릅니다.