현재 32GB 램이 달린 M5 맥북 에어에서 돌아가는 오픈소스 LLM 들의 순위를 메겨주세요.
라는 질문을 Claude Opus 4.8 Extra, ChatGPT 5.5 High, Gemini 3.1 Pro 에게 Deep Research 시킨 후 받은 응답.
sudo sysctl iogpu.wired_limit_mb=24576 명령으로 24GB까지 올릴 수 있으며, GitHub macOS·앱용으로 최소 8GB를 남기는 것이 안전합니다. 따라서 **모델 가중치 + KV 캐시 실사용 한도는 약 222026년 6월 기준 base M5(153 GB/s)에서의 절대 tok/s 직접 측정치는 커뮤니티에 거의 없습니다. 온라인의 "M5" 수치는 대부분 M5 Max(614 GB/s, base 대비 약 4배 대역폭)입니다 — 예를 들어 Michael Hannecke(Medium, 2026)가 인용한 "decode from 58 to 112 tokens per second, measured on an M5 Max running Qwen3.5–35B-A3B in NVFP4"(int4 시 134 tok/s)는 M5 Max 수치이므로 base M5에 그대로 적용하면 안 됩니다. 아래는 base M4 실측 앵커에 Apple의 측정 배수(dense 1.19×, MoE 1.25×)를 적용한 외삽 추정치입니다.
| 모델 (4-bit) | 구조 | base M5 추정 디코드 | 근거 |
|---|---|---|---|
| Qwen3.5-9B | dense | 소형 dense, 외삽 | |
| gpt-oss-20b (MXFP4) | MoE 3.6B 활성 | 외삽 | |
| Qwen3.6-35B-A3B | MoE 3B 활성 | M4 base ~17 tok/s × 1.25, 외삽 | |
| Gemma 4 26B-A4B | MoE 3.8B 활성 | 외삽 | |
| Gemma 4 12B | dense | 외삽 | |
| Qwen3.6-27B | dense | 외삽 | |
| Mistral Small 3.2 24B | dense | 외삽 | |
| Gemma 4 31B | dense | 외삽 |
Qwen3.6-35B-A3B (Alibaba, 2026-04-16 출시) — MoE, 총 35B/활성 3B, Apache 2.0, Build Fast with AI 추론(하이브리드 thinking) 모델. MMLU-Pro 85.2, GPQA Diamond 86.0, SWE-bench Pro 49.5, Hugging Face AIME 2026 92.7, Artificial Analysis Intelligence Index 43. 4-bit MLX 약 19.5~20GB. 256K 네이티브 컨텍스트. 이 머신의 종합 1순위.
Qwen3.6-27B (Alibaba, 2026-04-22 출시) — dense, 28B 파라미터, Hugging Face Apache 2.0, 추론 모델. MMLU-Pro 86.2, GPQA Diamond 87.8, SWE-bench Verified 77.2. Hugging Face 4-bit GGUF ~16.8GB(Simon Willison이 Unsloth Q4_K_M로 25.57 tok/s 측정, 단 상위 사양 Mac), 6-bit ~20GB. dense라 base M5에서는 느림. 품질 우선 순위 1위지만 느림.
Gemma 4 31B Dense (Google, 2026-04-02 출시) — dense, Apache 2.0, 추론 모델. MMLU-Pro 85.2, AIME 2026 89.2, GPQA Diamond 84.3, LiveCodeBench v6 80.0, Arena AI 1452(개방형 3위). Auriga IT 4-bit ~20GB. dense라 base M5에서 매우 느림(79 tok/s).
Gemma 4 26B-A4B MoE (Google, 2026-04-02 출시) — MoE, 총 26B/활성 3.8B, Auriga IT Apache 2.0. AIME 2026 88.3, Arena AI 1441(개방형 6위). 4-bit 1418GB. Auriga IT MoE라 빠름.
Gemma 4 12B (Google, 2026-06-03 출시) Build Fast with AI — dense, 11.95B, TECHSY Apache 2.0, 멀티모달(텍스트+이미지+오디오 입력), 256K 컨텍스트. MMLU-Pro 77.2(전세대 Gemma 3 27B의 67.6 대비 대폭 상승), GPQA Diamond ~78.8(비공식·검증 전). 4-bit 6.77.4GB, 8-bit ~13.4GB. Digital Applied Team 8-bit로 올려도 32GB에 여유롭게 들어가는 품질·속도 균형형.
gpt-oss-20b (OpenAI, 2025-08 출시) — MoE, 총 21B/활성 3.6B, Apache 2.0, 추론 모델(reasoning effort 조절). Artificial Analysis 집계 기준 MMLU-Pro 74.8, GPQA Diamond 68.8, AIME 2025 89.3, Intelligence Index 24.5. (참고: OpenAI 자체 모델카드는 평가 조건이 달라 MMLU 85.3, GPQA Diamond 71.5, AIME 2025 98.7로 더 높음.) MXFP4 네이티브 ~12GB. 작고 빠르며 수학·추론 강점.
Mistral Small 3.2 24B (Mistral, 2025-06 출시) — dense, Apache 2.0, 비추론(표준) 모델, 멀티모달. MMLU 84.5(자체)/ Chats-llm MMLU-Pro 65.9(Artificial Analysis). 4-bit ~15GB. 구세대지만 안정적이고 함수 호출·구조화 출력에 강함.
Qwen3.5-9B (Alibaba, 2026-02 출시) — dense 소형, Apache 2.0. 8GB급에서도 구동, ModelFit base M5에서 매우 빠름. 메모리에 여유를 두고 빠른 응답이 필요할 때의 안전한 백업.
1단계 — 기본 설치 (대부분 사용자): LM Studio를 설치하고 MLX 백엔드로 Qwen3.6-35B-A3B 4-bit를 받으십시오. 이것이 이 32GB M5 Air에서 "잘 들어가면서 + 빠르고 + 가장 똑똑한" 종합 최적입니다. 설치 후 sudo sysctl iogpu.wired_limit_mb=24576로 VRAM 한도를 24GB로 올리고, GitHub 컨텍스트를 8K~16K로 설정해 KV 캐시 압박을 피하십시오. SudoAll
2단계 — 품질을 더 원할 때: 동일 답변 품질에서 더 높은 정밀도가 필요하면 **Qwen3.6-27B 6-bit(MLX)**로 전환하되, dense라 1014 tok/s로 느려지는 점을 감수해야 합니다. 멀티모달(이미지·오디오)이 필요하면 Gemma 4 12B 8-bit가 균형이 가장 좋습니다.
3단계 — 속도/저메모리를 더 원할 때: 더 빠른 응답이나 큰 컨텍스트가 필요하면 gpt-oss-20b(MXFP4) 또는 Qwen3.5-9B 4-bit로 내려가십시오.
전환 기준(임계값):
2026년 현재 대형 언어 모델(LLM) 생태계는 거대한 클라우드 데이터센터 중심의 연산에서 벗어나, 소비자용 에지(Edge) 디바이스 환경으로 급격히 재편되고 있다. 이러한 패러다임 전환의 중심에는 단연코 Apple Silicon의 진화가 자리 잡고 있다. 과거 수천만 원을 호가하는 다중 GPU 클러스터에서나 제한적으로 구동할 수 있었던 300억(30B) 파라미터 이상의 고성능 오픈소스 모델들이 이제는 노트북 환경에서 온전히 로컬로 구동되는 시대가 도래했다. 본 보고서는 이러한 기술적 변곡점의 최전선에 있는 최신 3나노미터(3nm) 공정 기반 Apple M5 맥북 에어(MacBook Air) 32GB 통합 메모리(Unified Memory) 환경을 심층적으로 분석한다. 특히 2026년 상반기에 앞다투어 출시된 Qwen 3.6 시리즈, Gemma 4 라인업, 그리고 DeepSeek-R1 증류(Distilled) 모델들은 아키텍처 측면에서 혁신적인 진보를 이루어냈다. 이들은 고도의 지능을 유지하면서도 연산 부하를 극단적으로 줄이는 전문가 혼합형(MoE, Mixture-of-Experts) 구조를 도입하거나, 멀티모달 인코더를 아예 제거하는 등 제한된 하드웨어 자원을 극한으로 활용하는 방식을 채택하고 있다. 본 보고서는 물리적인 냉각 팬이 없는 맥북 에어 폼팩터의 열역학적 한계, 153.6 GB/s로 제한된 메모리 대역폭, 그리고 macOS의 커널 메모리 할당 정책을 모두 종합적으로 고려하여, 해당 시스템에서 가장 뛰어난 성능을 발휘하는 오픈소스 LLM의 순위를 산정하고 그 기저에 깔린 하드웨어 및 소프트웨어 상호작용의 원리를 규명한다.
대형 언어 모델의 추론(Inference) 워크로드를 정확히 평가하기 위해서는 호스트 시스템이 지닌 물리적 한계와 아키텍처적 특성을 정밀하게 이해해야 한다. Apple의 M5 아키텍처는 CPU, GPU, 그리고 신경망 처리 장치(NPU)가 단일한 LPDDR5X 메모리 풀을 지연 없이 공유하는 통합 메모리(Unified Memory) 구조를 기반으로 한다. 이는 데이터를 CPU 램에서 GPU VRAM으로 복사해야 하는 전통적인 x86 및 개별 그래픽 카드(Discrete GPU) 아키텍처 대비 근본적인 지연 시간(Latency)의 이점을 제공한다.
기본형 M5 칩은 10코어 CPU를 탑재하고 있으며, 이는 4개의 고성능 슈퍼 코어(Super Cores)와 6개의 고효율 코어(Efficiency Cores)로 구성된다. 하지만 LLM 추론에 있어 더욱 중요한 변화는 10코어 구조로 설계된 차세대 GPU 아키텍처에 있다. 이전 M4 세대까지는 표준 산술 논리 장치(ALU)를 공유하여 인공지능 연산을 처리했던 반면, M5는 각 GPU 코어 내부에 전용 신경망 가속기(Neural Accelerator)를 물리적으로 통합하였다. 이러한 하드웨어적 진보를 통해 M5는 사이클당 1,024개의 FP16 FMA(Fused Multiply-Accumulate) 연산을 전용으로 수행할 수 있게 되었으며, 이는 GPU 기반 AI 워크로드의 최고 연산 속도를 M4 대비 4배 이상, 초기 M1 아키텍처 대비 6배 이상 끌어올리는 결과를 낳았다. 이러한 연산 유닛의 통합은 하드웨어 가속 레이 트레이싱(Hardware-accelerated ray tracing) 모듈 및 16코어 Neural Engine과 맞물려, 복잡한 다단계 추론이나 에이전트 코딩(Agentic coding) 워크로드를 저전력으로 수행할 수 있는 기반을 마련한다.
연산 능력이 비약적으로 향상되었음에도 불구하고, LLM의 토큰 생성(Decoding) 속도는 여전히 메모리 대역폭(Memory Bandwidth)에 의해 절대적인 제한을 받는다. LLM은 단일 토큰을 생성할 때마다 모델의 전체 가중치(Weights)를 메모리에서 연산기로 불러와야 하기 때문이다. M5 맥북 에어의 메모리 대역폭은 153.6 GB/s(LPDDR5X 9600 MT/s)로, M4 대비 약 30% 향상되었다.
이는 상위 기종인 M5 Pro(307 GB/s)나 M5 Max(460614 GB/s)에 비하면 현저히 낮은 수치다. 메모리 대역폭 중심(Memory Bandwidth-bound) 워크로드의 특성상, 이론적인 최대 토큰 생성 속도는 대역폭을 모델 크기로 나눈 값으로 수렴한다. 예를 들어, 4비트 양자화(Q4)가 적용되어 크기가 약 7GB인 9B(90억) 파라미터 모델의 경우, 이론적 한계는 153.6 / 7 = 약 21.9 토큰/초 수준이다. 그러나 최근 M5의 전용 신경망 가속기와 최적화된 캐시 라우팅을 활용한 MLX 프레임워크를 적용할 경우, M5 맥북 에어에서 해당 모델이 최대 58.7 tok/s에 달하는 실측 생성 속도를 보인다는 분석 결과가 보고되고 있다. 반면, 가중치 크기가 약 16.8GB에 달하는 밀집형 27B 모델은 동일 시스템에서 약 1518 tok/s 수준의 속도로 둔화되며 대역폭의 물리적 한계를 여실히 드러낸다.
32GB라는 물리적 메모리가 제공된다고 해서 LLM이 이를 전부 모델 적재에 사용할 수 있는 것은 아니다. macOS의 그래픽 프레임워크인 Metal은 시스템의 전반적인 안정성과 백그라운드 프로세스의 구동을 보장하기 위해, 기본적으로 통합 메모리의 약 75%만을 GPU 작업(즉, recommendedMaxWorkingSetSize)에 할당하도록 커널 레벨에서 제한하고 있다. 32GB 시스템의 경우 이 한계치는 약 21~24GB 수준에 형성된다. 만약 사용자가 20GB 크기의 양자화 모델을 로드하고, 32K 이상의 긴 컨텍스트 윈도우(Context Window) 처리를 위해 방대한 KV 캐시(Key-Value Cache)를 생성하게 되면, GPU 메모리 요구량은 즉각적으로 이 24GB 임계치를 돌파하게 된다. 임계치를 넘어서는 순간 macOS는 초당 수백 기가바이트의 전송이 필요한 텐서 데이터를 상대적으로 매우 느린 SSD 스왑(Swap) 메모리로 넘기기 시작하며, 이 지점에서 LLM의 토큰 생성 속도는 0.02 tok/s라는 사실상 정지 상태로 추락하게 된다. 이를 극복하기 위해 에지 AI 커뮤니티와 시스템 엔지니어들은 macOS의 숨겨진 커널 파라미터를 조정하는 방식을 채택하고 있다. sudo sysctl iogpu.wired_limit_mb=28672 와 같은 명령어를 통해 Metal의 GPU 메모리 할당 한도를 시스템 램의 90% 수준인 28GB까지 강제로 상향 조정하는 것이다. 이 오버라이드(Override)를 적용하면 32GB 맥북 에어에서도 20GB 규모의 35B 모델들을 스왑 페이징(Swap paging) 없이 온전히 하드웨어 가속으로 구동할 수 있다. 단, 운영체제 자체에 남겨지는 메모리가 4GB 남짓으로 극도로 제한되므로, 모델 구동 중 다른 무거운 애플리케이션(Docker, 웹 브라우저 다중 탭 등)의 동시 사용을 엄격히 통제해야 하는 운영상의 제약이 따른다.
메모리 대역폭이 153.6 GB/s로 제한되고 물리적 냉각 팬이 존재하지 않는 32GB M5 맥북 에어에서 최고의 효율을 도출하기 위해, 모델 아키텍처의 선택은 성능을 좌우하는 가장 핵심적인 변수다. 2026년 현재 오픈소스 생태계는 크게 밀집형(Dense) 구조와 전문가 혼합형(MoE) 구조로 양분되어 경쟁하고 있다. 밀집형(Dense) 아키텍처는 신경망을 구성하는 모든 파라미터가 매번 토큰을 생성할 때마다 빠짐없이 연산에 참여하는 전통적인 구조다. Qwen 3.6 27B와 같은 모델은 단 하나의 토큰을 출력하기 위해 270억 개의 전체 가중치에 대해 행렬 곱셈을 수행해야 한다. 이는 모델의 논리적 깊이와 일관성을 극대화하여 코딩이나 수학적 증명과 같은 고난도 작업에서 무결점에 가까운 성능을 보여주지만, 치명적인 단점을 수반한다. 연산 부하(Compute load)가 매우 높아 팬리스 기반의 맥북 에어에서 수천 토큰 이상의 장문 텍스트를 지속해서 생성할 경우 필연적으로 열 축적(Thermal build-up) 현상을 유발하며, 시스템이 기기를 보호하기 위해 클럭을 낮추는 열 스로틀링(Thermal Throttling)에 직면하게 된다. 반면, 전문가 혼합형(MoE) 아키텍처는 방대한 파라미터를 다수의 전문가(Expert) 서브 네트워크로 분할하고, 라우터(Router) 모듈이 현재 처리 중인 토큰의 문맥에 가장 적합한 소수의 전문가만을 동적으로 선택하여 활성화하는 방식이다. Qwen 3.6 35B-A3B 모델의 경우 전체 파라미터는 350억 개에 달하지만, 토큰당 활성화되는 파라미터는 30억 개(A3B)에 불과하다. Gemma 4 26B-A4B 역시 252억 개의 총 파라미터 중 128개의 전문가 네트워크를 구성하고, 단 38억 개의 파라미터만을 선별적으로 가동한다. MoE 아키텍처는 전체 모델 가중치를 통합 메모리에 상주시켜야 하므로 밀집형 모델에 비해 높은 램 용량을 요구하지만, 실제 수행되는 연산량(FLOPs)은 3B~4B 수준의 소형 모델과 동일하다. 따라서 디코딩 속도가 비약적으로 빠르며, 연산 부하가 적어 팬이 없는 맥북 에어 환경에서도 장시간 안정적인 저발열 추론이 가능하다. 이러한 특성 덕분에 대역폭과 냉각 성능이 제한적인 소비자용 디바이스에서 MoE 아키텍처는 성능과 열 관리라는 두 가지 물리적 한계를 동시에 돌파하는 핵심 솔루션으로 자리매김하였다.
본 순위는 모델의 4비트 양자화 시 메모리 요구량(VRAM Footprint), 에이전트 코딩 및 수학적 추론 벤치마크, M5의 153.6 GB/s 대역폭 내에서의 실측 구동 속도, 그리고 장기 컨텍스트(Long Context) 처리 능력을 복합적으로 교차 검증하여 산정되었다. Llama 4 Scout 109B와 같은 초대형 모델은 고도의 퀀타이제이션을 적용하더라도 64GB 이상의 메모리를 요구하므로 32GB 시스템 구동 범위를 벗어나 평가에서 제외되었다.
| 종합 순위 | 모델명 | 아키텍처 (파라미터 / 활성) | 필요 메모리 (Q4 양자화) | 주요 벤치마크 최고치 | 예상 속도 (M5 Base) | 활용 목적 최적화 |
|---|---|---|---|---|---|---|
| 1위 | Qwen 3.6 35B-A3B | MoE (35B / 3B) | 약 20.1 GB | HumanEval+ 89.6% | ~ 30-45 tok/s | 실시간 에이전트 코딩, 대화형 추론 |
| 2위 | Qwen 3.6 27B | 밀집형 (27B / 27B) | 약 16.8 GB | SWE-bench 77.2% | ~ 12-18 tok/s | 고정밀 다단계 리팩토링, 백그라운드 배치 |
| 3위 | DeepSeek-R1-Distill-32B | 밀집형 (32B / 32B) | 약 20.0 GB | AIME 2024 72.6% | ~ 9-14 tok/s | 고난도 수학, 논리적 자가 검증, 버그 추적 |
| 4위 | Gemma 4 26B-A4B | MoE (25.2B / 3.8B) | 약 14.4 GB | MMLU Pro 82.6% | ~ 35-50 tok/s | 안정적 메모리 관리, 병렬 사용자 처리 |
| 5위 | Gemma 4 12B | 밀집형 (11.9B / 11.9B) | 약 6.7 GB | GPQA Diamond 78.8% | ~ 50-65 tok/s | 네이티브 오디오/비전, 문서 구조 분석 |
| 6위 | Qwen 2.5 Coder 32B | 밀집형 (32B / 32B) | 약 18.6 GB | HumanEval 90%+ | ~ 10-15 tok/s | IDE 통합 플러그인 레거시 코드 생성 |
32GB 메모리를 장착한 M5 맥북 에어 환경에서 현재 선택할 수 있는 가장 완벽한 타협점이자 정점에 있는 모델은 Alibaba의 Qwen 3.6 35B-A3B다. 이 모델의 가장 큰 무기는 희소성(Sparsity)을 활용한 압도적인 연산 효율성이다. 메모리에는 35B 규모의 방대한 지식 기반을 모두 적재하여 깊이 있는 컨텍스트를 유지하면서도, 실제 디코딩 과정에서는 단 30억 개의 파라미터만 활성화하여 연산을 수행하므로 속도가 타의 추종을 불허한다. 벤치마크 결과를 살펴보면, Qwen 3.6 35B-A3B는 HumanEval+ 테스트에서 89.6%라는 경이로운 점수를 기록하며 Claude 3.5 Sonnet이나 GPT-4o와 같은 프론티어급 폐쇄형 모델에 필적하는 에이전트 코딩(Agentic coding) 능력을 입증했다. 사용자가 이 모델을 통해 복잡한 소프트웨어 아키텍처를 설계하거나 여러 파일에 걸친 코드 리팩토링을 지시할 때, 3B 연산 부하 덕분에 M5 맥북 에어의 153.6 GB/s 대역폭 한계 내에서도 초당 30~45 토큰에 달하는 쾌적한 반응성을 경험할 수 있다. 더욱이 시각 지능(Vision)과 텍스트를 단일 가중치 내에서 모두 처리할 수 있는 네이티브 멀티모달 능력을 갖추고 있어, 복잡한 다이어그램을 분석하고 이를 코드로 변환하는 작업까지 원활히 지원한다. Q4 양자화 기준 약 20.1GB의 램을 요구하므로 앞서 설명한 sysctl iogpu.wired_limit_mb 커널 튜닝을 통해 할당 한도를 확장해야 하지만, 팬리스 환경에서 스로틀링 없이 장시간 코딩 파이프라인을 유지할 수 있다는 점에서 1위로 선정되었다.
속도와 발열 제어를 차치하고, 오직 코딩 품질과 심층적인 논리 추론의 '무결성'만을 평가한다면 Qwen 3.6 27B는 독보적인 위치를 점한다. 이는 밀집형(Dense) 아키텍처의 특성에 기인한다. 매 토큰을 생성할 때마다 270억 개의 전체 파라미터가 빠짐없이 활성화되어 신경망을 통과하므로, MoE 아키텍처가 전문가 라우팅 과정에서 간과할 수 있는 미묘한 문맥적 뉘앙스나 보안 취약점을 훨씬 더 견고하게 분석해낸다. 이는 벤치마크 수치로도 명확히 증명된다. Qwen 3.6 27B는 실제 GitHub 이슈 해결 능력을 측정하는 SWE-bench Verified에서 77.2%를 기록하며, 파라미터 수가 10배 이상 큰 이전 세대 플래그십(Qwen 3.5 397B)마저 능가하는 성능을 과시했다. 또한 GPQA Diamond(대학원 수준의 과학 및 논리 추론)에서 87.8%를 달성하여 압도적인 학술적 역량을 보여준다. 하지만 M5 맥북 에어의 환경에서는 이 거대한 연산량이 양날의 검으로 작용한다. 153.6 GB/s의 메모리 대역폭을 완전히 포화(Saturate)시키기 때문에, 초당 토큰 생성 속도는 12~18 tok/s 수준으로 하락하여 대화형 챗봇으로 사용하기에는 다소 답답함을 느낄 수 있다. 그럼에도 불구하고 이 모델이 2위를 차지한 이유는 약 16.8GB에 불과한 훌륭한 메모리 경제성 덕분이다. 32GB 시스템에서 macOS 커널 튜닝 없이도 안전하게 적재되며, Docker 컨테이너나 무거운 IDE(통합 개발 환경)를 동시에 구동할 수 있는 넉넉한 램 여유 공간(Headroom)을 보장한다. 따라서 실시간 반응성보다 단 한 번의 프롬프트로 완벽한 결과물을 도출해야 하는 백그라운드 리서치나 자동화 파이프라인에 최적화된 모델이다.
2026년 인공지능 생태계에 가장 큰 패러다임 전환을 가져온 모델은 단연 DeepSeek-R1 시리즈다. 중국의 DeepSeek AI가 불과 560만 달러의 훈련 비용으로 개발한 671B 원본 모델에서 논리적 사고 패턴만을 추출(Distillation)하여 Qwen 2.5 32B 백본에 이식한 이 모델은, OpenAI의 o1 모델과 유사한 '사고의 사슬(Chain-of-Thought)' 기능을 로컬 환경에서 완벽하게 구현한다. 이 모델의 핵심은 최종적인 텍스트를 출력하기 전에 태그 내에서 자가 교정(Self-correction), 가설 검증, 오류 백트래킹을 명시적으로 수행한다는 점이다. 사용자가 난해한 알고리즘의 최적화나 복잡한 수학적 증명을 요구할 때, 모델은 내부적으로 여러 접근 방식을 시도하고 논리적 모순을 스스로 발견하여 경로를 수정한다. 이는 AIME 2024(미국 수학 올림피아드) 벤치마크에서 72.6%라는 경이로운 점수를 달성하는 원동력이 되었다. 특히 허레틱(Heretic) 라이브러리를 통해 안전 가드레일을 완화한 검열 해제(Abliterated/Uncensored) 버전은 어떠한 제약이나 답변 거부 없이 극한의 시스템 프롬프트에도 순응하며 추론을 이어간다. 32GB M5 맥북 에어에서는 4비트 양자화 시 약 20GB의 메모리를 점유하므로 시스템 한계선에 도달하지만, sysctl 튜닝을 통해 안정적인 구동이 가능하다. 단점은 사고 과정(Thinking phase)에서 적게는 수백 개에서 많게는 수만 개의 토큰을 사전 생성하므로, 대역폭이 제한된 M5 시스템에서 최종 응답을 확인하기까지 상당한 시간이 소요된다는 점이다. 즉흥적인 코드 자동완성보다는 난제를 해결하기 위한 '디지털 페어 프로그래머'로서 활용 가치가 극대화된다.
Google DeepMind가 설계한 Gemma 4 26B-A4B는 하드웨어 제약이 심한 소비자 기기에서 대형 모델을 구동하기 위한 '예산 내 추론(Budget Inference)'의 교과서적인 사례다. 총 252억 개의 파라미터를 128개의 전문가 네트워크로 세분화하고, 특정 토큰을 처리할 때 단 38억 개(A4B)의 파라미터만을 동적으로 활성화하는 극단적인 희소성 라우팅(Sparse routing)을 채택했다. 이러한 공학적 설계 덕분에 모델은 상위 플래그십인 Gemma 4 31B(Dense)에 필적하는 지능(AIME 2026 88.3%, MMLU Pro 82.6%)을 유지하면서도, 연산 부하는 4B 소형 모델 수준으로 억제한다. Q4 양자화 기준 요구 메모리가 약 14.4GB로 매우 낮아, 32GB 맥북 에어에서 복잡한 시스템 설정 변경 없이도 매우 안정적으로 적재된다. 또한 여유 메모리를 대규모 KV 캐시에 할당할 수 있어 256K에 달하는 거대한 컨텍스트 윈도우를 적극적으로 활용하여 수백 페이지의 문서를 한 번에 분석할 수 있다. 코딩 벤치마크(LiveCodeBench v6 77.1%)에서 Qwen 3.6 라인업에 근소하게 밀리는 경향이 있어 4위로 배치되었으나, 범용 텍스트 분석과 다중 사용자 동시 처리 환경에서는 가장 신뢰할 수 있는 모델이다.
일반적인 10B 규모의 모델들이 단순히 텍스트 생성에 머무는 반면, Gemma 4 12B는 멀티모달(Multimodal) 아키텍처의 근본적인 혁신을 통해 5위에 올랐다. 기존의 시각 및 음성 처리 모델들은 무거운 개별 인코더(Vision/Audio Encoder)를 거쳐 텍스트로 변환한 뒤 이를 LLM에 주입하는 방식을 사용했다. 그러나 Gemma 4 12B는 이러한 분리된 인코더 모듈을 완전히 제거한 최초의 중형 인코더-프리(Encoder-free) 아키텍처를 도입했다. 단순한 선형 투영(Linear projection) 모듈 1회만 거쳐 48x48 픽셀의 원시 이미지 패치나 16kHz 오디오 프레임 파형을 LLM의 임베딩 차원으로 직접 밀어 넣는다. 이 구조적 혁신은 메모리 풋프린트를 극단적으로 줄여주어, 4비트 양자화 시 불과 6.7GB의 램만을 소비한다. 32GB M5 맥북 에어 환경에서는 25GB 이상의 가용 램이 남아돌아, 어떠한 제약 없이 쾌적한 데스크탑 멀티태스킹이 가능하다. 네이티브 오디오 입력 기능 덕분에 중간 변환 과정 없이 사용자의 음성을 직접 이해하고 텍스트를 출력하는 실시간 음성 비서(Voice Agent)를 로컬에서 구축하는 데 독보적인 효율을 자랑한다.
비록 세대가 교체되며 Qwen 3.6 라인업에 최고 자리를 내주었으나, Qwen 2.5 Coder 32B는 여전히 전 세계 수많은 개발자들의 에디터(VS Code, JetBrains) 내부에서 Continue.dev와 같은 로컬 코딩 플러그인을 통해 구동되는 산업 표준 모델이다. 320억 개의 파라미터가 제공하는 문맥 파악의 깊이와 자동 완성(Autocomplete) 코드 제안의 문법적 무결성은 신뢰도가 매우 높다 (HumanEval 90% 이상). 다만 32GB 밀집형 모델의 특성상 18.6GB에 달하는 메모리를 차지하고 대역폭 병목에 취약하여 초당 10~15 토큰 수준으로 구동되므로, 반응성을 중시하는 최신 트렌드를 반영하여 6위로 선정되었다.
하드웨어의 제약을 극복하고 위 모델들의 잠재력을 끝까지 인출하기 위해서는 2026년 현재 고도화된 추론 프레임워크와 최신 양자화(Quantization) 포맷을 적극적으로 도입해야 한다.
전통적으로 로컬 오픈소스 LLM 구동의 표준이었던 llama.cpp는 C++ 기반의 범용성으로 널리 쓰여 왔다. 그러나 Apple Silicon 생태계에서는 Apple 기계 학습 연구팀이 M-시리즈 통합 메모리 구조와 NPU 신경망 가속기를 하드웨어 레벨에서 직접 제어하기 위해 개발한 MLX 프레임워크가 압도적인 우위를 점하고 있다. 데이터 벤치마크에 따르면, 10B~30B 급 모델 구동 시 MLX 백엔드는 llama.cpp 대비 텍스트 디코드(Decode) 속도를 20%에서 특정 모델의 경우 최대 92%까지 향상시키는 것으로 나타났다. 이러한 기술적 격차를 인지하고, 전 세계적으로 가장 대중적인 LLM 구동 툴인 Ollama는 2026년 3월 0.19 버전을 기점으로 Mac 환경에서 내부 추론 엔진을 MLX 백엔드로 전면 전환했다. 이 업데이트를 통해 M5 맥북 에어 사용자는 복잡한 파이썬 가상환경 설정 없이도, Qwen 3.5 35B-A3B와 같은 MoE 모델에서 첫 토큰 생성 시간(Prefill/TTFT)을 최대 57% 단축하고 전반적인 생성 속도를 93%가량 끌어올리는 극적인 체감 성능 향상을 누릴 수 있게 되었다.
32GB 시스템에서 30B 이상 급의 모델을 온전히 구동하기 위해서는 모델의 가중치를 4비트 수준으로 압축하는 양자화(Quantization)가 필수적이다.
로컬 환경에서 LLM의 실질적인 가치는 단순히 모델을 로드하는 것에 그치지 않고, 수십 개의 코드 파일, 방대한 기술 문서, 또는 이전 대화 기록을 모델에 주입하여 개인화된 답변을 얻는 데 있다. 이 과정에서 발생하는 **KV 캐시(Key-Value Cache)**의 관리는 32GB 시스템에서 가장 경계해야 할 요소다. 사용자가 모델에 긴 텍스트를 입력하면, 모델은 이를 내부적인 텐서 공간(Key와 Value 행렬)에 저장하여 다음 토큰 예측 시 연산을 생략한다. 문제는 이 KV 캐시가 차지하는 메모리가 텍스트 길이에 비례해 선형적으로 팽창한다는 점이다. 예를 들어 약 16.8GB를 차지하는 Qwen 3.6 27B 모델을 사용할 때, 32,000 토큰(32K) 길이의 컨텍스트를 주입하면 KV 캐시만으로 약 1.6GB가 추가 소모된다. 이를 64K로 확장하면 3.2GB를 소모하며, 262,000 토큰(262K)의 전체 컨텍스트 윈도우를 활용하려 할 경우 수 GB 이상의 램이 증발해버린다. 앞서 언급한 iogpu.wired_limit_mb 커널 튜닝을 통해 GPU 할당량을 28GB로 늘려두었다 하더라도, 모델 가중치(17GB)와 KV 캐시(4GB)가 합쳐져 이 한계치를 돌파하는 순간 치명적인 메모리 페이징(Paging) 현상이 발생한다. 따라서 32GB 맥북 에어 사용자는 클라우드 환경처럼 무작정 컨텍스트 한도를 최대로 개방하는 행위를 지양해야 한다. 실질적인 작업에 필수적인 8K~16K 수준으로 max_model_len 인자를 엄격히 제한하고, 문서의 핵심만 요약해서 프롬프트에 주입하는 컨텍스트 엔지니어링(Context Engineering)이 수반되어야만 시스템 충돌이나 성능 저하 없이 워크로드를 완수할 수 있다.
2026년의 Apple M5 아키텍처와 32GB 통합 메모리의 조합은 소비자용 경량 랩탑의 범주를 넘어섰다. 불과 몇 년 전만 해도 엔터프라이즈 데이터센터의 수천만 원대 그래픽 카드 서버에서나 가능했던 고도화된 AI 추론 작업을 사용자의 책상 위, 비행기 안, 카페 등 완벽한 오프라인 환경에서 프라이빗하게 수행할 수 있는 혁명적인 자유를 제공한다. 철저한 보안이 요구되는 기업의 독점적인 소스 코드 분석이나, 외부 클라우드로 전송할 수 없는 민감한 데이터 리서치 워크로드에 있어 이 폼팩터는 궁극의 대안이다. 분석 결과, 32GB라는 물리적 램의 제약, 153.6 GB/s로 묶여 있는 메모리 대역폭, 그리고 물리적 팬이 존재하지 않는 방열(Thermal) 구조의 한계를 동시에 극복하기 위한 최적의 해답은 전문가 혼합형(MoE) 아키텍처임이 명백히 입증되었다.
결론부터 말하면, M5 맥북 에어 32GB에서 가장 추천할 만한 모델은 Qwen3-30B-A3B입니다. 이유는 단순합니다. 32GB 한도 안에서 품질 대비 속도 비율이 가장 좋고, MoE 구조 덕분에 체감 성능이 dense 14B급보다 더 좋으면서도 M5 기본 칩 기준 커뮤니티 실측에서 Q4_K_M GGUF 23.1 tok/s, peak RSS 17.48GB가 나왔기 때문입니다. 여기에 Qwen3 계열은 공식적으로 로컬 툴로 Ollama, MLX, llama.cpp, LM Studio, vLLM, SGLang을 권장하며, Apache-2.0 라이선스를 사용합니다. citeturn44view0turn30view0turn43view0
그 다음은 Qwen3-14B, Phi-4 14B, Qwen3-8B, Mistral Small 3.1 24B, DeepSeek-R1-Distill-Qwen-14B 순으로 보는 것이 가장 현실적입니다. 다만 이 순서는 “절대 성능”이 아니라 32GB 에어에서 실제로 오래 쓰기 좋은가를 기준으로 정한 것입니다. 예를 들어 DeepSeek-R1-Distill-Qwen-14B는 추론 벤치마크가 매우 강하지만, 공식 권장 자체가 온도 0.6·시스템 프롬프트 회피·<think> 강제 같은 운영 요령을 요구하고, reasoning 출력이 길어져 실사용 지연이 커지기 쉽습니다. 반대로 Qwen3-8B는 최고급 품질은 아니어도 속도와 안정성, 설치 편의성에서 매우 강합니다. citeturn45view0turn30view0turn44view0
플랫폼 관점에서는 MLX가 Apple Silicon 최적화 측면에서 가장 유리하고, Ollama는 가장 쉽게 설치, llama.cpp는 가장 통제 가능, vLLM-metal은 네이티브 arm64 전용이지만 설치 난도가 더 높다고 보는 것이 맞습니다. Apple은 MLX가 Apple Silicon 통합 메모리 구조를 활용하며, 최신 M5에서는 Neural Accelerators까지 사용한다고 설명합니다. llama.cpp는 Apple Silicon을 ARM NEON, Accelerate, Metal로 최적화된 “first-class citizen”으로 명시합니다. vLLM-metal은 Rosetta/x86_64 Python을 지원하지 않으며 arm64 Python 3.12가 필요합니다. PyTorch MPS는 돌아가지만 Apple도 여전히 beta 성격임을 분명히 적고 있습니다. citeturn39view0turn32view0turn32view2turn32view4
이번 보고서에서 가장 신뢰도 높은 M5 실측은 두 축입니다. 첫째, Apple은 M5 MacBook Air가 153GB/s 메모리 대역폭, 최대 32GB 통합 메모리를 제공한다고 밝힙니다. 둘째, mac-llm-bench는 M5 10 CPU / 10 GPU / 32GB 구성에서 GGUF와 일부 MLX 4-bit 모델의 실제 tg128 속도와 peak RSS를 공개합니다. 일부 모델은 이 두 소스를 직접 쓸 수 있고, 일부는 Apple MLX 연구 글과 유사 14B/24B 모델의 M5 실측을 바탕으로 보수적으로 추정했습니다. citeturn37search3turn37search9turn30view0turn39view0
아래 표는 “M5 맥북 에어 32GB에서 실제로 돌려 쓸 때의 총합 가치” 기준입니다. tok/s는 가능한 경우 M5 10C CPU / 10C GPU / 32GB 실측을 우선했고, 없는 경우는 명시적으로 추정으로 표시했습니다. citeturn30view0turn39view0
| 순위 | 모델 | 라이선스 | 모델 규모 | 4-bit 또는 실사용 메모리 | M5 Air 32GB 속도 | 네이티브 실행성 | 판단 |
|---|---|---|---|---|---|---|---|
| 상 | Qwen3-30B-A3B | Apache-2.0 계열 Qwen3 오픈 배포 citeturn44view0turn43view0 | 총 30B / 활성 3B / 128K citeturn44view0 | GGUF Q4_K_M peak RSS 17.48GB citeturn30view0 | 23.1 tok/s GGUF 실측 citeturn30view0 | Ollama·MLX·llama.cpp·vLLM·SGLang 권장 citeturn44view0 | 32GB 맥에서 최고 균형 |
| 상 | Qwen3-14B | Apache-2.0 citeturn43view0 | 14.8B / 128K citeturn43view0 | M5 MLX 4-bit 메모리 9.16GB, GGUF Q4_K_M peak RSS 8.52GB citeturn39view0turn30view0 | MLX 10~12 tok/s 추정, GGUF 5.8 tok/s 실측 citeturn30view0turn31view3turn39view0 | Qwen 공식이 로컬로 Ollama·MLX-LM·llama.cpp 지원 명시 citeturn43view0 | best dense all-rounder |
| 중상 | Phi-4 14B | Microsoft 공개 배포, Ollama/HF 제공 citeturn6view3turn41search0 | 14B / 16K citeturn41search0turn22search1 | MLX 4-bit 8.25GB, GGUF Q4_K_M peak RSS 8.56GB citeturn17view2turn30view0 | MLX 11.6 tok/s, GGUF 5.3 tok/s 실측 citeturn31view2 | MLX·Transformers·vLLM·Docker Model Runner 지원 citeturn16view3 | 코딩/수학 우선이면 강함 |
| 중상 | Qwen3-8B | Qwen3 계열 Apache-2.0 오픈 배포 citeturn44view0 | 8B / 128K citeturn44view0 | MLX 4-bit 4.61GB, GGUF Q4_K_M peak RSS 4.81GB citeturn17view1turn30view0 | MLX 24.0 tok/s, GGUF 9.1 tok/s 실측 citeturn31view0turn30view0 | Ollama·MLX·llama.cpp 등 로컬 친화적 citeturn44view0 | 기본값으로 가장 빠르고 편함 |
| 중 | Mistral Small 3.1 24B | Apache-2.0 citeturn40view1turn40view0 | 24B / 128K / 멀티모달 citeturn40view1 | MLX 4-bit 14.1GB, M5 peak RSS 13.50~13.80GB citeturn17view5turn30view0 | MLX 6.9 tok/s, GGUF 3.6 tok/s 실측 citeturn31view3turn30view0 | 32GB Mac에서 실행 가능하다고 Mistral이 직접 명시 citeturn40view1turn40view0 | 품질 좋지만 에어에서는 느림 |
| 중 | DeepSeek-R1-Distill-Qwen-14B | MIT, 원형 Qwen2.5 파생 citeturn45view0 | 15B / distill / 32K gen window 평가 citeturn45view0 | MLX 4-bit 8.31GB, GGUF/MLX peak RSS 8.52~8.80GB citeturn17view3turn30view0 | MLX 10.8 tok/s, GGUF 5.6 tok/s 실측 citeturn31view3 | Qwen/Llama 방식으로 로컬 실행 가능 citeturn45view0 | 추론 특화, 체감 지연 큼 |
아래 막대는 권장 런타임 기준의 대략적 생성 속도입니다. 실측이 있는 모델은 실측을 썼고, Qwen3-14B MLX 4-bit만 14B급 유사 모델과 Apple의 M5 MLX 메모리 데이터를 바탕으로 보수 추정했습니다. reasoning 모드가 길어질수록 실제 완료 시간은 tok/s보다 더 나빠질 수 있습니다. citeturn30view0turn39view0turn45view0
xychart-beta
title "M5 Air 32GB 권장 런타임 기준 생성 속도"
x-axis ["Qwen3-30B-A3B","Qwen3-14B","Phi-4 14B","Qwen3-8B","Mistral Small 3.1","DeepSeek-R1-DQ14B"]
y-axis "tok/s" 0 --> 25
bar [23.1,11,11.6,24,6.9,10.8]
핵심은 M5 에어가 GPU 연산형 머신이 아니라 메모리 대역폭형 머신이라는 점입니다. Apple은 M5 MacBook Air의 통합 메모리 대역폭을 153GB/s로 제시했고, Apple ML Research는 LLM의 첫 토큰은 계산 지배, 이후 토큰 생성은 메모리 대역폭 지배라고 설명합니다. 동일 글에서 Qwen3-14B-MLX-4bit 메모리를 9.16GB, Qwen3-30B-A3B-MLX-4bit 메모리를 17.31GB로 제시했고, M5가 M4 대비 생성에서 19~27% 이득을 준다고 밝힙니다. 그래서 dense 24B보다 active params가 작은 MoE 30B-A3B가 훨씬 더 매력적입니다. citeturn37search3turn39view0
Qwen3-30B-A3B를 최상위로 둔 이유는 품질과 속도가 동시에 잡히기 때문입니다. Qwen은 Qwen3-30B-A3B가 총 30B, 활성 3B, 128K context의 MoE라고 설명하고, Qwen3 MoE 계열이 Qwen2.5 dense 계열과 비슷한 성능을 active params 10% 수준으로 달성한다고 밝힙니다. 동시에 커뮤니티 M5 32GB 실측은 23.1 tok/s / 17.48GB입니다. 32GB 에어에서 이 정도 품질-속도 조합을 내는 공개 모델은 매우 드뭅니다. citeturn44view0turn30view0
Qwen3-14B는 가장 무난한 dense 상한선입니다. Qwen 공식 카드 기준 14.8B, 128K context, Apache-2.0, 로컬 툴 지원도 넓습니다. Qwen 블로그는 Qwen3-14B dense base가 Qwen2.5-32B base와 맞먹는 수준이라고 설명합니다. M5 측면에서는 Apple이 Qwen3-14B-MLX-4bit를 직접 벤치한 적이 있고, 메모리 사용량은 9.16GB입니다. 다만 절대 tok/s는 Apple 글에 없어서, M5 32GB에서 실측이 있는 동급 14B 모델인 Phi-4-4bit 11.6 tok/s와 DeepSeek-R1-Distill-Qwen-14B-4bit 10.8 tok/s를 근거로 11 tok/s 전후로 보는 것이 가장 보수적입니다. GGUF Q4_K_M 실측은 5.8 tok/s입니다. citeturn43view0turn44view0turn39view0turn31view2turn31view3turn30view0
Phi-4 14B는 코딩과 수학이 우선일 때 Qwen3-14B와 거의 동급의 대안입니다. M5 base 32GB 실측에서 MLX 11.6 tok/s, GGUF 5.3 tok/s, peak RSS 8.56~8.90GB이고, mac-llm-bench의 HumanEval+는 **82.3%**입니다. LLMCheck의 다른 Apple Silicon 페이지에서도 Phi-4 14B는 M2·M4·M5 Max 전반에서 꾸준히 상위권 속도를 보입니다. citeturn31view2turn30view0turn22search1
Qwen3-8B는 “최고 품질”보다는 가장 좋은 기본값입니다. 공식 MLX 4-bit 파일 크기가 4.61GB이고, M5 32GB 실측이 MLX 24 tok/s, GGUF 9.1 tok/s입니다. Qwen 공식 블로그는 Qwen3-8B dense가 Qwen2.5-14B dense와 비슷한 수준이라고 설명합니다. 즉, 성능은 충분히 쓸 만하고, 반응성은 이 여섯 모델 중 상위권입니다. 하루 종일 코드 보조·문서 요약·브라우저 병행을 할 때는 이 모델이 가장 스트레스가 적습니다. citeturn17view1turn31view0turn30view0turn44view0
Mistral Small 3.1 24B는 품질은 높지만, 에어에서는 순수 효율이 떨어집니다. Mistral은 이 모델을 Apache-2.0, 128K context, 멀티모달, 32GB Mac에서 실행 가능이라고 직접 밝힙니다. 또 Mistral Small 3 24B instruct 모델 카드는 공개 벤치에서 MMLU-Pro 0.663, GPQA 0.453, HumanEval 0.848, MT-Bench 8.35 등을 제시합니다. 하지만 M5 base 32GB 실측은 MLX 6.9 tok/s, GGUF 3.6 tok/s로, 품질은 좋지만 Air에서의 응답성은 분명히 느립니다. citeturn40view1turn40view0turn17view5turn30view0
DeepSeek-R1-Distill-Qwen-14B는 벤치마크만 보면 더 높이 둘 수도 있습니다. 공식 카드에서 AIME 2024 69.7, MATH-500 93.9, GPQA Diamond 59.1, LiveCodeBench 53.1, Codeforces 1481를 기록합니다. 라이선스는 MIT이며, Qwen2.5 파생 모델임을 명시합니다. 문제는 이 모델이 reasoning 과정이 길고, DeepSeek 공식 권장도 temperature 0.5~0.7, 시스템 프롬프트 지양, <think>\n 강제 같은 운영 튜닝을 요구한다는 점입니다. M5 32GB 실측 자체는 MLX 10.8 tok/s로 나쁘지 않지만, 체감 완료 시간은 쉽게 길어집니다. 그래서 “전천후 기본 모델”보다 추론 특화 서브 모델로 두는 편이 맞습니다. citeturn45view0turn31view3turn30view0
이 모델은 이번 조건에서 가장 추천되는 1순위입니다. Qwen은 Qwen3-30B-A3B를 30B total / 3B active / 128K MoE로 공개했고, 로컬 사용 시 Ollama, LM Studio, MLX, llama.cpp 등을 직접 권장합니다. M5 32GB 실측에서는 Q4_K_M GGUF 23.1 tok/s, peak RSS 17.48GB입니다. 품질 면에서는 Qwen3 MoE 계열이 dense 계열 대비 훨씬 적은 active params로 유사 성능을 낸다는 공식 설명이 있고, Qwen3 전체는 하이브리드 thinking / non-thinking 모드를 지원합니다. 이 조합 때문에 “32GB 에어에서 가장 큰 체감 향상”을 줍니다. citeturn44view0turn30view0
권장 런타임은 Ollama 또는 llama.cpp, 더 세밀하게 만지려면 MLX입니다. 다만 현재 제가 확보한 M5 32GB 실측은 GGUF 기준이므로, 가장 확실한 선택은 Ollama/llama.cpp 계열입니다. Thinking 모드는 품질을 올리지만 출력 길이를 크게 늘릴 수 있으므로, 일상 대화·코드 수정·문서 요약에서는 non-thinking 기본, 어려운 문제에만 thinking으로 전환하는 운용이 좋습니다. citeturn44view0turn30view0
이 모델은 dense 계열 최우선 추천입니다. 공식 카드 기준 Apache-2.0, 14.8B params, 128K context이고, transformers, vLLM, SGLang, Ollama, MLX-LM, llama.cpp까지 광범위하게 연결됩니다. Qwen은 Qwen3-14B가 Qwen2.5-32B급 dense 모델과 맞먹는다고 설명합니다. Apple은 M5+MLX 글에서 Qwen3-14B-MLX-4bit 메모리 9.16GB를 직접 제시했습니다. citeturn43view0turn44view0turn39view0
다만 중요한 단점이 하나 있습니다. M5 32GB에서 Qwen3-14B-MLX-4bit 절대 tok/s를 공개한 1차 자료를 이번 조사에서는 확보하지 못했습니다. 대신 같은 M5 32GB에서 Phi-4-4bit 11.6 tok/s, DeepSeek-R1-Distill-Qwen-14B-4bit 10.8 tok/s가 있으므로, Qwen3-14B도 MLX 10~12 tok/s 범위로 추정하는 것이 가장 보수적입니다. GGUF Q4_K_M 실측은 5.8 tok/s입니다. citeturn31view2turn31view3turn30view0turn39view0
실전에서는 일반 문서 작업, 다국어, 코드 보조, 도구 사용을 한 모델로 처리하고 싶을 때 가장 균형이 좋습니다. 설치는 쉽지만, transformers<4.51.0에서는 **KeyError: 'qwen3'**가 날 수 있으므로 최신 transformers를 써야 합니다. citeturn43view0
Phi-4는 코드와 수학, 구조화된 출력에 강한 14B급 선택지입니다. Ollama는 Phi-4를 14B parameter로 소개하고, 모델 카드는 MLX·Transformers·vLLM·SGLang·Docker Model Runner 사용 예시를 제공합니다. M5 32GB 실측은 MLX 11.6 tok/s, GGUF 5.3 tok/s, peak RSS 8.56~8.90GB입니다. mac-llm-bench의 HumanEval+가 **82.3%**라서 실전 코드 보조에서도 꽤 강합니다. citeturn41search0turn16view3turn31view2turn30view0
이 모델을 Qwen3-14B보다 아래에 둔 이유는 범용성 때문입니다. Qwen3 쪽이 더 긴 공식 context, 더 넓은 다국어, thinking / non-thinking 전환, agentic 사용성을 제공하기 때문입니다. 반대로 사용 목적이 코드 생성, 수학 풀이, JSON 중심 에이전트 응답이라면 Phi-4를 Qwen3-14B보다 먼저 고르는 것이 합리적입니다. citeturn43view0turn44view0turn31view2
Qwen3-8B는 가장 빠른 기본 모델입니다. Qwen3 공식 블로그는 8B dense를 공개 계열에 포함하고, 128K context와 로컬 도구 지원을 제시합니다. MLX 4-bit 모델 크기는 4.61GB이고, M5 32GB 실측은 MLX 24 tok/s, GGUF 9.1 tok/s입니다. 품질은 Qwen 공식 설명상 Qwen2.5-14B dense급으로 보는 것이 맞습니다. citeturn44view0turn17view1turn31view0turn30view0
이 모델의 장점은 세 가지입니다. 첫째, 설치와 운용이 가장 단순합니다. 둘째, 브라우저·IDE·터미널을 동시에 열어 둔 상태에서도 부담이 적습니다. 셋째, 온디바이스 응답성이 좋습니다. 모델 하나만 깔아 두고 장기간 쓰려는 경우라면 상위 14B·24B 모델보다 이 모델이 더 만족스러울 가능성이 큽니다. citeturn31view0turn44view0
Mistral Small 3.1은 품질 자체는 상위권입니다. Mistral은 이 모델을 Apache-2.0, 128K context, 멀티모달, 32GB Mac에서 실행 가능이라고 밝힙니다. 이전 24B instruct 카드도 공개 벤치에서 MMLU-Pro 0.663, GPQA 0.453, HumanEval 0.848, MT-Bench 8.35 등 강한 결과를 제시합니다. MLX 4-bit 크기는 14.1GB이고 M5 32GB 실측은 MLX 6.9 tok/s, GGUF 3.6 tok/s입니다. citeturn40view1turn40view0turn17view5turn30view0
순위를 낮춘 이유는 단 하나입니다. 에어형 섀시에서 느립니다. 품질이 높고 Apache-2.0이라 매력적이지만, 반응성은 분명히 떨어집니다. 이미지 입력까지 필요하거나, 128K 긴 문맥과 범용 assistant 성능을 같이 원하면 가치가 있습니다. 그렇지 않으면 Qwen3-30B-A3B나 Qwen3-14B가 더 낫습니다. citeturn40view1turn30view0
DeepSeek-R1-Distill-Qwen-14B는 추론 문제 전용으로 매우 강한 카드입니다. 공식 카드에서 AIME 2024 69.7, MATH-500 93.9, GPQA 59.1, LiveCodeBench 53.1, Codeforces 1481를 보여 주며, 라이선스는 MIT입니다. MLX 4-bit 크기는 8.31GB, M5 32GB 실측은 MLX 10.8 tok/s, GGUF 5.6 tok/s입니다. citeturn45view0turn17view3turn31view3turn30view0
하지만 이 모델은 “켜 놓고 편하게 쓰는 기본 모델”이 아닙니다. DeepSeek는 공식적으로 temperature 0.5~0.7, system prompt 회피, 수학문제에 step-by-step 지시, 때로는 <think>\n 강제를 권장합니다. 즉, 잘 쓰면 강하지만 운영 안정성은 더 손이 갑니다. 연구·수학·알고리즘 풀이용 보조 모델로는 좋고, 일반 대화·문서 작업 기본값으로는 비효율적입니다. citeturn45view0
런타임 선택은 아래처럼 정리하면 됩니다. 가장 쉽고 무난하면 Ollama, 속도를 더 뽑고 싶으면 MLX, 세밀한 제어와 GGUF 생태계가 필요하면 llama.cpp, OpenAI 호환 서버와 배치 처리를 macOS에서 하고 싶으면 vLLM-metal입니다. MLX는 Apple Silicon 전용 최적화 프레임워크이고, llama.cpp는 Apple Silicon을 Metal/Accelerate/NEON으로 최적화합니다. vLLM-metal은 arm64 Python 전용이며 Rosetta를 허용하지 않습니다. citeturn39view0turn32view0turn32view2
flowchart TD
A[목표] --> B{가장 쉬운 설치}
B -->|예| C[Ollama]
B -->|아니오| D{최고 속도 우선}
D -->|예| E[MLX / mlx-lm]
D -->|아니오| F{GGUF 세밀 제어 필요}
F -->|예| G[llama.cpp]
F -->|아니오| H{OpenAI 호환 서버/배치}
H -->|예| I[vLLM-metal]
H -->|아니오| J[Transformers + MPS]
실행 전 공통 권장값은 이렇습니다.
메모리 32GB Air에서는 4-bit 우선, context는 기본 8K 또는 16K부터 시작, thinking/reasoning 모델은 필요할 때만 켜기, 장시간 세션에서는 Ollama보다 MLX가 대개 더 빠름, Transformers+MPS는 검증용 정도가 맞습니다. Apple은 PyTorch MPS를 beta로 설명하고, bitsandbytes의 Apple Silicon 다중 백엔드는 아직 preview/alpha 수준입니다. 반면 MLX-LM은 quantized model fine-tuning까지 직접 지원합니다. citeturn32view4turn34search1turn34search3turn35search2
일반 사용자 기본값은 Ollama + Qwen3-30B-A3B입니다. Qwen은 로컬 사용 시 Ollama를 직접 권장하고, 쉬운 명령은 ollama run qwen3:30b-a3b입니다. 생각 모드가 과하면 프롬프트에 /no_think를 붙이는 방식이 좋습니다. citeturn44view0
# Ollama 설치 후
ollama run qwen3:30b-a3b빠른 기본값은 MLX + Qwen3-8B-4bit입니다. MLX-LM은 pip install mlx-lm 또는 uv tool install mlx-lm으로 설치하고, MLX Community 모델은 바로 불러올 수 있습니다. Qwen3-8B-4bit는 M5 32GB에서 24 tok/s 실측이 있어서 체감상 가장 시원합니다. citeturn32view3turn16view1turn31view0
uv tool install mlx-lm
mlx_lm.chat --model "mlx-community/Qwen3-8B-4bit"dense 상한선 기본값은 MLX + Qwen3-14B-4bit입니다. Qwen 공식 카드와 MLX Community 변환 카드 모두 MLX 사용 예시를 제공합니다. 이 조합은 속도-품질 균형이 가장 좋습니다. citeturn43view0turn16view0
uv tool install mlx-lm
mlx_lm.chat --model "mlx-community/Qwen3-14B-4bit"코드/수학 우선이면 MLX + phi-4-4bit가 좋습니다. 공식 MLX 카드가 바로 서버/채팅 예시를 제공합니다. citeturn16view3
uv tool install mlx-lm
mlx_lm.chat --model "mlx-community/phi-4-4bit"Mistral Small 3.1 24B는 느리지만 Apache-2.0, 128K, 멀티모달이 필요할 때 선택합니다. 공식 MLX 변환 모델이 있고, Mistral은 32GB Mac 실행 가능성을 직접 밝힙니다. citeturn16view2turn40view1
pip install -U mlx-vlm
python -m mlx_vlm.generate \
--model mlx-community/Mistral-Small-3.1-24B-Instruct-2503-4bit \
--max-tokens 128 \
--temperature 0.2 \
--prompt "이 문단의 핵심 주장 3개를 한국어로 정리해줘."DeepSeek-R1-Distill-Qwen-14B는 reasoning 특화 세팅이 필요합니다. 공식 권장대로 temperature 0.6, system prompt 없이, 필요하면 <think>\n 시작을 강제하는 편이 낫습니다. citeturn45view0
uv tool install mlx-lm
mlx_lm.chat --model "mlx-community/DeepSeek-R1-Distill-Qwen-14B-4bit"llama.cpp는 macOS에서 brew 설치, GGUF 직접 실행, OpenAI 호환 API 서버까지 가장 간단합니다. Apple Silicon을 NEON·Accelerate·Metal로 최적화한다고 명시합니다. 4/5/6/8-bit까지 광범위한 정수 양자화를 지원합니다. citeturn32view0
brew install llama.cpp
llama-cli -m ./model.gguf
# 또는
llama-server -m ./model.ggufvLLM-metal은 이제 macOS Apple Silicon에서 설치 가능하지만, native arm64 Python 3.12 필수, Rosetta/x86_64 Python 불가, Xcode Command Line Tools 필요입니다. 즉, “되긴 되지만 쉬운 길은 아니다”가 정확한 평가입니다. citeturn32view2
curl -fsSL https://raw.githubusercontent.com/vllm-project/vllm-metal/main/install.sh | bash
source ~/.venv-vllm-metal/bin/activate
vllm serve "Qwen/Qwen3-14B"체감 성능은 모델마다 다릅니다. 아래는 M5 Air 32GB 기준 권장 조합과 현실적 기대치입니다. tok/s는 가능한 범위에서 실측을 썼고, reasoning 모델은 출력 길이 증가 때문에 완료 시간은 더 길어진다는 점을 반영했습니다. citeturn30view0turn31view0turn31view2turn31view3turn45view0
| 용도 | 추천 모델 | 예시 프롬프트 | 기대 처리량 |
|---|---|---|---|
| 빠른 일반 대화 | Qwen3-8B-4bit MLX | 아래 메일을 5문장으로 요약하고 실행 항목 3개를 뽑아줘. |
약 24 tok/s citeturn31view0 |
| 범용 최고 균형 | Qwen3-30B-A3B GGUF | 이 PR diff를 읽고 버그 가능성과 테스트 누락을 찾아줘. /no_think |
약 23.1 tok/s citeturn30view0 |
| 코드 보조 | Phi-4-4bit MLX | 이 TypeScript 함수의 타입 오류를 수정하고 diff만 보여줘. |
약 11.6 tok/s citeturn31view2 |
| 추론 문제 | DeepSeek-R1-DQ14B MLX | 다음 점화식을 단계별로 풀고 마지막 답만 boxed로 정리해줘. |
약 10.8 tok/s, 그러나 reasoning 출력이 길어 체감 완성 시간은 더 김 citeturn31view3turn45view0 |
| 긴 문맥 / 이미지 포함 | Mistral Small 3.1 24B MLX | 이 이미지와 설명을 함께 읽고 검수 포인트를 정리해줘. |
약 6.9 tok/s citeturn31view3 |
| dense 상한선 | Qwen3-14B-4bit MLX | 이 설계 문서를 읽고 대체 아키텍처 2개를 제안해줘. |
약 10~12 tok/s 추정, GGUF는 5.8 tok/s 실측 citeturn30view0turn39view0turn31view2turn31view3 |
Qwen3는 transformers가 너무 낮으면 **KeyError: 'qwen3'**가 날 수 있으므로, 공식 카드가 말하듯 **최신 transformers**를 쓰는 것이 안전합니다. citeturn43view0
vLLM-metal은 Rosetta/x86_64 Python이 아예 불가합니다. python3 -c "import platform; print(platform.machine())" 결과가 arm64인지 먼저 확인해야 합니다. Rosetta 환경이면 설치 자체를 다시 해야 합니다. citeturn32view2
Transformers + PyTorch MPS는 실행은 되지만, Apple도 MPS backend를 아직 beta로 설명합니다. 32GB Air에서 “항상 되는 경로”가 필요하면 MLX나 Ollama가 더 낫습니다. citeturn32view4
bitsandbytes 기반 4/8-bit와 전형적인 Hugging Face QLoRA 워크플로는 macOS Apple Silicon에서 아직 주력 경로가 아닙니다. 최신 bitsandbytes 문서는 multi-backend alpha / preview와 Apple Silicon 지원 계획을 언급합니다. 반대로 MLX-LM은 quantized model fine-tuning을 공식 기능으로 제공합니다. 따라서 맥에서는 QLoRA류 작업도 사실상 MLX 쪽이 현실적입니다. citeturn34search1turn34search3turn35search2
이번 조사에서 M5 Air 32GB 실측이 직접 확보된 모델은 충분히 많았지만, 모든 후보의 모든 런타임 조합이 있는 것은 아니었습니다. 특히 Qwen3-14B MLX 4-bit의 절대 tok/s는 Apple이 메모리만 공개했고, 이번에 확보한 커뮤니티 M5 base 표에는 직접 값이 없어서 유사 14B 모델의 M5 실측으로 추정했습니다. 그 점만 불확실성이 남습니다. citeturn39view0turn30view0turn31view2turn31view3
최종 추천은 다음처럼 정리됩니다.
**하나만 고르면 Qwen3-30B-A3B**입니다. 32GB M5 Air에서 품질 대비 속도가 가장 좋습니다. citeturn44view0turn30view0
**dense 계열 하나만 고르면 Qwen3-14B-4bit**입니다. 범용성, 라이선스, 로컬 생태계, 메모리 여유가 가장 균형적입니다. citeturn43view0turn39view0
**가장 빠른 기본값은 Qwen3-8B-4bit**입니다. 일상적인 로컬 어시스턴트로 가장 편합니다. citeturn31view0turn44view0
**코드 작업 비중이 높으면 Phi-4-4bit**가 좋습니다. citeturn31view2turn22search1
긴 문맥·멀티모달이 필요하면 Mistral Small 3.1 24B, **수학·추론 문제 전용 서브 모델이 필요하면 DeepSeek-R1-Distill-Qwen-14B**를 추가로 두면 됩니다. citeturn40view1turn45view0