[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 4/14화: mlx-lm으로 Qwen3 서빙 — Mac Studio 실전 가이드
mlx-lm으로 Mac Studio에 Qwen3를 서빙하는 전 과정을 다룹니다. 메모리 계산, OpenAI 호환 서버, 벤치마크, 프로덕션 래퍼까지 완전 실전 가이드.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 3/14화: Mac Studio MLX vs CUDA vLLM, Qwen3 서빙 전략
Qwen3 서빙을 위한 Mac Studio(MLX)와 NVIDIA CUDA(vLLM) 비교. 메모리 대역폭·동시성·양자화 강약점을 7가지 축으로 분석하고, 모델 크기별 최적 하드웨어 매핑과 하이브리드 전략을 제시합니다.