[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 3/14화: Mac Studio MLX vs CUDA vLLM, Qwen3 서빙 전략
Qwen3 서빙을 위한 Mac Studio(MLX)와 NVIDIA CUDA(vLLM) 비교. 메모리 대역폭·동시성·양자화 강약점을 7가지 축으로 분석하고, 모델 크기별 최적 하드웨어 매핑과 하이브리드 전략을 제시합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 2/14화: Qwen3 아키텍처 해부 — Dense·MoE·양자화 변형 결정 가이드
Qwen3 Dense·MoE 아키텍처 차이, Instruct·Thinking 모드 토글 전략, 8B~235B 사이즈별 용도 매핑, FP8·AWQ·GGUF·MLX 양자화 비교, 변형 결정 트리를 다룹니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 1/14화: 온프레미스 AI 자체 호스팅, Qwen3을 선택한 6가지 이유
온프레미스 AI 자체 호스팅의 데이터 주권·비용·지연 이점과, Qwen3를 기준 모델로 선정한 6가지 이유를 정리합니다. 14일 연재의 전체 아키텍처 레이어 지도를 공개합니다.