LLM 양자화 가이드 — 내 PC로 70B 모델 돌리기
LLM 양자화로 내 PC에서 70B 모델을 실행하는 방법을 정리했습니다. GGUF·GPTQ·AWQ 기법 비교, GPU별 모델 선택법, Ollama 실전 가이드까지 한 번에 안내합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 2/14화: Qwen3 아키텍처 해부 — Dense·MoE·양자화 변형 결정 가이드
Qwen3 Dense·MoE 아키텍처 차이, Instruct·Thinking 모드 토글 전략, 8B~235B 사이즈별 용도 매핑, FP8·AWQ·GGUF·MLX 양자화 비교, 변형 결정 트리를 다룹니다.