[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 11/14화: LLM 메모리 아키텍처 실전 — 단기·장기·세션 기억 설계
Qwen3 기반 온프레미스 AI Assistant의 단기·세션·장기 3계층 메모리 아키텍처를 설계합니다. 슬라이딩 윈도우, 사실 추출, 벡터 검색 인출, PII 마스킹까지 실전 코드와 스키마 포함.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 8/14화: Qwen3 프롬프트·컨텍스트 아키텍처 실전 설계
Qwen3 Chat Template 해부, 시스템 프롬프트 4계층 설계, 토큰 예산 관리, Thinking 모드 비용 제어, 프롬프트 Git 버전 관리까지 — 컨텍스트 윈도우를 자원으로 다루는 실전 파이프라인을 구현합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 7/14화: Qwen3-VL 서빙 실전 — 멀티모달 추론과 Visual Agent 통합 설계
Qwen3-VL 8B·30B-A3B를 vLLM으로 서빙하고, Visual Agent와 금융 문서 파이프라인을 통합하는 멀티모달 아키텍처를 설계합니다. KV 캐시 관리부터 감사 로그까지 실전 포인트를 다룹니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 6/14화: LLM 게이트웨이 구축 — 모델 라우팅과 폴백 설계
Qwen3-8B 라우터로 요청을 분류하고, LiteLLM 게이트웨이로 Mac Studio MLX·CUDA vLLM 백엔드를 통합하는 하이브리드 추론 파이프라인 설계 가이드
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 5/14화: vLLM으로 Qwen3 서빙 — FP8·텐서 병렬 실전 구축
vLLM의 PagedAttention과 Continuous Batching으로 Qwen3-30B-A3B를 듀얼 RTX 4090에서 고처리량 서빙하는 실전 구축 가이드. FP8 양자화, 텐서 병렬, KV 캐시 튜닝, Xid 장애 대응까지 다룹니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 4/14화: mlx-lm으로 Qwen3 서빙 — Mac Studio 실전 가이드
mlx-lm으로 Mac Studio에 Qwen3를 서빙하는 전 과정을 다룹니다. 메모리 계산, OpenAI 호환 서버, 벤치마크, 프로덕션 래퍼까지 완전 실전 가이드.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 3/14화: Mac Studio MLX vs CUDA vLLM, Qwen3 서빙 전략
Qwen3 서빙을 위한 Mac Studio(MLX)와 NVIDIA CUDA(vLLM) 비교. 메모리 대역폭·동시성·양자화 강약점을 7가지 축으로 분석하고, 모델 크기별 최적 하드웨어 매핑과 하이브리드 전략을 제시합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 2/14화: Qwen3 아키텍처 해부 — Dense·MoE·양자화 변형 결정 가이드
Qwen3 Dense·MoE 아키텍처 차이, Instruct·Thinking 모드 토글 전략, 8B~235B 사이즈별 용도 매핑, FP8·AWQ·GGUF·MLX 양자화 비교, 변형 결정 트리를 다룹니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 1/14화: 온프레미스 AI 자체 호스팅, Qwen3을 선택한 6가지 이유
온프레미스 AI 자체 호스팅의 데이터 주권·비용·지연 이점과, Qwen3를 기준 모델로 선정한 6가지 이유를 정리합니다. 14일 연재의 전체 아키텍처 레이어 지도를 공개합니다.
로컬 RAG 구축 가이드, 내 PC에서 프라이빗 AI 검색
클라우드 API 없이 내 PC에서 완전한 RAG 시스템을 구축하는 방법을 단계별로 안내합니다. 데이터 프라이버시를 지키면서도 강력한 AI 문서 검색을 구현해 보세요.