[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 11/14화: LLM 메모리 아키텍처 실전 — 단기·장기·세션 기억 설계
Qwen3 기반 온프레미스 AI Assistant의 단기·세션·장기 3계층 메모리 아키텍처를 설계합니다. 슬라이딩 윈도우, 사실 추출, 벡터 검색 인출, PII 마스킹까지 실전 코드와 스키마 포함.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 6/14화: LLM 게이트웨이 구축 — 모델 라우팅과 폴백 설계
Qwen3-8B 라우터로 요청을 분류하고, LiteLLM 게이트웨이로 Mac Studio MLX·CUDA vLLM 백엔드를 통합하는 하이브리드 추론 파이프라인 설계 가이드
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 1/14화: 온프레미스 AI 자체 호스팅, Qwen3을 선택한 6가지 이유
온프레미스 AI 자체 호스팅의 데이터 주권·비용·지연 이점과, Qwen3를 기준 모델로 선정한 6가지 이유를 정리합니다. 14일 연재의 전체 아키텍처 레이어 지도를 공개합니다.