[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 11/14화: LLM 메모리 아키텍처 실전 — 단기·장기·세션 기억 설계
Qwen3 기반 온프레미스 AI Assistant의 단기·세션·장기 3계층 메모리 아키텍처를 설계합니다. 슬라이딩 윈도우, 사실 추출, 벡터 검색 인출, PII 마스킹까지 실전 코드와 스키마 포함.
[opencode 12일 집중 — 터미널 네이티브 AI 코딩 에이전트 완전 정복] 7/12화: AGENTS.md 완전 가이드 — opencode 프로젝트 메모리 설계법
AGENTS.md로 opencode에 프로젝트 맥락을 주입하는 방법. /init 자동 생성, 모범 템플릿, /compact 컨텍스트 압축, git 커밋으로 팀 공유까지 실전 가이드.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 10/14화: Graph RAG·멀티모달 RAG 실전 — 고급 검색 아키텍처
단순 벡터 검색의 한계를 넘는 고급 RAG 기법 — 쿼리 재작성, 메타데이터 필터링, Graph RAG, 멀티홉, Qwen3-VL 멀티모달 RAG를 온프레미스 Qdrant·Neo4j 위에서 구축합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 9/14화: 온프레미스 RAG 파이프라인 — bge-m3·Qdrant 자체 호스팅 실전
bge-m3 임베딩, Qdrant 자체 호스팅, RRF 하이브리드 검색, 리랭킹까지 — 외부 API 없이 온프레미스에서 완성하는 Qwen3 RAG 파이프라인 전체 구축 가이드입니다.
[opencode 12일 집중 — 터미널 네이티브 AI 코딩 에이전트 완전 정복] 6/12화: opencode 내장 툴 완전 가이드 — 파일·셸·검색·LSP 실전 활용
opencode의 내장 툴 — 파일(read/write/edit/patch), 셸(!command), 검색(grep/glob), LSP(정의·참조) — 을 실전 예제로 익히고, 도구 조합 패턴까지 정리합니다.
tmux 사용법 총정리 — 터미널 멀티플렉서 실전 가이드
터미널 멀티플렉서 tmux의 설치, 세션·윈도우·페인 관리 명령어, .tmux.conf 커스터마이징, 실전 활용 시나리오, 필수 플러그인까지 한 편에 총정리하는 실전 가이드입니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 8/14화: Qwen3 프롬프트·컨텍스트 아키텍처 실전 설계
Qwen3 Chat Template 해부, 시스템 프롬프트 4계층 설계, 토큰 예산 관리, Thinking 모드 비용 제어, 프롬프트 Git 버전 관리까지 — 컨텍스트 윈도우를 자원으로 다루는 실전 파이프라인을 구현합니다.
[opencode 12일 집중 — 터미널 네이티브 AI 코딩 에이전트 완전 정복] 5/12화: opencode Plan 모드 완전 가이드 — 읽고 확인하고 고치는 안전 루틴
opencode의 Plan 모드와 Build 모드 구분법, Tab 토글 워크플로우, 미지 코드베이스 안전 탐색 전략을 실전 명령어와 함께 정리합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 7/14화: Qwen3-VL 서빙 실전 — 멀티모달 추론과 Visual Agent 통합 설계
Qwen3-VL 8B·30B-A3B를 vLLM으로 서빙하고, Visual Agent와 금융 문서 파이프라인을 통합하는 멀티모달 아키텍처를 설계합니다. KV 캐시 관리부터 감사 로그까지 실전 포인트를 다룹니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 6/14화: LLM 게이트웨이 구축 — 모델 라우팅과 폴백 설계
Qwen3-8B 라우터로 요청을 분류하고, LiteLLM 게이트웨이로 Mac Studio MLX·CUDA vLLM 백엔드를 통합하는 하이브리드 추론 파이프라인 설계 가이드