[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 6/14화: LLM 게이트웨이 구축 — 모델 라우팅과 폴백 설계
Qwen3-8B 라우터로 요청을 분류하고, LiteLLM 게이트웨이로 Mac Studio MLX·CUDA vLLM 백엔드를 통합하는 하이브리드 추론 파이프라인 설계 가이드
[opencode 12일 집중 — 터미널 네이티브 AI 코딩 에이전트 완전 정복] 4/12화: opencode TUI 단축키 완전 정복 — 키보드만으로 코딩하기
opencode TUI의 Leader 키(Ctrl+X) 단축키 체계, 파일 멘션(@), 테마·키바인드 커스터마이징까지. 마우스 없이 키보드만으로 AI 코딩 워크플로우를 완결하는 방법을 치트시트와 실습으로 정리합니다.
GitHub CLI(gh) 사용법 총정리 — 터미널 실전 가이드
GitHub CLI(gh)를 활용해 터미널에서 PR 생성, 이슈 관리, Actions 모니터링, API 호출, 자동화 스크립트까지 처리하는 명령어를 총정리합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 5/14화: vLLM으로 Qwen3 서빙 — FP8·텐서 병렬 실전 구축
vLLM의 PagedAttention과 Continuous Batching으로 Qwen3-30B-A3B를 듀얼 RTX 4090에서 고처리량 서빙하는 실전 구축 가이드. FP8 양자화, 텐서 병렬, KV 캐시 튜닝, Xid 장애 대응까지 다룹니다.
[opencode 12일 집중 — 터미널 네이티브 AI 코딩 에이전트 완전 정복] 3/12화: opencode BYOK 설정 — 75개 프로바이더, 최적 모델 고르기
opencode BYOK로 Anthropic·OpenAI·Google·Bedrock 등 75개 프로바이더를 자유롭게 연결하는 법. API 키 vs OAuth 비교, 모델별 비용 시뮬레이션, 실무 추천 조합까지 한번에 정리합니다.
AI 에이전트 워크플로우 설계 패턴, 실전 자동화 구축법
AI 에이전트가 복잡한 작업을 안정적으로 처리하려면 워크플로우 설계가 핵심입니다. 순차·병렬·분기·반복·사람 개입 등 5가지 핵심 패턴과 LangGraph, CrewAI 등 프레임워크 실전 구현 전략을…
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 4/14화: mlx-lm으로 Qwen3 서빙 — Mac Studio 실전 가이드
mlx-lm으로 Mac Studio에 Qwen3를 서빙하는 전 과정을 다룹니다. 메모리 계산, OpenAI 호환 서버, 벤치마크, 프로덕션 래퍼까지 완전 실전 가이드.
jq 사용법 총정리 — JSON 파싱부터 변환까지 실전 가이드
jq 명령어의 설치부터 기본 문법, 배열·객체 변환, 실무 레시피 7가지, 고급 기법, 대안 도구(gojq·jaq·fx·yq) 비교까지 한 번에 정리하는 JSON 처리 완전 가이드입니다.
RAG 하이브리드 검색, 키워드와 벡터를 결합하는 법
RAG에서 키워드 검색(BM25)과 벡터 검색을 결합하는 하이브리드 검색의 원리, 스코어 융합 전략(RRF·가중합산), 구현 방법, 한국어 최적화 팁까지 실전 중심으로 안내합니다.
[온프레미스 AI Assistant 아키텍처 — Qwen3·Qwen3-VL 14일 설계] 3/14화: Mac Studio MLX vs CUDA vLLM, Qwen3 서빙 전략
Qwen3 서빙을 위한 Mac Studio(MLX)와 NVIDIA CUDA(vLLM) 비교. 메모리 대역폭·동시성·양자화 강약점을 7가지 축으로 분석하고, 모델 크기별 최적 하드웨어 매핑과 하이브리드 전략을 제시합니다.