최근 포스트

자가 개선 에이전트 루프 설계: 5단계 아키텍처와 리워드 해킹 방어

llm

13 분 소요

자가 개선(self-improving) 루프는 사람 라벨 없이 프로덕션 트레이스를 학습 신호로 되돌리는 구조다. 롤아웃·스코어·필터·트레인·디플로이의 5단계 아키텍처, 복합 리워드 설계, PII·동의 게이트, 리워드 해킹 탐지와 방어, 조직 차원의 도입 판단 기준을 운영자 시점에서...

MCP 토큰 최적화 4가지 기법: 점진적 발견부터 코드 실행 호출까지

llm

10 분 소요

MCP 서버를 늘릴수록 사용자 입력 없이 소비되는 도구 정의 토큰이 컨텍스트를 잠식한다. 업프론트 로딩 비용을 정량화하고, 점진적 발견·툴 압축 프록시·코드 실행형 호출·프롬프트 캐시 정합성이라는 네 가지 기법을 게이트웨이 레벨 통합과 토큰 예산 관리 관점에서 재구성한다.

부하 테스트로 검증하는 오토스케일링: Azure Load Testing과 p95 SLO

azure

9 분 소요

2편에서 정한 concurrentRequests 10이라는 값이 실제로 맞는지, Azure Load Testing으로 사설망 내부에 부하를 넣어 검증한다. 스케일 임계값 도달과 maxReplicas 도달이라는 두 변곡점을 p95 지연 곡선으로 읽고, 수용량과 병목을 도출하는 과정을...

추론 라우팅과 요청 캐스케이딩: 2-Tier 게이트웨이와 시맨틱 캐싱

llm

16 분 소요

모든 요청을 같은 모델로 보내면 비용은 선형으로 늘고 지연은 최악값에 맞춰진다. 2-Tier 게이트웨이(L1 Ingress / L2 LLM API Gateway) 구조, 게이트웨이 솔루션 비교, 난이도 기반 요청 캐스케이딩, 시맨틱 캐싱, 그리고 라우팅 품질을 어떻게 관측하는지까지...

커스텀 모델 서빙 파이프라인: LoRA 학습부터 평가·롤아웃까지

llm

12 분 소요

오픈 웨이트 모델을 직접 서빙하려면 데이터 수집, QLoRA 학습, 평가 게이트, Multi-LoRA 배포, 카나리 승격, 롤백까지 하나의 루프로 묶어야 한다. 모델·GPU·배포 모드 선택 기준, S3→NVMe 캐시, PP 멀티노드 교착 같은 실패 사례, 평가 임계값·레지스트리 운...