2026년 8월 26일 수요일

RAG 실전 ⑪ (완결) — 운영: 모든 계층에 캐시를, 모든 스팬에 트레이스를

마지막 편은 서비스로 돌리는 이야기다 — 비용, 지연, 보안, 그리고 출시 후에 시스템을 계속 좋게 만드는 피드백 루프.

비용 — 3겹 캐시와 실측 감각

프롬프트 캐시(Anthropic·OpenAI 공통 구조: 읽기 0.1×) — 고정 시스템 프롬프트+재사용 문서를 breakpoint 앞에, 질문을 뒤에. 5분 TTL이면 요청 2회에 손익분기. 함정: 프리픽스 1바이트만 바뀌어도 이후 전부 무효(시스템 프롬프트에 datetime.now() 금지). ② 시맨틱 캐시(Redis LangCache류) — FAQ성 반복 질문에서 적중률 ~70%, 단 임계값 느슨하면 "비슷하지만 다른 질문"에 오답 캐시 반환 — cosine 0.92+와 TTL을 평가셋으로 검증. ③ 인제스천 해시 캐시(⑨편). 1M 문서 코퍼스의 실측 감각: 임베딩 ~$60은 오차 수준, 진짜 비용은 파싱($0.01/페이지×페이지 수), 벡터 DB 상시 운영비, 쿼리당 LLM 호출(캐시 적용 시 ~$0.001~0.004/쿼리). 저빈도 코퍼스는 S3 Vectors류로 내리고 핫셋만 고성능 DB에 두는 티어링으로 저장 최대 90% 절감.

지연과 관측 — 스테이지별 p95

실무 목표치: 임베딩+벡터검색 <100ms, 리랭킹 <200ms, LLM TTFT <1.5s, 전체 <5s. Langfuse(오픈소스, 셀프호스팅 가능 — 국내 규제 환경에서 선택 기준) 트레이싱이 있어야 "느린 건 검색인가 생성인가"를 즉답하고 $/query를 상시 감시할 수 있다. 프레임워크는 LangChain 1.0(2025-10, 2.0까지 무파괴 약속)으로 "안정판" 국면 — 단 서빙 코어(retrieve→프롬프트 조립→LLM 콜)는 얇게 직접 소유하는 절충이 주류다(Anthropic의 Building Effective Agents 논거).

보안 — 두 축

검색 단계 ACL 강제(⑨편의 시큐리티 트리밍) — RAG 보안 사고 1순위는 LLM 유출이 아니라 검색이 권한 밖 문서를 컨텍스트에 넣는 것. ② 검색 문서를 신뢰하지 않는 설계 — 검색된 문서는 lethal trifecta의 "신뢰할 수 없는 콘텐츠"다: 답변 에이전트에 이메일 발송·외부 HTTP 도구를 주지 말고, 문서는 항상 데이터로 감싸고 출처를 인용으로 표시. 한국 맥락: 사내 문서엔 개인정보가 섞인다 — 인제스천에 PII 마스킹 단계(마스킹 후 임베딩), 벡터 DB도 개인정보처리시스템으로 취급, 삭제 요청 시 파생 벡터·캐시까지 지우는 경로. 2026-08-20 개인정보 보호법 AI 특례 통과로 법적 근거는 생겼지만 안전조치 의무는 명문화 방향. 한국 스택은 Upstage(파싱+Solar Pro 4, 국내 리전·SOC2)와 HyperCLOVA X(SEED 오픈웨이트 자체 서빙 = 소버린 요건).

피드백 루프 — 출시 후가 진짜 시작

  • 1일차부터: 모든 트레이스에 thumbs 점수(1/0)와 암묵 신호(복사, 재생성, 인용 클릭)를 기록 — 캡처 안 한 것은 채굴할 수 없다.
  • 주간 트리아지: 실패 트레이스를 사람이 리뷰해 실패 모드 클러스터링 — 보통 상위 3개 모드가 문제의 60%+(Hamel Husain의 현장 가이드).
  • 리랭커 파인튜닝이 가장 싼 큰 승리 — HF 실측: 도메인 쌍 ~10만 개 + hard negative 마이닝 + RTX 3090 한 장 30분으로 NDCG@10 59.1→77.1(+18점), 4배 큰 공개 리랭커들을 이겼다. 단 클릭 데이터로 학습하기 전에 위치 편향 보정(IPS) 필수 — 아니면 자기확증 루프가 된다.
  • 한국 실전기스캐터랩 제타: "답변 재생성" 로그를 DPO 쌍으로 채굴 — 노이즈 코호트를 걸러내자 주간 사용시간 +8.1%. 교훈: 루프의 가치는 신호 정의에서 결정된다.

시리즈를 마치며

열한 편을 한 문장으로: RAG의 성패는 모델이 아니라 파이프라인의 위생이다 — 파서가 천장을 정하고, 토크나이저·하이브리드·리랭커가 실패의 3분의 2를 지우고, 색인은 늙지 않게 관리하고, 캐시·트레이스·ACL 위에서 피드백 루프를 돌리는 것. 평가는 LLM 평가 방법론 시리즈 ⑨편과 함께 읽으시길.

— RAG 실전 시리즈 ⑪ (완결)

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

에이전트 설계 ⑪ (완결) — 프레임워크와 2026 스택: 제어 흐름의 소유권만은 넘기지 마라

마지막 편. 프레임워크 전쟁은 사실상 수렴했다 — 모든 메이저 벤더가 공식 SDK를 냈고 원시 개념(도구 루프·subagent/handoff·체크포인팅·MCP)도 동일해졌다. 차별화 전선은 루프가 아니라 하네스 품질과 내구성(durability) 으로...