RAG 시스템에서 사용자가 어떤 경험을 하는지. 만족도 스코어(1~5)와 함께 표현.
💡 핵심 개념: 시스템 아키텍처가 아무리 좋아도 사용자가 답을 못 얻으면 실패. "답 정확도"만 보지 말고 "답까지 걸리는 시간", "출처 표시", "재질문 흐름" 같은 UX 지표도 봐야 함.
journey
title RAG 시스템 사용자 여정
section 문제 인식
정보 부족 인식: 3: User
시스템 접속: 5: User
section 검색 시도
질문 입력: 5: User, System
벡터 검색 실행: 4: System
관련 문서 추출: 4: System
section 답변 생성
컨텍스트 구성: 3: System
LLM 응답 생성: 5: System
출처 인용 표시: 4: System
section 검증
답변 확인: 4: User
후속 질문: 3: User
만족/피드백: 4: User
🔧 단계별 UX metric
- 첫 토큰 latency — 첫 글자까지 1초 이내 권장 (LLM streaming)
- 답변 정확도 — 사용자 평가 4점 이상 비율 목표
- 출처 신뢰도 — 인용된 chunk의 relevance 평균 점수
- 재질문 비율 — 첫 답변에 만족 못한 비율. 낮을수록 좋음
- Hallucination rate — 답변 중 근거 없는 문장 비율
📋 만족 여정 vs 좌절 여정 비교:
| 시나리오 | 만족 여정 | 좌절 여정 |
| 질문 입력 | 자동완성, 예시 질문 | 빈 입력란, "뭘 물어봐야 할지" 모름 |
| 응답 | 2초 내 streaming + 출처 | 10초 대기 + 출처 없음 |
| 후속 | "더 자세히", "예시 보여줘" 버튼 | 새 질문 처음부터 다시 |
| 피드백 | 👍/👎 1클릭 + 코멘트 | 피드백 없음, 개선 불가 |
⚠️ 흔한 함정:
- "답 정확도"만 KPI로 — 빠르지만 틀린 답이면 사용자 이탈. latency도 KPI
- 출처 표시 안 함 — hallucination 검증 불가. "이 답의 근거: [chunk N]" 표시
- 재질문 흐름 없음 — "다음 중 어떤 게 의도?" 같은 disambiguation 질문 UX 안 넣음
- 피드백 수집 안 함 — 개선 사이클 막힘. 👍/👎 + 로그 연결 필수
🛠️ UX 도구: Streamlit/Gradio(프로토타입), Next.js + Vercel AI SDK(프로덕션), LangSmith(trace/feedback 수집).