3) 품질 관리 및 테스트
품질은 네 층에서 검증한다. 검색 성능, 데이터, 코드, 그리고 에이전트의 응답이다.
검색 성능 평가
- Recall@5 91.5%: 질문-정답 쌍 평가셋을 만들어, 검색 상위 5개에 정답 자료가 포함되는 비율을 측정한다. 평가셋 제작은 Sprint 3~4에 진행하며, 업종·상권 유형을 고르게 덮도록 설계한다.
- Latency 40% 개선: Chunking 최적화 전후의 응답 시간을 같은 질문 세트로 비교 측정한다.
- 데모에는 평가셋 검증을 통과한 업종만 노출한다.
데이터 품질 검증
- 조인 검증: 서울시 상권 경계 좌표와 LOCALDATA 주소 체계가 실제로 연결되는지 착수 1주차에 확인한다.
- 시계열 연속성: 2019년부터 현재까지 끊김 없는 데이터인지 확인한다. 특이변수 분석의 전제 조건이다.
- 중복 제거: 정책자금 공고는 여러 사이트에 동시 게시되므로 공고명+기관+기간 기준으로 dedup을 검증한다.
- 알려진 노이즈의 관리: 편의점 가맹 양수도가 폐업으로 잡히는 노이즈, 필라테스·요가가 신고 체계 차이로 누락되는 문제, 노래방·당구장의 행정동 단위 표본 부족(자치구 단위 병행으로 대응) 같은 한계를 목록으로 관리하고 응답에 명시한다.
코드 품질
- 완료 기준(DoD): 코드 리뷰 승인 + 테스트 통과 + 문서 반영.
- 통합 테스트 시나리오는 Sprint 4에 작성·실행한다(담당: 김충식). 수집 → 지표 산출 → 검색 → 응답까지 흐름 전체를 관통하는 시나리오로 구성한다.
응답 품질 검증
에이전트 응답은 다음 규칙을 지키는지 검사한다.
- 모든 수치에 출처가 붙어 있는가
- 정형 지표(“확인된 사실”)와 뉴스 신호(“참고 신호”)의 등급이 구분되어 있는가
- 지원금 왜곡 보정이 반영되어 “코로나 때 폐업이 적었다”는 착시를 출력하지 않는가
- 차별적 출력 금지 규칙을 지키는가 (외국인 변수는 정합성 문맥으로만)
- 가정값(LTV 등)과 데이터 한계를 고지하는가