인공지능CanvasDevs Team업데이트됨

RAG 애플리케이션에서 근거 없는 답변 줄이기

검색 품질, 문서 권한, 증거, 평가가 어떻게 근거 없는 답변을 줄일 수 있는지, 그리고 지식 어시스턴트가 여전히 한계를 필요로 하는 지점은 어디인지 알아봅니다.

RAG 애플리케이션에서 근거 없는 답변 줄이기

검색은 도움이 되지만, 정확한 답변을 보장하지는 않습니다

검색 증강 생성(RAG)은 언어 모델이 답변하기 전에 선택된 문서를 모델에 공급합니다. 이는 답변을 비즈니스의 정보에 더 관련성 있게 만들 수 있지만, 시스템은 여전히 잘못된 구절을 검색하거나, 예외를 놓치거나, 출처가 뒷받침하지 않는 주장을 생성할 수 있습니다.

정의된 작업으로 시작하세요: 예를 들어, 지원 직원이 현재 반품 정책을 찾도록 돕는 것입니다. 어떤 출처가 권위 있는지, 누가 이를 관리하는지, 답변이 언제 사람의 검토를 필요로 하는지 결정하세요. “우리 문서를 사용하라”는 일반적인 지시는 인수 기준이 아닙니다.

사용 가능한 증거를 준비하고 검색하세요

문서를 구절로 나눌 때 제목, 문서 신원, 버전, 출처 링크를 보존하세요. 예외는 그것이 한정하는 규칙과 함께 유지하세요. 하나의 방법이나 고정된 청크 크기가 항상 최선이라고 가정하는 대신, 대표적인 질문들에 대해 키워드, 벡터, 결합된 검색을 비교하세요. 필요한 증거가 검색 결과에 나타나는지를, 최종 응답이 그것을 정확하게 사용하는지와 별개로 테스트하세요. 다음을 참조하세요: Microsoft의 RAG 아키텍처 개요.

텍스트가 모델에 도달하기 전에 권한을 적용하세요

인증된 사용자의 테넌트 및 문서 권한을 사용하여 검색을 제한하세요. 기밀 자료를 숨기라고 모델에 지시하는 프롬프트는 권한 부여 경계가 아닙니다. 출처 링크, 생성된 요약, 대화 기록, 캐시된 답변에도 접근 확인이 필요합니다. 권한 변경과 문서 삭제는 인덱스와 파생된 모든 저장소에 전파되어야 합니다.

구현 예시는 Azure AI Search가 쿼리 시점 권한 필터링을 문서화합니다. 플랫폼별 기능과 프리뷰 제한 사항은 의도된 배포에 대해 확인이 필요합니다.

근거 없는 질문을 명시적인 결과로 만드세요

중대한 주장의 근거가 되는 구절을 보여주고 사용자가 이를 검토할 수 있게 하세요. 인용은 실제로 답변을 뒷받침할 때만 유용합니다. 출처가 누락되었거나, 모순되거나, 오래되었다면, 무엇을 확립할 수 없었는지 말하고 관련 검색 결과나 인계를 제공하세요. 약한 검색 점수를 꾸며낸 신뢰도 백분율로 바꾸지 마세요.

예시: 어떤 정책이 개봉하지 않은 품목은 30일 이내에 반품할 수 있다고 하지만 국제 반품 우편 요금에 대해서는 아무 언급이 없습니다. “해외 우편 요금을 환급해 주시나요?”라는 질문에 대해, 적절한 답변은 그 누락된 정보를 식별하고 정책이나 지원 팀을 안내합니다. 30일 규칙을 반복하는 것은 질문에 대한 답이 아닙니다.

전체 동작을 평가하세요

  • 답변 가능한, 모호한, 오래된, 그리고 의도적으로 근거 없는 질문들을 포함하세요.
  • 각 사례에 대해 예상되는 증거, 허용된 사용자 역할, 수용 가능한 답변 또는 답변 유보를 기록하세요.
  • 검색 적용 범위, 개별 주장에 대한 근거, 인용 정확성, 권한 유출, 지연 시간과 비용을 각각 따로 확인하세요.
  • 문서, 검색 설정, 프롬프트 또는 모델을 변경한 후 세트를 반복하세요. 불필요한 개인 데이터를 제거한 뒤 실제 실패 사례를 추가하세요.

이것은 제안된 평가 방식이며, 과거 클라이언트 데이터셋에 대한 주장이 아닙니다. 유한한 테스트 세트로는 향후 답변이 항상 정확할 것임을 증명할 수 없습니다. 영향이 큰 작업에는 워크플로에 적합한 추가 통제, 승인 또는 사람의 검토가 필요합니다.

살펴보기 LLM 통합 은 애플리케이션 내부의 AI 기능을 위한 것이며, 또는 워크플로 자동화 는 작업이 여러 시스템에 걸쳐 있을 때 적합합니다. 개발 도구 환경과 배포된 제품의 데이터 흐름은 별개의 결정입니다.

관련 서비스

비슷한 작업을 진행 중이신가요? 이러한 종류의 작업을 뒷받침하는 서비스들입니다.