QA 및 릴리스 보증

AI 평가 및 테스트

제품을 감싸는 앱만이 아니라 제품 내부의 AI를 테스트하세요. 에이전트, 챗봇, LLM 기능에서 답변 품질, 근거, 권한, 실패 처리를 평가하고, 명확한 릴리스 기준을 설정합니다.

AI 평가가 필요한 대상

데모에서는 AI 기능이 좋아 보이지만, 실제 질문과 적대적 입력, 누락된 데이터 전반에서 어떻게 동작하는지, 또는 다음 모델이나 프롬프트 변경이 성능을 더 나쁘게 만드는지 아직 아무도 말할 수 없습니다.

  • 챗봇이나 어시스턴트를 고객 앞에 선보이려는 팀
  • 모델, 제공업체 또는 프롬프트를 변경하면서 전후 비교가 필요한 제품 책임자
  • 에이전트가 내부 기록을 읽거나 다른 시스템에서 작업을 트리거하도록 허용하는 기업

각 동작이 평가되는 방식

고객 대면 어시스턴트를 위한 예시 계획입니다. 방법은 귀사의 사용 사례와 위험에 따라 달라집니다.

자동화된 평가전문가 검토레드팀 테스트프로덕션 신호
답변 정확도주요 방법주요 방법여기서는 거의 사용하지 않음보조 또는 표본 추출
근거 제시 및 인용주요 방법보조 또는 표본 추출여기서는 거의 사용하지 않음보조 또는 표본 추출
권한 경계보조 또는 표본 추출주요 방법주요 방법보조 또는 표본 추출
프롬프트 주입보조 또는 표본 추출보조 또는 표본 추출주요 방법보조 또는 표본 추출
거부 및 폴백주요 방법보조 또는 표본 추출보조 또는 표본 추출주요 방법
  • 주요 방법
  • 보조 또는 표본 추출
  • 여기서는 거의 사용하지 않음

AI 기능 테스트는 다른 일입니다

챗봇은 모든 기능 테스트를 통과하고도 자신 있게 틀린 답을 내놓거나, 공개해서는 안 되는 데이터를 드러내거나, 업로드된 파일에 숨겨진 지시를 따를 수 있습니다. AI 기능에는 자체적인 평가가 필요합니다: 실제의 어려운 사례로 이루어진 데이터셋, 답변 품질과 근거에 대한 점검, 도구 및 데이터 권한, 프롬프트 인젝션 노출, 실패 처리, 그리고 모델이나 프롬프트가 바뀔 때마다의 회귀 점검입니다. 이는 AI가 제작을 도운 일반 앱을 테스트하는 것과는 다르며, 그것은 소프트웨어 QA 및 테스트가 다룹니다.

AI는 대규모 채점을 돕고, 전문가가 기준을 세웁니다

AI가 돕는 방식

  • 귀하가 승인한 실제 사용자 질문의 변형을 생성하며, 여기에는 패러프레이즈, 엣지 케이스, 적대적 입력이 포함됩니다.
  • 전문가가 레이블한 답변을 기준으로 보정된 모델 기반 채점으로 대량의 답변을 채점합니다.
  • 누락된 맥락, 잘못된 도구 호출, 무시된 지시 등 원인별로 실패를 군집화합니다.
  • 모델, 프롬프트, 검색 변경에 따른 실행을 비교하고 동작이 나빠진 곳을 표시합니다.

전문가가 책임지는 부분

  • 전문가가 귀하의 도메인 전문가와 함께 정확하고 안전하며 유용한 답변이 무엇인지 정의합니다.
  • 모델 기반 채점은 사람이 표본 점검하며, 전문가와 의견이 다른 채점기는 수정하거나 폐기합니다.
  • 에이전트가 어떤 도구와 데이터를 사용할 수 있는지, 그리고 사람이 승인하거나 넘겨받아야 하는 지점을 사람이 결정합니다.
  • 릴리스 기준과 go/no-go 판단은 점수 하나에 맡기지 않고 귀하의 팀과 저희 팀이 함께 유지합니다.

받게 되는 것

모든 변경마다 다시 실행할 수 있는 평가

  • 평가 데이터셋

    기대 동작으로 레이블된 실제 및 합성 사례: 일반적인 질문, 엣지 케이스, 범위를 벗어난 요청, 과거의 실패.

  • 답변 품질과 근거

    정확성, 관련성, 어조, 그리고 답변이 귀하의 소스로 뒷받침되는지 여부를 인용을 점검하고 환각을 표시하며 확인합니다.

  • 도구 및 데이터 권한 테스트

    에이전트가 무엇을 읽고, 변경하고, 실행할 수 있는지를 최소 권한, 승인 지점, 사람 인계 경로를 기준으로 테스트합니다.

  • 프롬프트 인젝션 노출

    메시지, 업로드된 파일, 웹 페이지, 검색된 문서를 통한 직접 및 간접 인젝션을, 공격자가 도달할 수 있는 범위로 등급을 매깁니다.

  • 실패 처리 및 폴백

    모델이 시간 초과되거나, 공급자가 다운되거나, 검색이 아무것도 찾지 못하거나, 신뢰도가 낮을 때의 동작: 폴백, 명확한 메시지, 사람에게의 인계.

  • 회귀 점검 및 릴리스 기준

    모델, 프롬프트, 데이터가 바뀔 때 다시 실행되는 자동 평가와, 변경의 출시 여부를 결정하는 합의된 기준.

AI 평가는 어떻게 진행되는지

  1. 01

    좋은 동작 정의하기

    귀하의 팀 및 도메인 전문가와 함께 사용 사례, 위험, 품질 기준, 권한을 합의하고, 저희가 사용하도록 허락하신 실제 예시를 수집합니다.

  2. 02

    데이터셋 구축하기

    어렵고 적대적인 사례를 포함한 평가 사례를 모아 레이블하고, 각 변경이 충족해야 할 릴리스 기준을 설정합니다.

  3. 03

    평가하고 탐사하기

    전문가 검토, 레드팀 권한, 프롬프트 인젝션과 함께 자동 평가를 실행하고, 실패를 프롬프트, 검색, 도구 또는 모델로 추적합니다.

  4. 04

    게이트와 모니터링

    귀하의 릴리스 프로세스에 평가를 추가하고, 권장 수정안과 함께 결과를 보고하며, 제품이 바뀜에 따라 데이터셋을 최신 상태로 유지합니다.

AI 도구와 함께 작업하는 두 가지 방법

AI는 테스트 초안 작성과 결함 조사를 돕습니다. 코드와 테스트 데이터를 어디에서 처리할 수 있는지 선택하세요.

확실하지 않으신가요? 범위 지정 중에 저희가 하나를 추천하겠습니다. AI 딜리버리 옵션 비교하기

일반적인 평가 요청

고객 사례 연구가 아니라, 저희가 범위를 정하는 일반적인 시나리오입니다.

  • 공개 출시 전 고객센터 어시스턴트

    한 팀이 도움말 문서를 바탕으로 답변하는 어시스턴트를 원합니다. 우리는 실제 지원 질문을 라벨링된 세트로 전환하고, 답변과 인용을 채점하며, 범위를 벗어난 사례와 적대적 사례를 추가하고, 출시 전에 릴리스 기준에 합의합니다.

  • 저비용 모델로 기능 이전

    한 제품 책임자가 어떤 기능을 더 저렴한 모델이나 제공업체로 전환하고 싶어 합니다. 우리는 동일한 평가 세트를 양쪽 모두에서 실행하고, 답변이 어디서 나아지거나 나빠지는지와 지연 시간이 어떻게 변하는지 보여주며, 결정은 그들에게 맡깁니다.

  • 기록을 변경할 수 있는 에이전트

    한 기업이 내부 에이전트가 주문을 업데이트하도록 허용합니다. 우리는 그 도구 권한과 승인 지점을 레드팀 방식으로 테스트하고, 에이전트가 읽는 문서에 지시를 심어 간접 주입을 테스트하며, 작동하기 전에 사람이 승인해야 하는 지점을 권고합니다.

AI 평가가 멈추는 지점

  • 프롬프트, 검색 또는 모델 자체를 변경하는 것은 평가의 일부가 아닙니다. 우리는 수정 사항을 권고하고, 귀사의 팀이 이를 수행하거나 우리가 LLM Integration 범위에서 범위를 정합니다.
  • 기능 뒤에 있는 서버, API 및 클라우드 계정에 대한 공격은 Penetration Testing에 속합니다. 여기서는 모델의 지시, 도구 및 데이터 접근을 조사합니다.
  • 최대 트래픽 시의 지연 시간, 속도 제한 및 모델 비용은 Performance Testing에서 측정됩니다.
  • 귀사의 AI 사용에 대한 법률적 또는 규제적 승인은 포함되지 않습니다. 결과는 귀사 자체의 위험 및 컴플라이언스 검토를 위한 증거입니다.

AI 평가가 디자인, QA, 운영과 어떻게 연결되는지

  • 디자인: 사람이 사용할 수 있는 감독

    디자이너는 사용자가 소스, 불확실성, 오류를 어떻게 보는지, 그리고 귀하의 직원이 에이전트를 어떻게 검토하고, 수정하고, 넘겨받는지를 설계합니다.

  • QA: 제품의 나머지 부분도

    소프트웨어 QA는 로그인, 결제, 역할, 통합 등 AI를 둘러싼 앱을 다루며, 다른 릴리스와 마찬가지로 요구사항을 기준으로 테스트합니다.

  • 운영: 프로덕션에서의 품질

    프로덕션 로그, 사용자 피드백, 지연 시간, 비용이 모니터링과 새로운 평가 사례에 반영되며, 품질이 흔들리기 시작하면 알림을 보냅니다.

  • 지속: 모든 변경을 재평가

    모델 업그레이드, 프롬프트 수정, 새로운 데이터 소스는 귀하와 합의한 AI 운영의 일환으로 릴리스 전에 평가됩니다.

FAQ

자주 묻는 질문

이것은 AI가 제작을 도운 앱을 테스트하는 것과 어떻게 다른가요?

AI 코딩 도구로 작성된 앱도 여전히 일반 소프트웨어처럼 동작하므로, 소프트웨어 QA 및 테스트가 그것을 다룹니다. AI 평가는 모델이 런타임에 답변을 생성하거나 작업을 수행하는 제품을 위한 것입니다. 출력이 다양하므로, 저희는 여러 사례에 걸쳐 품질을 측정하고, 권한을 테스트하며, 실패에 대비해 계획합니다. 많은 제품이 둘 다 필요로 하며, 저희는 이를 함께 범위에 넣습니다.

어떤 모델과 AI 스택을 평가할 수 있나요?

OpenAI나 Claude 같은 호스팅 모델, Llama나 Mistral 같은 오픈 웨이트 모델, 검색 파이프라인, 에이전트 프레임워크 위에 구축된 기능입니다. 이 방법은 공급자에 의존하지 않으므로, 귀하의 자체 사례에서 모델이나 공급자를 비교하는 데에도 사용할 수 있습니다.

평가로 AI가 결코 틀리지 않게 만들 수 있나요?

아니요. 모델은 여전히 실수할 수 있습니다. 평가는 그것들이 어디서 어떻게 실패하는지 보여주므로, 릴리스 기준을 세우고, 가드레일과 폴백을 추가하며, 오류가 비싼 곳에 사람 검토를 설계하고, 품질이 바뀔 때 빠르게 알아차릴 수 있습니다.

저희의 프롬프트, 로그, 평가 데이터는 어디서 처리되나요?

귀하 기능 자체의 모델 호출은 이미 사용 중인 공급자로 갑니다. 작업에 저희가 사용하는 AI 도구, 예컨대 모델 기반 채점은 귀하가 선택한 경계 안에서 실행됩니다: 귀하가 관리하는 인프라의 Private / Local AI 엔지니어링, 또는 합의된 데이터 처리 조건 하의 Claude Code / OpenAI Codex 엔지니어링입니다. 로그의 개인 데이터는 귀하와 합의한 대로 사용 전에 마스킹됩니다.

관련 읽을거리

출시 전에 귀하의 AI가 어떻게 동작하는지 확인하세요

귀하의 AI 기능이 무엇을 하는지, 어떤 모델을 사용하는지, 무엇이 걱정되는지 알려주세요. 저희가 평가 계획과 릴리스 기준을 제안하겠습니다.