AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI TestingData Validation
AI 학습용 데이터 검증 공공데이터 품질 검증 기업 운영 데이터 검증Software Testing
SW Testing
개발 단계 리스크
조기 발견
배포 전
최종 검증
도입 의사결정
근거 확보
운영 중
정기 점검
자율 트레이딩,
재무·회계 자동화 에이전트
RPA, ERP 업무
자동화 에이전트
고객 응대 및
이메일 처리 에이전트
스마트 팩토리 공정 제어,
로봇 등 물리 환경 제어 에이전트
멀티 에이전트
협업 시스템
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 사용자 목적·지시어 해석 정확도 | 동일 목표를 다양한 표현(모호한 지시, 암묵적 조건 포함)으로 변형해 반복 입력하고, 에이전트가 도출한 실행 계획이 의도와 일치하는지 평가 | 의도-실행계획 일치율(%), 오독으로 인한 목표 이탈 사례 수 |
| 초기 시스템 프롬프트 파싱 정확도 | 시스템 프롬프트에 포함된 제약조건(권한 범위, 금지 행동 등)을 다양한 길이·복잡도로 구성해 준수 여부 확인 | 제약조건 준수율(%), 프롬프트 길이별 누락 빈도 |
| 프레임워크 초기화 안정성 | 반복 실행(N회)을 통해 초기화 실패율과 실패 시점을 측정 | 초기화 성공률(%), 평균 초기화 소요 시간 |
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 작업 분해 및 스케줄링 정밀도 | 다단계 목표를 부여하고, 생성된 하위 작업(Sub-task) 목록의 논리적 순서와 누락 여부를 전문가 평가 기준으로 채점 | 작업 분해 완결성 점수, 순서 오류율 |
| 도구·API 선택 자율성 | 유사 기능을 가진 복수의 도구를 제공한 상태에서, 상황별 최적 도구 선택 여부를 확인 | 최적 도구 선택률(%), 불필요한 도구 호출 횟수 |
| 실패 시 대안 경로 설계 능력 | 의도적으로 1차 시도를 실패시키는 환경을 조성해 재시도·우회 전략 생성 여부를 관찰 | Fallback 성공률(%), 동일 실패 반복 횟수 |
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 외부 API·DB 호출 정확도 | 호출 파라미터, 응답 처리 로직을 실제 연동 환경에서 트레이스(Trace)하여 오류 유형별로 분류 | 호출 성공률(%), 파라미터 오류 유형별 발생 빈도 |
| 멀티 에이전트 데이터 무결성 | 복수 에이전트가 동일 데이터를 참조·수정하는 시나리오에서 충돌·유실 여부 확인 | 데이터 정합성 오류 건수, 충돌 해결 성공률 |
| 무한 루프 방지 및 자율 종료 판단력 | 종료 조건이 불명확한 태스크를 부여해 루프 탈출 시점과 방식을 관찰 | 평균 루프 지속 횟수, 자율 종료 성공률(%) |
| 등급 | 도메인 | 강조 검증 항목 |
|---|---|---|
| R3 | 스마트 팩토리 공정 제어, 응급 의료 관제 워크플로우 | Fail-Safe 즉시 차단, 하드웨어 긴급 정지 설계 |
| R2 | 자율 트레이딩, ERP 자동화, 세무·법률 결재 | 권한 외 금융 거래 차단, 데이터 위변조 방지, 감사 로그 무결성 |
| R1 | 이메일 발송, 마케팅 자동화, 개인 생산성 도구 | 워크플로우 완료 성공률, API 호출 비용 효율, Human-in-the-loop 프로세스 |
LLM/VLM Testing과 구체적으로 어떤 점이 다른가요?
LLM/VLM Testing은 모델이 만들어내는 언어적 출력의 품질과 환각 현상 통제에 집중합니다.
AI Agent Testing은 그 모델을 기반으로 작동하는 시스템 전체 — 도구 활용, 여러 단계에 걸친 추론, 자율적인 API 호출, OS·인프라 제어까지 — 실제 행동 과정을 통합적으로 검증합니다.
테스트를 위해 어떤 데이터나 환경을 제공해야 하나요?
에이전트가 안전하게 작동할 수 있는 격리된 샌드박스나 데모 환경, 접근 권한(API 토큰 등)이 필요합니다. 여기에 더해 연동 도구의 API 명세서와 목적 기반 워크플로우 시나리오 문서를 제공해 주셔야 합니다.
테스트 파이프라인 구축과 테스트 기간은 얼마나 걸리나요?
에이전트가 수행해야 하는 작업 단계 수와 연동된 도구·API 개수에 따라 다르지만, 통상 2~6주가 소요됩니다. 일정이 급한 경우 사전 협의를 통해 테스트 범위를 조율할 수 있습니다.
가드레일 검증이나 실행 테스트에서 불합격이 나오면 어떻게 되나요?
자율 실행 중 권한을 벗어나거나 예외 처리에 실패해 무한 루프에 빠진 결함 로그와 재현 시나리오를, 가드레일 보정 가이드와 함께 개선 권고안으로 전달합니다. 디버깅이 끝난 뒤에는 해당 결함 영역에 대한 부분 재테스트를 지원합니다.