AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI TestingData Validation
AI 학습용 데이터 검증 공공데이터 품질 검증 기업 운영 데이터 검증Software Testing
SW Testing
개발 단계 리스크
조기 발견
배포 전
최종 검증
도입 의사결정
근거 확보
운영 중
정기 점검
이미지 분류·객체 검출
·세그멘테이션 기반 AI
(제조 검사, 의료 영상 등)
이미지·영상 생성 AI
OCR 및 문서 인식 AI
시각-언어 멀티모달 모델
(VQA, 이미지 설명 생성 등)
CCTV·영상 기반
이상 탐지 AI
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 이미지 분류 정확도 | 레이블링된 테스트셋을 다양한 클래스 분포로 구성해 예측 결과와 실측값을 비교 | F1 Score, Recall |
| 객체 검출 정확도 | 다양한 크기·밀도·조도 조건의 이미지에서 검출 결과의 위치·클래스 정확도를 평가 | mAP@0.5, IoU |
| 세그멘테이션 정확도 | 픽셀 단위 레이블과 모델 예측 결과의 겹침 정도를 측정 | Dice Score |
| 생성 품질 | 생성된 이미지와 레퍼런스 이미지 간의 시각적 유사도 및 통계적 분포 차이를 측정 | FID, SSIM, PSNR |
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 시각적 질의응답(VQA) 정확도 | 이미지에 대한 다양한 유형(사실 확인, 추론형)의 질의를 투입해 응답 정확도를 평가 | VQA 정확도(%), 질의 유형별 정답률 |
| 장면 이해 | 복잡한 장면 이미지를 제시해 상황·맥락 설명의 정확성과 완결성을 전문가 기준으로 채점 | 장면 이해 점수, 핵심 요소 누락률 |
| 멀티모달 일관성 | 동일 이미지에 대해 표현이 다른 질의를 반복 투입해 응답 간 일관성을 비교 | 응답 일관성(%) |
| 시각적 인과 추론 | 이미지 내 사건의 원인·결과를 추론하는 질의에 대한 논리적 타당성을 평가 | 인과 추론 정확도(%), 논리 오류 발생률 |
| 등급 | 도메인 | 중점 검증 항목 |
|---|---|---|
| R3 | 의료 영상 진단 보조 | 미탐(FNR) 허용 임계값, AI 단독 진단 경로 차단, 판독 설명 가능성, 민감 의료정보 처리 적정성 |
| R2 | 제조 품질 검사 | 결함 미탐지 리스크, 오탐으로 인한 생산 중단 최소화, 검사 기준 일관성 |
| R2 | 보안·CCTV 이상 탐지 | 오탐·미탐 균형, 사생활 침해 최소화 처리, 감사 로그 무결성 |
| R1 | 미디어·커머스 생성 이미지 | 저작권 침해, 브랜드 왜곡 차단, 합성 미디어(딥페이크 포함) 표시 여부 |
어떤 데이터를 제공해야 하나요?
제품 접근 권한(API 또는 데모 환경), 평가 기준이 되는 레퍼런스 데이터, 운영 시나리오 문서가 필요합니다. 세부 사항은 사전 미팅에서 확인합니다.
검증 기간은 얼마나 걸리나요?
검증 범위와 모델 복잡도에 따라 다르지만 일반적으로 2~6주 내외입니다. 긴급 일정은 사전 협의를 통해 조율할 수 있습니다.
불합격 판정이 나오면 어떻게 되나요?
결함 목록과 개선 권고안을 함께 제공합니다. 개선 후 해당 결함 영역에 대한 부분 재테스트 또는 전체 재테스트를 진행할 수 있습니다.
텍스트도 함께 처리하는 모델(예: 이미지를 설명하는 챗봇)은 어떻게 검증하나요?
이미지와 텍스트를 함께 처리하는 멀티모달 제품은 Vision AI Testing과 LLM Testing을 통합 설계하여 함께 진행할 수 있습니다.
Physical AI Testing과 무엇이 다른가요?
Vision AI Testing은 인식·생성 모델 자체의 출력 품질에 집중합니다. Physical AI Testing은 그 인식 결과를 바탕으로 실제 물리적 제어(주행, 로봇 동작 등)까지 수행하는 시스템 전체를 검증합니다. 로봇·모빌리티에 탑재되는 Vision AI는 두 서비스를 함께 적용하는 것을 권장합니다.