· AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI Testing· Data Validation
AI Ready 데이터 검증· Software Testing
SW Testing추론·수학(Reasoning)
수학
예측

P사는 건물 기본 정보와 설계 조건을 입력하면 아파트 동 단위 철근량을 예측하는 기능을 개발하고 있었습니다. 철근량 예측은 단순한 정오답 문제가 아니었습니다. 예측 대상마다 건물 규모가 다르고 실제 철근량의 절대값도 달라, 같은 차이라도 큰 건물에서는 작은 오차, 작은 건물에서는 부담이 큰 오차가 될 수 있었습니다.
따라서 실제값 대비 어느 정도의 비율로 벗어났는지를 건물별로 동일한 방식으로 환산해 비교할 필요가 있었습니다. 견적 담당자가 여러 조건을 반복 검토하는 업무 특성상, 예측 결과의 반환 속도와 철근 계수 검색 같은 주변 기능의 응답성도 함께 검증해야 했습니다.
와이즈스톤은 예측 오차, 예측 반환 시간, 검색 응답 성능, 소프트웨어 품질 관점으로 구분해 평가했습니다. 예측 오차는 실제 건축 데이터를 기준으로, 화면에 출력된 철근량 예측값을 실제값과 비교해 MAPE를 산출했습니다. 건물별 규모 차이를 보정하기 위해 각 데이터의 오차 비율을 전체에 대해 평균하는 방식을 적용했습니다.
예측 반환 시간은 동일한 데이터를 업로드한 뒤 화면 로그에 출력된 시간을 반복 측정해 평균했습니다. 검색 응답 성능은 철근 계수 검색 결과가 화면에 출력되기까지의 시간과 함께 프로세서·메모리 사용률을 측정했습니다. 마지막으로 기능 적합성, 성능 효율성, 사용성, 신뢰성 등 소프트웨어 품질 항목을 종합적으로 점검했습니다.
৹ 실제 건축 데이터 기준 철근량 예측값과 실제값의 오차(MAPE)
৹ 데이터 업로드 후 예측 결과 반환 시간
৹ 철근 관련 검색 결과의 평균 응답 시간
৹ 평균 프로세서·메모리 사용률
৹ 기능 적합성, 성능 효율성, 호환성, 사용성, 신뢰성, 보안성, 유지보수성
P사는 이번 검증을 통해 철근량 예측 기능이 실제 건축 데이터 기준으로 목표 오차 범위 안에 들어오고, 결과도 신속하게 반환된다는 근거를 확보했습니다. 와이즈스톤은 예측 성능을 단순한 성공 여부가 아니라 실제값 대비 오차율과 반환 시간으로 구분해, 견적 업무에서 필요한 판단 기준을 검증했습니다.