데이터 정리에서 가장 위험한 순간은 파일이 깔끔해졌지만 어떤 값이 왜 바뀌었는지 모를 때입니다. AI에게 파일 전체를 맡기기 전에 열별 변환 규칙과 변경 기록을 먼저 만듭니다.
원본과 작업본을 분리합니다
원본 파일은 읽기 전용으로 보관하고 작업본을 새 이름으로 만듭니다. 행 수, 고유 ID 수, 주요 금액 합계와 빈 값 수를 기록합니다. 정리 후 같은 지표를 비교할 수 있어야 합니다.
열별 규칙표를 만듭니다
| 열 | 현재 문제 | 변환 규칙 | 허용 예외 | 검증값 |
|---|---|---|---|---|
| 주문일 | 형식 혼합 | YYYY-MM-DD | 원문 불명은 빈 값 | 최소·최대 날짜 |
| 채널 | 표기 혼합 | 검색/소셜/이메일 | 기타 유지 | 범주별 행 수 |
| 매출 | 문자 포함 | 정수 원 | 환불은 음수 | 전체 합계 |
AI에는 값보다 규칙을 먼저 검토시킵니다
아래는 합성 CSV의 열 설명과 정리 규칙이다. 실제 데이터를 바꾸지 말고 규칙의 모순과 누락만 검토해줘.
확인 항목: 중복 판정 키 / 날짜·시간대 / 빈 값 처리 / 범주 매핑 / 숫자 단위 / 원본 보존 / 변경 로그.
출력: 문제 / 영향 / 수정 규칙 / 정리 후 검증식.
규칙이 확정된 뒤 일부 합성 행으로 변환 결과를 시험합니다. 개인정보가 있는 실제 고객 파일은 회사가 승인한 환경에서만 처리합니다.
반드시 남길 변경 로그
- 변경 전 값과 변경 후 값
- 적용한 규칙 이름
- 변경된 행의 ID
- 자동 변경인지 수동 확인인지
- 변환 실행일과 담당자
정리 후 검증
행 수가 의도 없이 줄지 않았는지, ID가 중복되거나 사라지지 않았는지, 금액 합계 차이가 설명 가능한지 확인합니다. 범주별 건수의 전후 비교도 남깁니다.
CSV에는 화면에서 잘 보이지 않는 이메일, 전화번호, 내부 ID가 함께 들어갈 수 있습니다. 업로드 전에 모든 열을 확인하세요.
실패 사례
서울, 서울시, 서울특별시를 하나로 바꾸는 작업 중 빈 지역을 서울로 채우면 누락을 정상값으로 오인합니다. 변환 규칙과 결측값 처리를 분리하고, 변경 전후 행 수와 고유값 목록을 함께 보관합니다.