CSV 파일을 한국어로 물으면 실제로 계산해 답하는 질문 스킬입니다. “지역별 환불율”, “월별 매출 추이”, “재구매 비중”처럼 말하면 됩니다. Claude에게 말로 부탁하면 됩니다 — 셀을 직접 세거나 SQL을 쓸 필요가 없고, cp949로 저장된 한국 엑셀 CSV도 그대로 읽습니다.
빠른 시작
/data-ask 지역별 환불율 계산해줘
/data-ask 월별 매출 추이 보여줘
/data-ask 재구매 비중 알려줘
CSV를 건네면 열 구성과 각 열의 성격(측정값·차원·날짜·식별자·개인정보)을 먼저 요약하고, 물어볼 만한 질문 예시를 제안합니다. 그중에서 고르거나 직접 말하면 계산해 답합니다.
활용 시나리오
집계·비율·추이 질문
합계·평균·건수·최소·최대·비율을 열 값으로 묶어(그룹별) 계산하고, 날짜 열이 있으면 월 단위 추이로도 봅니다.
/data-ask 지역별 금액 합계와 평균 알려줘
/data-ask 지역 값별 건수 분포 보여줘
관계·영향을 따지는 추론 질문
“무엇이 무엇에 영향을 주는가” 같은 질문은 상관·단순회귀로 확인합니다. 먼저 “어떤 결정을 위한 분석인지”를 물은 뒤, 계산 결과를 독립적으로 한 번 더 재현해 교차검증합니다.
/data-ask 광고비가 매출에 영향을 주는지 봐줘
한국 엑셀·앞자리 0·통화 금액
cp949로 저장된 한국 엑셀 CSV를 자동으로 읽습니다. 06234 같은 앞자리 0 코드는 숫자로 뭉개지 않고 그대로 보존하며, 480,000원·₩·(1,200) 같은 통화·형식 금액도 집계할 때 숫자로 인식합니다.
물어볼 수 있는 계산
| 계산 | 설명 | 예시 질문 |
|---|---|---|
| 건수·합계·평균·최소·최대 | 기본 집계 | “지역별 주문 건수”, “월 매출 합계” |
| 비율 | 특정 조건에 해당하는 비중 | “환불율”, “재구매 비중” |
| 그룹별 집계 | 특정 열 값으로 묶어 비교 | “지역별”, “지역·연령 조합별” |
| 월별 추이 | 날짜를 월 단위로 묶은 흐름 | “월별 매출 추이” |
결과 신뢰도 확인
- 실행한 계산식을 함께 보여줍니다. 눈대중이 아니라 실제로 어떤 SQL로 집계했는지 결과와 같이 노출하며, QueryPlan으로 표현할 수 없어 직접 SQL로 처리한 질의에는 “해석에 주의” 경고를 붙입니다.
- 표본이 작은 그룹은 경고합니다. 어떤 그룹의 건수가 5건 미만이면 “우연일 수 있으니 단정하지 마세요”라고 자동으로 알립니다.
- 추론은 증거가 없으면 보고하지 않습니다. 관계·영향 질문은 결정 인터뷰·표본 충분성 게이트·독립 재현 교차검증 세 증거가 모두 있어야 결과를 보고합니다.
팁
- 먼저 질문 예시를 받아 보세요. CSV를 건네면 열 성격 요약과 함께 물어볼 만한 질문을 제안합니다. 개인정보·식별자 열은 그룹 기준·측정값에서 자동 제외됩니다.
- 모호한 열 이름은 확인을 거칩니다. 어느 열을 뜻하는지 분명하지 않으면 단정하지 않고 한 번 되묻습니다.
- “무조건·빠르게”로 건너뛸 수 없습니다. 매핑 확인·표본 경고·추론 게이트는 강제이며, 재촉해도 생략되지 않습니다.
제한사항
- 읽기 전용: 원본 파일을 수정하지 않고, 외부 네트워크·디스크 쓰기·임의 파일 접근을 하지 않습니다.
- 데이터 정돈은 별도: 빈 열·중복 헤더 등 구조가 흐트러진 파일 정리는
data-prep스킬이 담당합니다. - 추론 통계는 게이트 통과 후에만: p-value·다중회귀 등 심화 기법은 후속 과제입니다.
- cp949 확장 최초 1회 온라인 필요: 한국 엑셀 파일을 처음 읽을 때만 인코딩 확장 설치를 위해 온라인 연결이 필요합니다(이후 오프라인).
- 실행 환경·상태: Python 3.10 이상과 duckdb가 필요하며, 아직 실험(experimental)·비권장 인큐베이션 스킬입니다.