스터디/TIL

[TIL] 내일배움캠프 84일 - 클러스터링 분석 진행 (+피드백)

다다킴 2025. 6. 20. 20:57

생일에도 프로젝트하는 우리내 인생

1. 클러스터링 2차 진행 

클러스터링 분석을 먼저 진행을 하고 있었고, K값을 조정해가며 최대한 좋은 성능의 결과값을 나오기 위해 조정을 했다.  수치형 변수 내용 ('Age', 'Purchase Amount (USD)', 'Previous Purchases', 'Review Rating', 'Selling Price') 은 PCA 까지 정리를 해보았으나 클러스터링 k=6 했을 때 범위가 아래와 같이 너무 밀집되어 결과값이 노출이 되고 있다.

어휴... 환공포증이 없는게 참 다행이라 생각한다.
어라... 모이면 안되는데?!

PCA 시각화도 적용을 했는데 이상했다. 보통 흩어지는 걸로 알고 있는데 너무 다닥다닥 붙어 있어 이상하다는 생각이 들었다. 
지금 수치형 변수만 있어 그런가... 다른 변수들도 다 때려 넣어야 하나 생각을 했던 것 같다. 

그래서 튜터님께 문의를 했던 내용은 아래와 같다. 

1. 행동 데이터를 넣어야 할까? (view, like, purchase)
2. 행동데이터 (View, Like, Purchase) 경우 범주형이고 텍스트로 구성 되어 있는데,
    클러스터링을 진행 시 수치형으로 인코딩 하여 진행하는 것이 맞는지 궁금.
3. 인코딩 방법을 학습자료와 구글링으로 같이 찾고 있는데, 레이블 인코딩과 원핫인코딩 중 클러스터링 진행 시 어떤 인코딩이 나을까요? (참고는 : https://hye-z.tistory.com/16 )

 

2. 피드백 내용 + 회고 

튜터님과 다시 한 번 코드를 확인 하고, 피드백 받다가 내가 간과 한 것이 하나가 있었다.
원래는 세그먼트를 나누는 것을 목적으로 클러스터링을 진행하는 것인데
코드가 맞게 돌아가는지 신경을 쓰다가 변수 선정이 이상하게 된 사실을 깨닫게 되었다. 코드는 대략적으로 잡아 수정을 하면 되지만
세그먼트에 넣었던 변수들은 아직 클러스터를 진행 하지 않았으니, 다시 한 번 시도를 해봐야겠다.

그리고 상관관계 변수들이 너무 많아, 상관관계가 높은 변수를 하나만 남기고 제거를 해야하고, 변수를 맞춘다음 kmeans를 다시 시도해ㅐ 야한다. 주말에 조금 다듬어 봐야겠구만.. 태블로까지 생각을 하면 늦어도 화요일엔 마무리를 해야한다 ㅠㅠ ...

** 피드백 확인 사항 (월요일 저녁까지 해야할 것들 ) 

  • 우선 순위로 변수 다시 선정하기
  • 서로 상관관계가 높은 변수들은 하나만 남기고 제거
  • 변수 간의 scale을 맞출 것 
  • 범주형 변수가 포함되는 경우라면, gower + KMedoids를 사용하거나 어렵다면, Kmeans 시도 
  • 성능평가는 실루엣계수와 elbow-method를 진행 (성능평가가 빠져 있었음)
  • 태블로 대시보드 아이데이션 (내일 카페로 피신갑시다!)  

    아 월요일 생일인데.... 씁.......