1. 코드카타 풀이

SQL을 다지기 위해 밀린 코드카타를 풀이 했다. 막상 풀고나니 Join의 문제가 많이 나왔다. 아직 Left는 언제 써야하고, Inner는 언제 써야하는지 헷갈리는 포인트가 많았다. 보통 둘다 많이 쓰이기도 하니 찾아보니 Left join은 왼쪽에 있는 모든 테이블의 행을 조회하고, Inner join은 교집합, 겹치지만 않는다면 그 행은 결과에서 제외 되는 것이다. 쓰임에 따라 다르지만 Inner join은 교집합 결과로 나오니 성능적으로 효율적이라하는데.. 문제 풀어야 감이 잡힐듯 하다.
코드카타 92번 : Average Selling Price
코드카타 93번 : Project employee
코드카타 94번 : Percentage of Users Attended a Contest
2. 종합복습반
드디어 머신러닝의 시간이 왔다. 일요일에 읽었을 때도 어질어질 했는데, 막상 이론 문제와 내용을 다시 파악을 해보니 조금 차근히 이해는 할 수 있었다. 학습을 하고, 프로젝트 병행 하면서 정말 힘들었던 과정 중에 하나인데 조금씩은 이해가 가고 있어 다행이라 생각한다.
- 데이터 분할 과정 (훈련 70%, 테스트 세트 (Test size) 30% 기준 - 훈련/ 테스트 세트는 조절을 할 수 있다)
from sklearn.model_selection import train_test_split
#타겟 분리 (입력변수 , 타겟변수)
X=df.drop('Outcome', axis=1) #입력변수
y= df['Outcome'] #타겟변수
# 훈련 70 % / 테스트 세트 30% 분할
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
print("X_train shape:", X_train.shape)
print("X_test shape:", X_test.shape)
print("y_train 분포:\n", y_train.value_counts())
print("y_test 분포:\n", y_test.value_counts())
- 로지스틱 회귀 모델 / 분류 모델 성능 평가
# 로지스틱 모델
from sklearn.linear_model import LogisticRegression
model = LogisticRegression (max_iter=1000, random_State=42)
model.fit(X_train, y_train)
print(model)
#분류 모델 성능평가
from sklearn.metrics import confusion_matrix, classification_report
y_pred = model. predict(X_test)
confu=confusion_matrix(y_test, y_pred)
- 선형 회귀 모델 생성 및 학습
from sklearn.linear_model import LinearRegression
# 1. 선형 회귀 모델 생성 및 학습
lin_model = LinearRegression()
lin_model.fit(X_train, y_train)
print(lin_model.coef_)
#절편 : model.intercept_
print(lin_model.intercept_ )
#회귀계수 : model.coef_
#절편 : model.intercept_
3. 기획안 작성
금요일에 작성했던 주제와 선정 된 데이터에 맞추어 기획안을 작성하기 위해 준비하였다. 아무래도 가상으로 나온 데이터 세트이기도 하고 프로젝트 배경 설정을 구상하는 것부터 어려웠다. 혼자 개인으로 진행을 하다보니 배경, 개요, 주제 등등 디벨롭 하는 것에 시간이 오래 소요가 되었다. GPT에게 물어보는 것도 정답이 아니라 판단 되어, 데이터를 하나 둘 씩 뜯어보며 정리 중에 있다. 개인적으론 몇 개를 워싱하고 싶지만 건들 엄두가 안나 ㅠㅠ
답답한 마음에 일정을 먼저 계획을 하였다. 이미 정해진 큰 일정은 남아 있었고 조금 타이트해 질 필요가 있다고 판단하였다.
왜냐하면 너무 일정을 러프하게 잡았다가 실전 프로젝트에서 피를 본 경험이 있었기에... 이번엔 조금 더 타이트하게 디벨롭 하기로 했다.
- 1주차 : 전체 데이터 구조 파악 및 데이터 EDA (+ 상세 주제 및 가설 정리 확정
- 2주차 : 성과 지표별 집계 분석 및 인사이트 정리
- 3주차 : 중간 보고 준비 및 대시보드 구성
- 4주차 : 전략 구성 / 대시보드 제작
- 5주차 : 대시보드 제작 완료 / 흐름 정리
- 6주차 : PPT 최종본 제작 / 최종 파일 정리 및 제출
TIL을 다쓰고 분석 주제와 방향을 확정 지어야겠다.
내일 투표하고 잠깐 밀린 집안일과 필사를 마무리 하려 했지만, 어림없지 차근히 정리를 해보자.
'스터디 > TIL' 카테고리의 다른 글
| [TIL] 내일배움캠프 73일 - 저는 바보 입니다 (프로젝트 데이터 전처리, SQL 코드카타 / 기획안 피드백) (0) | 2025.06.04 |
|---|---|
| [TIL] 내일배움캠프 72.5일 - 기획안 작성 (1) | 2025.06.04 |
| [TIL] 내일배움캠프 71일차 - 최종프로젝트 시작 (Feat. 개인프로젝트) (3) | 2025.05.30 |
| [TIL] 내일배움캠프 38일차 - QCC 오답 정리 (SQL 오답 파티 리스트) (1) | 2025.04.11 |
| [TIL] 내일배움캠프 36일차 : 회귀분석은 무엇인가 (0) | 2025.04.09 |