스터디/TIL

[TIL] 내일배움캠프 36일차 : 회귀분석은 무엇인가

다다킴 2025. 4. 9. 23:59

1.  회귀분석은 무엇인가? 

독립변수와 종속 변수가 나누어진 데이터 기반으로 예측을 진행 할 때 수행 

  • 회귀분석에서 알아야 할 팁! 
    - 독립변수 : 원인이 되는 변수  /  종속변수 : 결과가 되는 변수 
    - 귀무가설 / 대립가설 

2. 회귀분석 진행 순서 3 단계

1) 독립, 종속변수 설정 : 가설을 설정 하는 단계.  인지적으로 알고있는 부분을 적절히 대입 필요 
2) 데이터 경향성 확인  : 독립변수와 종속변수 간 산점도 분석 및 상관관계 분석 (예. 피어슨 상관 계수) 를 통하여 데이터 분포 확인 
3) 정합성 검증 및 결과 해석  : 회귀모델이 얼마나 설명력을 갖는지 / 회귀모델이 통계적으로 유의한지, 독립변수와 종속변수간 선형관계가 있는지 검증 후 결과에 대해 해석  

3. 회귀분석 종류 및 특징 

1) 선형회귀 분석 
- 독립변수 / 종속변수 : 둘 다 연속형에 속함 
- 분석 목적 : 확실한 예측 
- 분석 방법 : 선형 방정식에 의한 함수 표현 
- 종류 : 단순회귀와 다중회귀 2가지로 나뉨 
   * 단순 회귀 : 독립변수 1개 , 종속변수 1개인 경우 즉, 원인과 결과가 각각 1건씩! 말그대로 단순함 
   *​ 다중 회귀 : 독립변수가 2개 이상이고, 종속변수가 1개. 즉, 원인이 2개 이상이고 결과는 1개 
   * 공통적으로 어쩔수 없이 발생 된 오차(잔차)도 고려를 해야함 

2) 로지스틱 회귀분석 

- 독립변수: 연속형, 범주형 
- 종속변수:
 범주형이면서도 이진형 or 순서가 없는 범주형 
- 분석 목적 : 분류, 예측 
- 분석 방법 : 연결함수를 이용한 함수식 표현 (구글링 해보니 뭔가 내용이 많아 Deep하게 정리해서 올리는걸로!)  
- 종류 : 이진 로지스틱회귀 , 다중 로지스틱 회귀 두가지 
   *이진 로지스틱 회귀: 종속변수가 두가지 중 하나의 값을 가지는 경우
   * 다중 로지스틱 회귀: 종속변수가 순서가 없는 3개이상일 경우

4. 정합성 검증 및 결과 해석 과정 

1) 회귀모델이 얼마나 설명력을 갖는지 궁금할 때 > 결정계수 R_Squared 활용
- 결정계수 : 종속변수와 독립변수의 관계를 나타내는 수치 
** 회귀식이 도출 되는 과정 (결정계수 해석을 위한 도출 과정) 
설명력(R²)은 전체오류중 회귀를 함으로써 얼마나 개선되었는가를 의미
설명력은 0과 1 사이의 값을 가지며, 1에 가까울수록 모델의 성능이 좋다는 것을 의미

 

개념  의미
T(Total) 전체 변동
R(Regresssion) 회귀분석을 통해서 찾아낸 회귀선 까지의 변동
E(Error)  잔차 = 회귀로 설명할 수 없는 여전히 존재하는 변동 

 

2) 회귀모델이 통계적으로 유의한지 궁금할 때 > 회귀식에 대한 F 검정 진행 

-회귀식을 통해 귀무가설 (회귀모델은 타당하지 x) / 대립가설(회귀모델은 타당함) 을 비교하여 검정 시행 
-이후 p-value를 통해 유의성을 판단 
-F 검정을 통해 얻은 P-value 값이 0.05보다 작다면, 대립가설을 채택함 (신뢰도 95%) 

3) 독립변수와 종속변수 간 선형관계가 있는지 궁금할 때 > 회귀식에 대한 T 검정 진행 
-회귀식을 통해 귀무가설 (회귀모델은 타당하지 x) / 대립가설(회귀모델은 타당함) 을 비교하여 검정 시행 
-이후 p-value를 통해 유의성을 판단 
-F 검정을 통해 얻은 P-value 값이 0.05보다 작다면, 대립가설을 채택함 (신뢰도 95%) 

4) OLS 해석 : 선형 회귀 모델의 결과를 나타내는 회귀 결과표 

** 참고할만한 지표

  1. Dep. Variable (y): 종속 변수, 즉 회귀분석에서 설명하고자 하는 변수
  2. R-squared (0.344): 결정계수로, 회귀 모델이 종속 변수의 변동성을 얼마나 설명하는지를 나타냅니다. 이 값은 0에서 1 사이에 위치하며, 0.344는 약 34.4%의 변동성이 설명됨을 의미 
  3. F-statistic (230.7): 회귀 모형의 전체 유의성을 검정하는 F-통계량입니다. 값이 클수록 모형이 유의미할 가능성 높다. 
  4. Prob (F-statistic) (3.47e-42): F-통계량의 p-값으로, 이 값이 매우 작으면 (예: 0.05 이하) 대립가설을 채택할 수 있습니다. 이 경우 p-값이 거의 0에 가까우므로, 회귀 모형이 통계적으로 유의미
  5. std err (Standard Error): 회귀 계수 추정치의 표준 오차입니다. 상수항과 x1에 각각 2.974, 62.515
  6. t (t-statistic): 회귀 계수가 0인지 검정하는 t-값입니다. 절대값이 클수록 해당 계수가 유의미할 가능성
    x1의 t-값은 15.187로 매우 크며 유의미함을 나타냅니다.
  7. P>|t| (P-value): 각 계수에 대한 p-값입니다. 일반적으로 0.05보다 작으면 해당 계수는 유의미하다고 판단. x1과 상수항의 p-값은 모두 0으로, 매우 유의미
  8. [0.025 0.975] (Confidence Interval): 회귀 계수에 대한 95% 신뢰구간.
    예를 들어, x1의 신뢰구간은 [826.570, 1072.301]로, 이 범위 내에서 실제 계수가 있을 가능성이 95%

 

 이미지 출처 : 데이터사이언스 레시피