1. 회귀분석은 무엇인가?
독립변수와 종속 변수가 나누어진 데이터 기반으로 예측을 진행 할 때 수행
- 회귀분석에서 알아야 할 팁!
- 독립변수 : 원인이 되는 변수 / 종속변수 : 결과가 되는 변수
- 귀무가설 / 대립가설
2. 회귀분석 진행 순서 3 단계
1) 독립, 종속변수 설정 : 가설을 설정 하는 단계. 인지적으로 알고있는 부분을 적절히 대입 필요
2) 데이터 경향성 확인 : 독립변수와 종속변수 간 산점도 분석 및 상관관계 분석 (예. 피어슨 상관 계수) 를 통하여 데이터 분포 확인
3) 정합성 검증 및 결과 해석 : 회귀모델이 얼마나 설명력을 갖는지 / 회귀모델이 통계적으로 유의한지, 독립변수와 종속변수간 선형관계가 있는지 검증 후 결과에 대해 해석
3. 회귀분석 종류 및 특징
1) 선형회귀 분석
- 독립변수 / 종속변수 : 둘 다 연속형에 속함
- 분석 목적 : 확실한 예측
- 분석 방법 : 선형 방정식에 의한 함수 표현
- 종류 : 단순회귀와 다중회귀 2가지로 나뉨
* 단순 회귀 : 독립변수 1개 , 종속변수 1개인 경우 즉, 원인과 결과가 각각 1건씩! 말그대로 단순함
* 다중 회귀 : 독립변수가 2개 이상이고, 종속변수가 1개. 즉, 원인이 2개 이상이고 결과는 1개
* 공통적으로 어쩔수 없이 발생 된 오차(잔차)도 고려를 해야함
2) 로지스틱 회귀분석
- 독립변수: 연속형, 범주형
- 종속변수: 범주형이면서도 이진형 or 순서가 없는 범주형
- 분석 목적 : 분류, 예측
- 분석 방법 : 연결함수를 이용한 함수식 표현 (구글링 해보니 뭔가 내용이 많아 Deep하게 정리해서 올리는걸로!)
- 종류 : 이진 로지스틱회귀 , 다중 로지스틱 회귀 두가지
*이진 로지스틱 회귀: 종속변수가 두가지 중 하나의 값을 가지는 경우
* 다중 로지스틱 회귀: 종속변수가 순서가 없는 3개이상일 경우
4. 정합성 검증 및 결과 해석 과정
1) 회귀모델이 얼마나 설명력을 갖는지 궁금할 때 > 결정계수 R_Squared 활용
- 결정계수 : 종속변수와 독립변수의 관계를 나타내는 수치
** 회귀식이 도출 되는 과정 (결정계수 해석을 위한 도출 과정)
설명력(R²)은 전체오류중 회귀를 함으로써 얼마나 개선되었는가를 의미
설명력은 0과 1 사이의 값을 가지며, 1에 가까울수록 모델의 성능이 좋다는 것을 의미

| 개념 | 의미 |
| T(Total) | 전체 변동 |
| R(Regresssion) | 회귀분석을 통해서 찾아낸 회귀선 까지의 변동 |
| E(Error) | 잔차 = 회귀로 설명할 수 없는 여전히 존재하는 변동 |
2) 회귀모델이 통계적으로 유의한지 궁금할 때 > 회귀식에 대한 F 검정 진행
-회귀식을 통해 귀무가설 (회귀모델은 타당하지 x) / 대립가설(회귀모델은 타당함) 을 비교하여 검정 시행
-이후 p-value를 통해 유의성을 판단
-F 검정을 통해 얻은 P-value 값이 0.05보다 작다면, 대립가설을 채택함 (신뢰도 95%)
3) 독립변수와 종속변수 간 선형관계가 있는지 궁금할 때 > 회귀식에 대한 T 검정 진행
-회귀식을 통해 귀무가설 (회귀모델은 타당하지 x) / 대립가설(회귀모델은 타당함) 을 비교하여 검정 시행
-이후 p-value를 통해 유의성을 판단
-F 검정을 통해 얻은 P-value 값이 0.05보다 작다면, 대립가설을 채택함 (신뢰도 95%)
4) OLS 해석 : 선형 회귀 모델의 결과를 나타내는 회귀 결과표
** 참고할만한 지표
- Dep. Variable (y): 종속 변수, 즉 회귀분석에서 설명하고자 하는 변수
- R-squared (0.344): 결정계수로, 회귀 모델이 종속 변수의 변동성을 얼마나 설명하는지를 나타냅니다. 이 값은 0에서 1 사이에 위치하며, 0.344는 약 34.4%의 변동성이 설명됨을 의미
- F-statistic (230.7): 회귀 모형의 전체 유의성을 검정하는 F-통계량입니다. 값이 클수록 모형이 유의미할 가능성 높다.
- Prob (F-statistic) (3.47e-42): F-통계량의 p-값으로, 이 값이 매우 작으면 (예: 0.05 이하) 대립가설을 채택할 수 있습니다. 이 경우 p-값이 거의 0에 가까우므로, 회귀 모형이 통계적으로 유의미
- std err (Standard Error): 회귀 계수 추정치의 표준 오차입니다. 상수항과 x1에 각각 2.974, 62.515
- t (t-statistic): 회귀 계수가 0인지 검정하는 t-값입니다. 절대값이 클수록 해당 계수가 유의미할 가능성
x1의 t-값은 15.187로 매우 크며 유의미함을 나타냅니다. - P>|t| (P-value): 각 계수에 대한 p-값입니다. 일반적으로 0.05보다 작으면 해당 계수는 유의미하다고 판단. x1과 상수항의 p-값은 모두 0으로, 매우 유의미
- [0.025 0.975] (Confidence Interval): 회귀 계수에 대한 95% 신뢰구간.
예를 들어, x1의 신뢰구간은 [826.570, 1072.301]로, 이 범위 내에서 실제 계수가 있을 가능성이 95%
이미지 출처 : 데이터사이언스 레시피
'스터디 > TIL' 카테고리의 다른 글
| [TIL] 내일배움캠프 72.5일 - 기획안 작성 (1) | 2025.06.04 |
|---|---|
| [TIL] 내일배움캠프 72일차 - 코드카타, 기획안 , 종합복습반 (3) | 2025.06.02 |
| [TIL] 내일배움캠프 71일차 - 최종프로젝트 시작 (Feat. 개인프로젝트) (3) | 2025.05.30 |
| [TIL] 내일배움캠프 38일차 - QCC 오답 정리 (SQL 오답 파티 리스트) (1) | 2025.04.11 |
| [TIL] 학습일기 기록을 velog에서 티스토리로 분산 이전 (1) | 2025.04.09 |