갤러리 보기
갤러리 보기

시각화의 시초 - 나폴레옹 진군맵

시각화의 시초 - 콜레라 발병맵

시각화의 시초 - 나이팅게일

분석 유형별 그래프

데이터 시각화의 원리
NumPy에서 np.dot과 np.matmul의 차이를 이해하는 것은 특히 딥러닝과 같은 수치 계산 분야에서 효율적인 프로그래밍을 위해 매우 중요합니다.
1. 차원 처리
•
np.dot (Dot Product):
•
np.matmul (Matrix Multiplication):
2. 연산 규칙
•
Dot Product (np.dot):
NumPy의 Dot Product (np.dot) vs Matrix Multiplication (np.matmul)
갤러리 보기

Feature Importance

정보이론(Information theory)

다중공산성(multicollinearity)
베이지안 부트스트랩 (Bayesian Bootstrap) 설명
베이지안 부트스트랩은 전통적인 부트스트랩 방법을 베이지안 통계 프레임워크로 확장한 것으로, 데이터의 불확실성을 반영하면서도 베이지안 추론의 장점을 활용할 수 있는 기법입니다. 이 방법은 특히 데이터의 분포에 대한 사전 정보가 부족하거나, 비모수적(non-parametric) 접근이 필요할 때 유용하게 사용됩니다.
1. 부트스트랩과 베이지안 부트스트랩의 차이점
•
전통적 부트스트랩 (Frequentist Bootstrap):
•
베이지안 부트스트랩:
2. 베이지안 부트스트랩의 기본 개념
Bayesian Bootstrap
불균형 데이터(imbalanced data)는 머신러닝 모델 학습 시 여러 가지 부정적인 영향을 미칠 수 있습니다. 특히 분류 문제에서 한 클래스의 샘플 수가 다른 클래스에 비해 현저히 적거나 많은 경우 모델의 성능과 일반화 능력에 큰 영향을 줄 수 있습니다. 아래에서는 불균형 데이터가 모델 학습에 미치는 주요 영향과 그로 인한 문제점들을 상세히 설명하겠습니다.
1. 모델의 편향(Bias) 발생
불균형 데이터에서는 다수 클래스(majority class)에 비해 소수 클래스(minority class)의 샘플 수가 적기 때문에 모델이 주로 다수 클래스에 치우쳐 학습됩니다. 이로 인해 모델은 다수 클래스를 더 잘 예측하는 반면, 소수 클래스에 대해서는 예측 성능이 저하될 수 있습니다.
예시:
•
이진 분류 문제에서 클래스 0이 90%, 클래스 1이 10%인 경우, 모델은 모든 샘플을 클래스 0으로 예측해도 90%의 정확도를 달성할 수 있습니다. 그러나 이는 소수 클래스인 클래스 1을 전혀 예측하지 못하는 비실용적인 모델입니다.
2. 평가 지표의 왜곡
불균형 데이터에서는 정확도(accuracy) 같은 전통적인 평가 지표가 모델 성능을 제대로 반영하지 못할 수 있습니다. 높은 정확도를 기록하더라도 소수 클래스에 대한 예측이 매우 부정확할 수 있습니다.
주요 평가 지표:
불균형 데이터(imbalanced data)
imbalanced-learn는 Python에서 데이터 불균형 문제를 해결하기 위한 다양한 샘플링 기법을 제공하는 라이브러리입니다. 이 라이브러리는 오버샘플링(Over-sampling), 언더샘플링(Under-sampling), 혼합 샘플링(Combined Sampling), 그리고 앙상블(Ensemble) 방법 등 다양한 접근 방식을 지원합니다. 아래에서는 imbalanced-learn에서 제공하는 주요 데이터 불균형 처리 기법들을 상세히 소개하겠습니다.
목차
1.
오버샘플링(Over-sampling) 기법
2.
언더샘플링(Under-sampling) 기법
3.
혼합 샘플링(Combined Sampling) 기법
4.
앙상블(Ensemble) 기법
5.
기타 유틸리티 기법
6.
샘플링 전략(Sampling Strategies)
imbalanced-learn
선형회귀분석은 **연속형 종속변수(Y)**와 한 개 이상의 독립변수(X) 사이의 관계를 모델링하는 가장 기본적이고 널리 쓰이는 통계·머신러닝 기법입니다.
1. 개요
1.
기본 개념
2.
단순회귀 vs 다중회귀
3.
결과 해석
선형회귀분석(단순/다중)
TREE Model
mRMR(minimum Redundancy Maximum Relevance) 알고리즘 개요
mRMR 알고리즘은 머신러닝에서 **특징 선택(Feature Selection)**을 위해 자주 사용되는 필터 기반(Filter-based) 방법입니다. 많은 수의 특징(feature) 중에서 **목표 변수(클래스 변수)**와 최대한 관련성이 높으면서도, 이미 선택한 특징들과는 중복 정보가 최소가 되는 특징들을 선별하는 것을 목표로 합니다. 이를 통해 모델의 성능 향상, 해석력 증가, 계산 비용 감소, 과적합 방지 등 다양한 이점을 얻을 수 있습니다.
특히, 빅데이터 시대에 고차원 데이터셋이 증가함에 따라, 불필요한 특징들을 제거하고 핵심적인 특징만을 활용하는 것은 매우 중요한 과제가 되었습니다. mRMR 알고리즘은 이러한 문제 상황에서 효율적이고 직관적인 해결책을 제공합니다.
핵심 개념
mRMR 알고리즘은 두 가지 핵심 기준을 통해 특징을 선택합니다.
1.
최대 관련성(Maximum Relevance):
2.
최소 중복성(Minimum Redundancy):
mRMR(minimum Redundancy Maximum Relevance)
Pearson 상관계수 (Pearson Correlation Coefficient)
개념:
Pearson 상관계수는 두 변수 간의 선형적(linear) 관계의 정도를 측정하는 통계량입니다.
값의 범위는 −1-1부터 +1+1이며,
•
+1+1에 가까울수록 두 변수는 강한 양의 선형관계,
•
−11에 가까울수록 강한 음의 선형관계,
•
00에 가까울수록 선형관계가 약함을 의미합니다.
공식:
Pearson 상관계수 vs Chatterjee 상관계수
변수 선택(Feature Selection)은 머신러닝 모델링 과정에서 매우 중요한 단계입니다. 많은 특징 중에서 불필요하거나 중복되는 변수를 제거하면 모델의 과적합(overfitting)을 줄이고, 계산 비용과 학습 시간을 절약하며, 모델 해석력을 높이고 예측 성능을 향상시킬 수 있습니다. 변수 선택 방법은 크게 Filter, Wrapper, Embedded 세 가지로 나눌 수 있으며, 각각 통계적 특성 이용, 모델 성능 기반 최적화, 모델 학습 과정 내의 변수 선택이라는 특징을 가집니다.
•
*Boruta 알고리즘(Boruta Algorithm)**은 이러한 변수 선택 방법론 중 Wrapper 방식에 해당하며, 특히 Random Forest 기반의 특징 선택 알고리즘으로 알려져 있습니다. 2010년 Kursa와 Rudnicki에 의해 제안된 이 알고리즘의 목표는 모든 관련 특징(all-relevant features)을 탐지하는 것입니다. 즉, 단지 최소한의 "필수" 변수만 고르는 것이 아니라, 모델 성능에 유의미한 영향을 주는 모든 변수를 포착하려고 합니다. 이를 통해 중요한 변수를 놓치지 않고 최대한 확보할 수 있으며, 해석 가능성과 예측력을 동시에 확보할 수 있습니다.
작동 원리
Boruta 알고리즘은 Random Forest의 변수 중요도(Variable Importance)를 핵심 지표로 활용합니다. 일반적으로 Random Forest는 각 특징이 트리 모델에서 분기(split)를 통해 불순도(impurity)를 얼마나 감소시켰는지(Mean Decrease in Impurity, MDI) 등을 기반으로 변수 중요도를 계산합니다. Boruta 알고리즘은 여기에 Shadow 특징이라는 아이디어를 도입하여, 원본 특징들이 정말로 의미 있는지 통계적으로 검증합니다.
작동 과정은 다음과 같이 정리할 수 있습니다.
1.
Shadow 특징 생성: 원본 특징들의 복사본을 무작위로 섞어(셔플) 의미 없는 Shadow 특징들을 만듭니다.
2.
확장된 데이터셋 학습: 원본 특징 + Shadow 특징을 합친 확장된 데이터셋으로 Random Forest를 학습시키고, 모든 특징(원본+Shadow)에 대한 변수 중요도를 계산합니다.
Boruta 알고리즘 종합 정리
Kruskal-Wallis 검정의 이해
1. 개요
1.1 기본 개념
•
Kruskal-Wallis 검정은 세 개 이상의 독립된 집단 간 분포 차이(특히 중위수 중심)를 비교하기 위한 비모수적(non-parametric) 검정 방법입니다.
•
모수적 검정인 일원분산분석(ANOVA)는 종속변수가 정규분포를 따른다는 가정, 그리고 등분산성 가정
하지만 실제 데이터가 정규성을 만족하지 않거나 극단값(이상치)이 많아 ANOVA의 가정이 깨지면, Kruskal-Wallis 검정을 대안으로 사용할 수 있습니다.
•
적용 데이터 유형: 순서형(Ordinal) 혹은 연속형(Continuous) 종속변수. 군집(집단)이 명목형 변수로 구성되고, 각 집단이 독립적인 표본이어야 합니다.
1.2 사용 조건
1.
독립 표본: 각 집단 샘플이 서로 겹치지 않아야 함 (예: 서로 다른 사람·집단에 대한 측정).
Kruskal-Wallis 검정
**일원분산분석(One-way ANOVA)**을 중심으로, 개념부터 가정, 수학적 배경, 절차, 사후검정, 그리고 Python 실습 예시까지 순차적으로 정리한 내용입니다. 실제 연구나 실무에서 3개 이상의 집단 평균을 비교할 때 가장 일반적으로 사용하는 통계 기법이니, 전체 흐름을 한 번에 살펴볼 수 있도록 구성했습니다.
1. 개요
1.1 기본 개념
•
ANOVA(Analysis of Variance, 분산분석)는 3개 이상의 집단 평균 차이를 동시에 비교하기 위한 통계 기법입니다.
•
“집단 A, B, C 간에 종속변수(연속형)의 평균값이 서로 같은가?”를 검정할 때, 각 집단 간 평균 차이를 분산(Variance)을 이용해서 분석합니다.
•
한 가지 독립변수(요인 Factor)에 여러 수준(Level)이 존재하고, 종속변수가 연속형인 경우를 일원분산분석(One-way ANOVA)라고 부릅니다.
1.2 예시 시나리오
ANOVA
카이제곱 검정은 범주형(명목형) 자료를 분석할 때 핵심적인 통계적 방법이므로, 실제 연구나 실무에서 매우 자주 활용됩니다.
카이제곱(\chi^2) 검정의 이해
1. 개요
1.1 기본 개념
•
*카이제곱 검정(Chi-square test)**은 범주형 자료 간의 관계나 분포 적합도를 검정하는 데 사용되는 통계 기법입니다.
•
주로 독립성 검정(두 범주형 변수 사이에 연관성이 있는지), 적합도 검정(하나의 범주형 변수 분포가 특정 이론이나 기대 분포와 일치하는지), 동질성 검정(서로 다른 모집단들의 범주형 분포가 동일한지) 등에 활용됩니다.
1.2 범주형 자료 예시
카이제곱(χ2) 검정의 이해
1. 로지스틱 회귀분석(Logistic Regression)의 기본 개념
1.
이진 분류
2.
선형회귀와의 차이
3.
결과해석
2. 로지스틱 회귀의 수학적 배경
2.1 로짓(로그오즈) 함수
\text{로짓}(p) = \log\left(\frac{p}{1 - p}\right)
로지스트 회귀분석
Tukey HSD (Tukey’s Honest Significant Difference)란?
Tukey HSD 검정은 **분산 분석(ANOVA)**의 사후 분석(Post-hoc test) 방법으로,
ANOVA 결과에서 여러 그룹 간 평균 차이가 유의미하다고 판정된 경우, 어떤 그룹 간에 차이가 나는지를 구체적으로 확인하는 데 사용됩니다.
Tukey HSD의 주요 특징
1.
다중 비교 문제 해결
2.
균등한 표본 크기 및 분산 가정
3.
유의수준 조정
Tukey HSD
베이지안 추론(Bayesian inference)은 관측된 데이터와 기존의 사전 지식을 결합해, 불확실한 상황에서 확률적으로 추정과 의사결정을 내리는 통계적 방법론입니다51. 이 방법은 관측 이전의 믿음(사전 확률, prior)과 관측된 데이터(우도, likelihood)를 바탕으로, 관측 후의 믿음(사후 확률, posterior)을 계산하는 과정을 포함합니다.
베이지안 추론의 핵심 원리
•
베이즈 정리(Bayes’ theorem)에 기반합니다.
P(A∣B)=P(B)P(B∣A)⋅P(A)
•
사전 분포(prior distribution):
•
우도 함수(likelihood):
베이지안 추론이란?
갤러리 보기
ANN
Q1. 왜 “미니”-배치를 사용하는가?
미니 배치 훈련은 배치 경사 하강법과 확률적 경사 하강법(SGD)의 극단 사이에서 균형을 이룹니다. 여기에는 그 사용 이유가 있습니다:
•
수렴: 미니 배치는 SGD에 비해 더 안정적인 수렴을 제공합니다. 왜냐하면 경사 업데이트가 하나의 샘플이 아닌 여러 샘플에 대해 평균화되기 때문에, 단일 예제로부터의 경사보다 덜 노이즈가 있기 때문입니다. 그러나, 전체 데이터셋을 사용하여 단일 업데이트를 계산하는 배치 경사 하강법보다 데이터 변동성에 더 민감합니다.
•
메모리 사용: 전체 데이터셋에 대한 훈련(배치 경사 하강법)은 메모리를 많이 소모하고 대규모 데이터셋에 대해 비현실적일 수 있습니다. 미니 배치는 모델을 데이터의 부분집합에 대해 훈련할 수 있게 하여 메모리 요구사항을 상당히 줄입니다.
•
병렬 처리: 미니 배치 훈련은 병렬 처리에 적합합니다. 현대 하드웨어(예: GPU)는 미니 배치에 대한 계산을 동시에 수행할 수 있어, 훈련 시간을 크게 단축시킬 수 있습니다.
•
정규화 효과: 미니 배치와 함께 훈련하는 것은 최적화 과정에 노이즈를 도입하여, 모델이 손실 함수의 날카로운 최소값에 정착하는 것을 방지할 수 있습니다. 이 노이즈는 일종의 정규화로 작용하여, 모델이 보지 못한 데이터에 대한 일반화를 potencially 개선할 수 있습니다.
Deeplearning

AI
1. 활성화 함수란?
활성화 함수는 인공 신경망에서 뉴런의 출력 값을 결정하는 함수로, 입력 값에 비선형성을 부여하여 신경망이 복잡한 문제를 학습할 수 있도록 돕습니다. 비선형성을 도입함으로써 신경망은 단순한 선형 모델 이상의 복잡한 패턴을 학습할 수 있습니다. 각 활성화 함수는 고유한 특징과 사용 목적을 가지며, 특정 문제에 적합한 활성화 함수를 선택하는 것이 중요합니다.
2. 활성화 함수의 종류
인공 신경망에서 사용되는 활성화 함수는 여러 가지가 있으며, 각 함수는 특정한 상황에서 더 효과적으로 작동합니다. 주요 활성화 함수로는 렐루(ReLU)와 그 계열, 시그모이드(Sigmoid), 하이퍼볼릭 탄젠트(Tanh), 소프트맥스(Softmax), GELU, Swish 등이 있습니다.
2.1 렐루 (ReLU)와 렐루 계열
2.1.1 ReLU 특징
•
ReLU (Rectified Linear Unit): 음수 입력을 0으로, 양수 입력은 그대로 반환합니다.
활성화함수

신경망 학습에서 가중치를 업데이트

Backpropagation with a Multi-Layer Network

GNN(Graph Neural Networks) 장점 단점
CDP(Conditional Density Partitioning)
CDP(Conditional Density Partitioning)는 통계적 학습과 데이터 분석에서 사용되는 개념 중 하나입니다. CDP는 주어진 조건 하에서 데이터의 밀도를 분할하여 분석하는 방법론을 의미합니다. 이 기법은 특히 조건부 확률밀도 함수(Conditional Probability Density Function, CPDF)를 추정하고자 할 때 유용합니다.
CDP의 기본 아이디어는 조건부 확률밀도를 사용하여 데이터 공간을 여러 영역으로 나누고, 각 영역에서 데이터의 분포 특성을 분석하는 것입니다. 이를 통해 데이터의 복잡한 구조를 더 잘 이해하고, 예측 모델링, 클러스터링, 분류 등에 활용할 수 있습니다.
CDP를 수식으로 설명하면, 우리는 먼저 조건부 확률밀도함수 \(f(x|y)\)를 가정합니다. 여기서 \(x\)는 관심 있는 변수(예: 예측하고자 하는 값)이고, \(y\)는 조건을 나타내는 변수입니다. CDP는 주어진 \(y\)의 값에 따라 \(x\)의 분포가 어떻게 변하는지를 분석합니다.
조건부 확률밀도함수는 다음과 같이 정의됩니다:
\[ f(x|y) = \frac{f(x, y)}{f(y)} \]
여기서 \(f(x, y)\)는 \(x\)와 \(y\)의 결합 확률밀도함수이고, \(f(y)\)는 \(y\)의 주변 확률밀도함수입니다. 이 식은 \(y\)가 주어졌을 때 \(x\)의 확률밀도를 나타냅니다.
CDP는 이 조건부 확률밀도함수를 추정하고, 데이터 공간을 \(y\)의 다른 값에 따라 여러 영역으로 나눕니다. 각 영역에서 \(x\)의 분포를 분석함으로써, 우리는 \(x\)와 \(y\) 사이의 관계를 더 깊게 이해할 수 있습니다.
CDP 란?
갤러리 보기
오늘은 회귀 분석에서 많은 분들이 간과하기 쉬운 P-값에 대해 이야기해보려고 합니다. 회귀 분석에서 P-값은 선택 사항이 아닙니다. 이를 무시하면 잘못된 특성을 신뢰하게 될 수 있습니다.
P-값이란 무엇인가?
P-값은 통계학에서 중요한 개념으로, 회귀 모델에서는 특성(변수)의 계수가 실제로 0일 확률을 알려줍니다. 쉽게 말해, 이 값은 "이 특성이 실제로 모델에 가치를 더하고 있는가?"라는 질문에 답해줍니다.
통계적으로 이는 가설 검정 형태를 띠고 있습니다:
•
H₀(귀무가설): 특성 계수 = 0 (특성이 목표 변수에 영향을 미치지 않음)
•
H₁(대립가설): 특성 계수 ≠ 0 (특성이 목표 변수에 영향을 미침)
P-값이 낮다는 것은 "이 특성이 쓸모없을 가능성이 낮다 → 아마도 중요하다"는 것을 의미합니다.
P-값 계산 방법
회귀 모델에서 P-값의 중요성


