전체 29

AARRR 프레임워크

AARRR 프레임워크란? 사용자 여정을 5단계로 분석하는 방법서비스가 성장하려면 단순히 사용자를 많이 모으는 것만으로는 부족하다.사용자가 어디에서 유입되고, 서비스의 가치를 경험하고, 다시 돌아오며, 결제하고, 다른 사람에게 추천하는지까지 전체 흐름을 확인해야 한다.이러한 사용자 여정을 5단계로 나누어 분석하는 프레임워크가 AARRR이다.AARRR이란?AARRR은 다음 다섯 단계의 앞 글자를 딴 이름이다.Acquisition → Activation → Retention → Revenue → Referral유입 → 활성화 → 유지 → 수익 → 추천해적의 외침인 AARRR과 비슷하다고 해서 해적 지표(Pirate Metrics)라고도 부른다.단계핵심 질문Acquisition사용자는 어디에서 들어오는가?Act..

Data Analysis 2026.08.05

리텐션 - classic, range, rolling

리텐션 분석의 3가지 방법: Classic, Range, Rolling Retention서비스에 들어온 사용자가 시간이 지난 뒤에도 다시 돌아오는지를 보여주는 지표가 리텐션(Retention)이다.신규 사용자가 계속 유입되더라도 대부분 한 번만 이용하고 떠난다면 서비스가 안정적으로 성장하기 어렵다. 따라서 사용자 수뿐만 아니라 얼마나 많은 사용자가 다시 돌아오는지를 함께 확인해야 한다.리텐션이란?리텐션은 처음 서비스를 이용한 사용자 중 일정 시간이 지난 뒤 다시 서비스를 이용한 사용자의 비율이다.리텐션 = 재방문 사용자 수 ÷ 최초 사용자 수 × 100예를 들어 가입자 100명 중 7일 뒤 다시 서비스를 이용한 사용자가 20명이라면 리텐션은 20%다.리텐션을 계산하려면 먼저 두 가지 행동을 정해야 한다...

Data Analysis 2026.08.05

Airflow

Apache Airflow란? DAG·Task·Operator 핵심 개념 정리Apache Airflow는 데이터 수집, 전처리, 저장과 같은 여러 작업의 실행 순서와 일정, 의존관계를 관리하는 워크플로 오케스트레이션 도구다.Airflow가 직접 데이터를 분석하는 것은 아니다. 어떤 작업을 언제 실행하고, 앞선 작업이 성공했을 때 어떤 작업을 이어서 실행할지를 관리한다.예를 들어 일일 매출 데이터 파이프라인을 다음과 같이 자동화할 수 있다.주문 데이터 수집→ 데이터 전처리→ 데이터베이스 저장→ 매출 보고서 생성→ 완료 알림 Airflow의 핵심 구성 요소Airflow의 기본 구조는 다음 세 가지 개념으로 이해할 수 있다.구성 요소의미DAG전체 작업 흐름과 실행 순서를 정의TaskDAG 안에서 실제로 실행되..

Git 브랜치

Git 브랜치란? 사용하는 이유와 기본 흐름Git은 파일의 변경 이력을 기록하고 관리하는 분산 버전 관리 시스템이다.코드가 언제, 어떻게 변경되었는지 기록할 수 있으며 문제가 발생하면 이전 상태로 되돌릴 수 있다. 여러 사람이 같은 프로젝트를 함께 작업할 때도 각자의 변경 내용을 관리하고 병합할 수 있다.브랜치란?브랜치(Branch)는 기존 코드에서 독립적으로 작업할 수 있도록 만든 별도의 작업 흐름이다.기본 브랜치인 main을 직접 수정하지 않고 새로운 브랜치를 만들어 기능을 개발하거나 오류를 수정할 수 있다.main └─ feature/login feature/login 브랜치에서 로그인 기능을 개발하더라도 main 브랜치의 코드는 그대로 유지된다.작업이 완료되면 변경 내용을 검토한 뒤 main에 병..

Data Analysis/Git 2026.07.31

절대 경로와 상대 경로

절대 경로와 상대 경로의 차이파일이나 폴더의 위치를 나타내는 방법에는 절대 경로와 상대 경로가 있다.두 방식의 차이는 경로를 어디에서부터 시작해서 표현하는지에 있다.절대 경로란?절대 경로(Absolute Path)는 파일이나 폴더의 위치를 최상위 디렉터리부터 전체 경로로 표현하는 방식이다.현재 작업 위치와 관계없이 항상 같은 파일을 가리킨다.Windows 예시C:\Users\user\project\data.csv Linux·macOS 예시/home/user/project/data.csv 절대 경로는 파일의 위치를 명확하게 지정할 수 있지만, 사용자명이나 폴더 구조가 다른 컴퓨터에서는 그대로 사용할 수 없다는 단점이 있다.상대 경로란?상대 경로(Relative Path)는 현재 작업 중인 폴더를 기준으로 ..

장바구니 분석

장바구니 분석이란? Support·Confidence·Lift 해석하기장바구니 분석(Market Basket Analysis)은 고객의 거래 데이터를 바탕으로 어떤 상품이 함께 구매되는지 찾는 분석 방법이다.예를 들어 Coffee를 구매한 고객이 Toast도 자주 구매한다면 다음과 같은 연관 규칙을 만들 수 있다.Coffee → Toast 이는 Coffee를 구매했을 때 Toast도 함께 구매하는 경향이 있다는 의미다.장바구니 분석은 상품 추천, 세트 메뉴 구성, 프로모션 기획 등 고객의 추가 구매를 유도하는 데 활용할 수 있다.장바구니 분석의 활용 사례활용 사례설명비즈니스 활용교차 판매함께 구매되는 상품 추천추가 구매 유도상품 진열 최적화연관 상품을 가까이 배치고객 편의와 충동구매 증가추천 시스템구매 ..

Data Analysis 2026.07.31

주성분 분석과 요인 분석

주성분 분석과 요인 분석의 차이주성분 분석(PCA)과 요인 분석(FA)은 모두 여러 변수를 더 적은 수의 변수로 줄이는 방법이다.하지만 목적은 다르다.주성분 분석: 기존 변수의 정보를 최대한 유지하면서 차원을 축소요인 분석: 관측된 변수에 공통으로 영향을 주는 잠재 요인을 발견주성분 분석이란?주성분 분석(Principal Component Analysis)은 여러 변수의 정보를 서로 독립적인 새로운 변수인 주성분으로 압축하는 방법이다.첫 번째 주성분은 전체 데이터의 변동을 가장 많이 설명하고, 두 번째 주성분은 첫 번째 주성분과 겹치지 않는 범위에서 남은 변동을 최대한 설명한다.기존 변수 여러 개→ 정보가 많이 담긴 소수의 주성분으로 변환 예를 들어 고객 데이터에 다음 변수가 있다고 가정한다.구매 횟수구..

부스팅

부스팅이란?부스팅(Boosting)은 여러 개의 약한 모델을 순차적으로 학습시키고, 이전 모델의 오류를 다음 모델이 보완하도록 만드는 앙상블 학습 방법이다.하나의 복잡한 모델을 만드는 대신 성능이 낮은 여러 모델을 이어 붙여 강한 예측 모델을 만든다.주로 얕은 결정트리를 기본 모델로 사용하며, 분류와 회귀 문제 모두에 활용할 수 있다.부스팅의 학습 방식부스팅은 모델을 동시에 만드는 것이 아니라 순서대로 학습한다.첫 번째 모델 학습→ 잘못 예측한 데이터 확인→ 두 번째 모델이 이전 오류를 보완→ 다음 모델이 남은 오류를 다시 보완→ 여러 모델의 결과를 결합 예를 들어 첫 번째 트리가 결제 고객 일부를 미결제로 잘못 예측했다면, 다음 트리는 해당 데이터를 더 잘 맞히는 방향으로 학습한다.이 과정을 반복하면서..

결정트리

결정트리란?결정트리(Decision Tree)는 데이터를 여러 조건으로 반복해서 나누며 결과를 예측하는 머신러닝 알고리즘이다.사람이 의사결정을 내리는 방식처럼 “이 조건을 만족하는가?”를 순서대로 판단하기 때문에 결과를 이해하고 설명하기 쉽다.분류와 회귀 문제에 모두 사용할 수 있다.분류: 결제 여부, 이탈 여부, 불량 여부 예측회귀: 매출, 가격, 수요량 등 연속적인 값 예측결정트리의 구조결정트리는 다음 세 가지 요소로 구성된다.구성 요소의미루트 노드가장 먼저 데이터를 나누는 시작점내부 노드특정 조건에 따라 데이터를 분할하는 지점리프 노드최종 예측 결과가 결정되는 지점예를 들어 고객의 결제 여부를 예측한다면 다음과 같은 구조를 만들 수 있다.방문 횟수 ≥ 3회?├─ 아니오 → 미결제└─ 예 └─ 평..

K-폴드 교차

K-폴드 교차 검증이란?K-폴드 교차 검증(K-Fold Cross Validation)은 데이터를 K개의 구간으로 나누고, 학습과 검증을 반복하여 모델의 성능을 평가하는 방법이다.한 번만 학습·검증 데이터를 나누는 방식보다 데이터 분할에 따른 우연을 줄이고, 모델의 일반화 성능을 더 안정적으로 확인할 수 있다.K-폴드 진행 방식데이터를 5개 구간으로 나누는 5-Fold를 예로 들면 다음과 같다.1회차: 1번 검증 / 나머지 학습2회차: 2번 검증 / 나머지 학습3회차: 3번 검증 / 나머지 학습4회차: 4번 검증 / 나머지 학습5회차: 5번 검증 / 나머지 학습 각 구간이 한 번씩 검증 데이터로 사용되며, 마지막에는 5번의 평가 점수를 평균 내어 최종 성능으로 사용한다.장점모든 데이터를 학습과 검증에 활..