출처: NotebookLM 「오늘코드todaycode」 라벨 '캐글 분석' (영상 12개, 중복 제외 12개) · 2026.10.05 생성
[1/13] 🗂전세계 데이터 사이언티스트들의 연령대? 관심사? 고용상태? 임금? 📊 이 궁금하다면? - 2020 kaggle survey
- 캐글(Kaggle)에서는 매년 머신러닝 및 데이터 사이언스 설문조사(Kaggle ML & DS Survey)를 진행하며, 전 세계 유저들의 응답 데이터셋을 공개합니다.
- 설문조사 리포트를 통해 데이터 사이언티스트의 연령대, 성별, 학위, 국가, 고용 상태, 사용 기술 등 다양한 프로필 정보를 파악할 수 있습니다.
- 머신러닝 라이브러리 중 사이킷런(Scikit-learn), 텐서플로우(TensorFlow), 파이토치(PyTorch) 등의 인기도와 국가별·학위별 기술 활용 현황을 살펴볼 수 있습니다.
- 캐글 사용자 성별은 남성이 여성보다 훨씬 높으며, 연령대는 20대 초반에서 30대 중반에 가장 많이 분포되어 있습니다.
- 유저 국가별 비중은 인도가 가장 높고 미국, 브라질, 영국, 러시아, 프랑스가 그 뒤를 이으며 한국의 위치도 확인할 수 있습니다.
- 온라인 교육 플랫폼 선호도와 학습 경로를 파악할 수 있어 데이터 사이언스를 처음 시작하는 입문자 분석 데이터셋으로 매우 추천됩니다.
[1/13~13/13 모음] 2020 kaggle survey 캐글 설문조사로 데이터 분석 입문하기
- 캐글(Kaggle)은 전 세계 데이터 사이언티스트들이 경진대회(Competitions), 데이터셋(Datasets), 주피터 노트북(Notebooks) 공유, 커뮤니티 토론을 진행하는 글로벌 플랫폼입니다.
- 캐글 설문조사 데이터(2020 Kaggle Survey)는 20,000개 이상의 응답과 355개 컬럼으로 구성되어 있으며, 0번 행에 질문 내용이 담겨 있습니다.
- 판다스(Pandas)의
filter(regex=...)기능과describe(),value_counts()를 활용하면 단일 선택 및 다중 선택(Multiple Choice) 문항을 손쉽게 정제할 수 있습니다. - 사용자 정의 함수(
show_count_plot,show_plot_by_qno)를 구축하여 질문 번호만 넘기면 빈도수 집계와 시각화 막대그래프(Seabornbarplot,countplot)가 출력되도록 자동화했습니다. - 성별, 연령대, 국가, 학위, 직업, 코딩 경력, 선호 프로그래밍 언어(파이썬, SQL, R 순), 개발 환경(Jupyter, VS Code) 등 전 세계 데이터 인력의 실태를 파악할 수 있습니다.
- 캐글 웹 환경의 노트북을
Copy & Edit하거나 로컬 컴퓨터로 주피터 노트북 파일(.ipynb)을 다운로드하여 직접 실행 및 분석해 볼 수 있습니다.
[2/13] 캐글은? 경진대회? 데이터셋? 노트북? 랭킹? 노트북을 만들어 경진대회의 데이터셋 분석해 보기
- 캐글의 주요 메뉴 구조(Competitions, Data, Notebooks, Community, Courses, More)와 핵심 기능들을 소개합니다.
- 경진대회(Competitions)는 다양한 기업 및 기관 문제 해결을 겨루며 상금, 리쿠르팅 채용 기회, 타이타닉 같은 입문용 튜토리얼을 제공합니다.
- 데이터(Data) 탭에서는 다른 유저들이 공유한 공공 데이터셋(코로나19 데이터 등)을 자유롭게 다운로드하고 직접 새 데이터셋을 업로드할 수 있습니다.
- 노트북(Notebooks) 탭에서는 다른 분석가들의 주피터 노트북 시각화 분석 사례를 탐색하고 'Most Votes' 필터로 우수한 코드를 학습할 수 있습니다.
- 유저 랭킹 시스템(Grandmaster, Master, Expert, Contributor, Novice)과 티어 등급 체계를 다룹니다.
- 캐글 노트북 페이지에서
Copy & Edit버튼을 클릭하면 컴페티션 룰 동의 후 사본 노트북을 생성하여 자신의 계정에서 직접 실행 및 수정이 가능합니다.
[3/13] 캐글 사용자의 연령대와 성별은 어떻게 될까?
- 2020 캐글 설문조사 데이터셋(
2020_responses.csv)을pd.read_csv()로 로드하고low_memory=False옵션으로 타입 혼용 경고를 처리합니다. - 데이터프레임의 0번 행에는 질문 텍스트가 들어있어
iloc으로 질문(question) 변수에 저장하고,drop(0)을 적용해 답변 데이터(answer)로 분리합니다. - 첫 번째 질문(Q1, 연령대)에 대한 응답을
value_counts()및normalize=True로 집계하여 비율(%)을 구합니다. - 분석 결과 25~29세(약 20%), 22~24세(약 18%), 18~21세(약 17%) 순으로 20~30대 젊은 연령층 응답자가 다수를 차지함을 확인합니다.
- 두 번째 질문(Q2, 성별) 분석 결과 남성 응답자가 여성 응답자에 비해 압도적으로 높은 비중을 차지함을 확인합니다.
sns.countplot()에 Seaborn 팔레트(palette='Blues_r')와sort_values()정렬을 적용하여 연령대 및 성별 빈도수를 직관적인 막대그래프로 시각화합니다.
[5/13] multiple choice 컬럼의 응답값 빈도수는 어떻게 구할까?
- 단일 선택 문항(Q1~Q6)과 달리 Q7부터 시작하는 다중 선택(Multiple Choice) 문항은 파트(Part_1, Part_2...) 형태의 여러 컬럼으로 분할되어 있습니다.
- 판다스
filter(regex='Q7')기능을 활용하여 Q7과 연관된 13개 컬럼 전체를 정규표현식으로 한 번에 필터링해 가져옵니다. - 필터링된 다중 선택 컬럼 데이터프레임에
.describe()를 실행하면 각 파트별 가장 많이 응답된 단일 텍스트(Top)와 응답 빈도수(Count)를 추출할 수 있습니다. .loc[['top', 'count']]색인 및 전치 행렬(.T) 변환을 적용하여 선택지 항목명과 실제 응답 빈도수로 구성된 전처리 데이터프레임을 생성합니다.- 정제된 빈도수 데이터프레임의
sort_values(by='count', ascending=False)정렬을 통해 항목별 순위를 도출합니다. - Q7(사용 프로그래밍 언어) 분석 결과 파이썬(Python)이 가장 압도적인 사용량을 보였으며, 그 뒤를 이어 SQL, R, C++, 자바(Java), C, 자바스크립트 순으로 나타났습니다.
[6/13] 캐글러가 주로 사용하는 언어는? 파이썬? R? SQL?!
- 다중 선택 질문(Q7)의 정제된 응답 데이터프레임을
sns.barplot()에 전달하여 시각화 차트를 구축합니다. palette='Blues_r'옵션을 적용하여 가장 응답수가 많은 언어 항목일수록 진한 색상이 칠해지도록 시각적 그라데이션을 적용합니다.- 질문 원문 텍스트에서 타이틀 텍스트를 추출하기 위해
split('-')연산으로 대시 기호를 기준으로 질문 문구만 가공해 차트 제목(ax.set_title)으로 지정합니다. - Q7 언어 분석 결과, 파이썬(Python) 응답수가 약 15,000건 이상으로 2위인 SQL과 3위인 R(약 4,200건)에 비해 3배 이상 높은 사용률을 기록했습니다.
- R과 파이썬을 비교했을 때 파이썬 사용자가 압도적으로 우세하며 C++, 자바, C, 자바스크립트, 매트랩(MATLAB) 등이 뒤를 따랐습니다.
- 다중 선택 질문 정제 기법과 시각화 함수 로직을 모듈화하여 다른 다중 선택 문항 분석에도 동일하게 재사용할 수 있는 기반을 다졌습니다.
[9/13] 여러 답변을 함께 분석하고 싶다면?-2020 kaggle survey
- 두 개의 범주형 질문(예: Q1 연령대 x Q2 성별, Q3 국가 x Q2 성별)을 동시에 비교 집계하기 위해
pd.crosstab()교차표를 사용합니다. pd.crosstab(answer['Q1'], answer['Q2'])를 실행하여 연령대별 남성/여성/기타 성별 응답자 수를 행렬 표 형태로 산출합니다.- 교차표 데이터프레임에
.plot.bar()또는.plot.barh()를 호출하여 판다스 내장 시각화로 연령대별 성별 분포를 나란히 비교합니다. - Seaborn의
sns.countplot(data=answer, x='Q1', hue='Q2')를 사용해 동일한 교차 빈도수를 색상별 막대 범주로 깔끔하게 그래프화합니다. - 단일 선택 문항과 다중 선택 문항(Q2 성별 x Q7 언어)을 함께 분석할 때는
filter로 Q7 컬럼을 구한 뒤groupby('Q2')로 그룹화 연산을 적용합니다. - 그룹화된 데이터프레임을 전치(
.T) 및 정렬하여 여성과 남성이 각각 선호하는 프로그래밍 언어 순위(남녀 모두 파이썬 > SQL > R 순)와 비중 차이를 교차 검증합니다.
[10/13] 7번~23번 하나의 함수로 모든 질문 분석하기 - kaggle survey
- 단일 선택 문항인지 다중 선택 문항인지를
Q_NO in answer.columns조건문으로 판단하여 정제 및 시각화를 자동 처리하는show_plot_by_qno()통합 함수를 정의합니다. - Q8(입문자 추천 언어): 파이썬(Python)이 압도적 1위를 기록하여 데이터 사이언티스트 지망생에게 파이썬 추천이 대세임을 증명했습니다.
- Q9(통합 개발 환경 IDE): 주피터 노트북(Jupyter Notebook)이 1위, VS Code가 2위, 파이참(PyCharm)과 RStudio가 그 뒤를 이었습니다.
- Q10(호스팅 노트북): 구글 콜랩(Google Colab)과 캐글 노트북(Kaggle Notebooks)이 가장 높은 사용률을 나타냈습니다.
- Q14(시각화 라이브러리): 매트플롯립(Matplotlib)과 씨본(Seaborn)이 최상위권이며, Plotly와 ggplot이 뒤를 이었습니다.
- Q16(머신러닝 프레임워크): 사이킷런(Scikit-learn)이 1위, 텐서플로우/케라스가 2위, 파이토치(PyTorch)가 3위를 기록했습니다.
- Q17(알고리즘): 선형/로지스틱 회귀(Linear/Logistic Regression) 및 의사결정나무/랜덤포레스트가 가장 흔히 사용되는 기본 모델로 집계되었습니다.
[11/13] 💵 전세계 캐글러의 연봉은 얼마나 될까? 💰
- Q24 문항인 캐글 응답자들의 연봉(Salary Range) 데이터를 탐색하고 정렬 문제점을 분석합니다.
- 연봉 데이터가 '\$0-999', '\$10,000-14,999' 같은 문자열 구간으로 되어 있어 기본 정렬 시 알파벳 순서대로 엉키는 현상이 발생합니다.
- 문자열 연봉 구간을 수치 순서대로 정렬하기 위해
str.split('-')으로 최소 연봉 수치를 분리하고, 달러($) 및 콤마(,), 꺾쇠 문자를 제거합니다. - 정제된 최소 연봉 수치를 정수형(
int) 파생변수(min_salary)로 변환한 후 이를 기준으로 전체 연봉 구간 인덱스를 올바르게 정렬합니다. - 수치 순으로 정렬된 연봉 분포를 시각화한 결과, 전 세계 기준 \$0-999 구간(학생 및 취준생 비중)이 가장 많고 \$10,000-14,999 구간이 그 다음 비중을 차지합니다.
- 국가별 연봉 차이를 확인하기 위해 미국(USA)과 한국(South Korea) 응답자만 필터링하여 연봉 분포를 비교합니다.
- 미국 캐글러의 경우 \$100,000~\$150,000(약 1억~1억 5천만 원) 고연봉 구간에 응답자가 집중되어 있는 반면, 한국은 \$30,000 부근 및 다양한 구간에 분포함을 시각화로 확인합니다.
[12/13] 캐글러는 어떤 툴과 제품 환경에서 분석과 머신러닝 모델을 구현할까?
- Q25~Q39 문항을 통해 클라우드, 데이터베이스, BI 툴, 오토ML, 머신러닝 운영 툴 등 캐글러들의 기술 스택을 분석합니다.
- Q26(클라우드 플랫폼): AWS가 가장 많이 사용되며, 구글 클라우드(GCP)와 마이크로소프트 애저(Azure)가 뒤를 잇고 있습니다.
- Q29&Q30(빅데이터/DB): MySQL, PostgreSQL, MS SQL Server 등 관계형 데이터베이스(RDBMS) 사용률이 가장 높고, 몽고DB(MongoDB)와 빅쿼리(BigQuery)도 활용됩니다.
- Q31&Q32(BI 툴): 태블로(Tableau)와 파워BI(Power BI), 구글 데이터 스튜디오(Looker Studio)가 가장 대표적인 비즈니스 인텔리전스 시각화 도구로 집계됩니다.
- Q34(AutoML): Auto-Sklearn, Auto-Keras, 구글 클라우드 AutoML 등이 주로 활용됩니다.
- Q35(ML 실험 관리): 텐서보드(TensorBoard)와 权重&바이아스(Weights & Biases)가 머신러닝 파라미터 및 손실 추적용 툴로 주목받고 있습니다.
- Q37&Q39(학습 플랫폼 및 미디어): 코세라(Coursera), 캐글 코스, 유데미(Udemy)에서 주로 학습하며, 미디어 채널로는 캐글, 유튜브, 블로그, 트위터를 통해 최신 데이터 과학 정보를 얻습니다.
[13/13] 캐글노트북을 내 컴퓨터에서 편집하고 싶다면?
- 캐글 웹상에서 작성되거나 다른 유저가 공개한 주피터 노트북을 자신의 로컬 컴퓨터(Jupyter Notebook / VS Code)로 가져와 편집하는 방법을 설명합니다.
- 캐글 노트북 상단 메뉴의
File->Download Notebook을 클릭하여.ipynb확장자 파일로 다운로드합니다. - 다운로드한
.ipynb파일을 로컬 작업 디렉토리 폴더로 이동시키고 주피터 노트북에서 실행합니다. - 캐글 전용 경로로 설정되어 있는 데이터 로드 코드(
../input/...)에서 캐글 입력 경로 부분을 주석 처리하거나 로컬 디렉토리 경로로 수정합니다. - 해당 경진대회의 데이터셋 CSV 파일(
2020_responses.csv)을 캐글 페이지의 Data 탭에서 직접 다운로드하여 로컬 노트북과 동일한 폴더에 위치시킵니다. pd.read_csv('2020_responses.csv')코드로 로컬 환경에서 동일하게 데이터를 불러와 인터넷 연결에 의존하지 않고 자유롭게 코드를 수정하고 실습을 이어갑니다.
캐글에서 길을 잃었다면?! 머신러닝 딥러닝 문제해결전략 📜 공략집과 📝 체크리스트
- 신간 도서 '머신러닝 딥러닝 문제해결전략'의 핵심 내용과 캐글/데이콘 경진대회 공략 체크리스트 및 공략집(미니맵)을 소개합니다.
- 경진대회 참여 시 필수적으로 거쳐야 하는 데이터 탐색(EDA), 시각화, 베이스라인 모델 구축, 성능 검증 평가 지표 선정 등 표준 프로세스를 체계적으로 정돈했습니다.
- 피처 엔지니어링 단계에서 체크해야 할 결측치 처리, 인코딩, 데이터 타입 변경(다운캐스팅), 불필요한 피처 제거, 피처 스케일링 항목을 체크리스트로 제공합니다.
- 저자가 공개한 깃허브 저장소를 통해 전체 경진대회 문제 해결 프로세스 체크리스트 및 맵을 무료로 확인하고 다운로드할 수 있습니다.
- 정형 데이터 분류·회귀부터 비정형 이미지/텍스트 딥러닝 문제까지 다양한 실제 캐글 경진대회 예제를 바탕으로 실전 문제 해결 능력을 키울 수 있도록 안내합니다.
- 이론에만 머물지 않고 캐글 환경에서 직접 실행하며 배우는 'Learn by doing' 습관과 체크리스트 기반의 체계적인 모델 성능 개선 접근법을 강조합니다.
라벨 종합 정리
이 영상 시리즈는 전 세계 데이터 인력의 실태를 다룬 2020 캐글 설문조사 데이터셋을 판다스(Pandas)와 씨본(Seaborn)으로 직접 정제·시각화하며 데이터 분석에 입문하는 과정을 다룹니다.
데이터 사이언티스트들이 가장 많이 사용하는 언어인 파이썬(Python)과 사이킷런, 주피터 노트북, 구글 콜랩 등 표준 기술 스택을 파악하고, 단일/다중 선택 문항 처리 및 교차표(crosstab), 함수 모듈화 기법을 습득합니다.
또한 캐글 노트북 다운로드 및 로컬 환경 실습법과 경진대회용 피처 엔지니어링 체크리스트를 활용하여 실제 실무·경진대회 데이터 문제 해결 역량을 체계적으로 완성하도록 돕습니다.
💡 다음 단계 제안: 필요하시다면 이번 캐글 분석 요약본을 바탕으로 한 페이지 개요 보고서나 슬라이드 대본 형태로 가공해 드릴 수 있습니다. 원하시는 형태가 있으신가요?