출처: NotebookLM 「오늘코드todaycode」 라벨 '공공 데이터' (영상 19개, 중복 제외 19개) · 2026.10.05 생성
[1/6~ 6/6 모음] 통계청 출생아수 데이터 분석하기
- 통계청 KOSIS 사이트에서 시도/시군구/월별/성별 출생아 수 데이터를 cp949 인코딩으로 판다스에 로드하였습니다.
- 통계표 형태로 요약된 데이터를 분석에 용이한 타이디 데이터(Tidy Data) 구조로 변환하기 위해
pd.melt()함수를 적용하였습니다. str.split('.')및expand=True옵션을 활용하여 연도, 월, 성별(남자/여자/전체) 파생변수를 정교하게 분리해냈습니다.- 데이터가 없는 대쉬(
-) 표기를np.nan결측치로 전환한 후 실수형으로 변환하여 평균 연산 시 왜곡을 방지하였습니다. sns.lineplot(),sns.barplot(),sns.pointplot()을 통해 연도별·월별 출생아 수 추이 및 계절성(1·3월 높음, 12월 낮음)을 관찰하였습니다.- 전국적인 출생아 수 급감 추세 속에서 세종특별자치시는 보육 환경 등의 요인으로 출생아 수가 유일하게 지속 증가함을 시각적으로 검증하였습니다.
- 그래프 작성 시 신뢰구간(
ci) 옵션 조정 및 범례(legend)를 외부로 배치(bbox_to_anchor)하여 시각화 가독성을 높였습니다.
국가통계포털 KOSIS 💰 경기종합지수 📈 ChatGPT와 함께 파이썬으로 분석하기
- KOSIS 경기종합지수 데이터 수집 시 시점 컬럼을 행으로 내리는 행렬 전환을 적용하여 다운로드 후 분석에 활용하였습니다.
koreanize_matplotlib라이브러리를 설치하여 별도의 복잡한 한글 폰트 설정 없이 차트의 한글 깨짐 문제를 해결하였습니다.- 대쉬(
-) 문자로 표기된 결측치를pd.to_numeric(..., errors='coerce')로 처리하여 수치형 데이터 타입으로 일괄 정제하였습니다. - ChatGPT에게
info(),describe()결과 및 마크다운 표를 전달하여 상관관계 분석 및 비즈니스 인사이트 도출을 유도하였습니다. - 선행종합지수와 코스피 지수 간의 강한 양의 상관관계(0.89) 및 CP 유통수익률과의 음의 상관관계를 확인하였습니다.
sns.heatmap()및sns.regplot()을 통해 회귀선을 시각화하고 상삼각 행렬 마스크(np.triu())를 적용한 깔끔한 히트맵을 구현하였습니다.- AI 생성 결과 중 수치나 시점에 대한 환각(Hallucination) 오류가 발생할 수 있으므로 실제 데이터 기반의 검증 절차가 필수적임을 확인하였습니다.
[1/5~5/5모음] 대한민국 인구통계 분석
- 위키피디아 '대한민국의 인구' 문서 내 HTML 테이블을 별도 크롤러 작성 없이
pd.read_html()단 한 줄로 파싱하였습니다. - 1925년부터 2019년까지의 추계 인구, 출생자 수, 사망자 수, 합계출산율 추이를 판다스로 로드하여 다루었습니다.
- 1950년대 전쟁 이후 100만 명대를 유지하던 출생아 수가 최근 30만 명대 이하로 급감하고 합계출산율이 0.92명까지 떨어진 현상을 파악하였습니다.
- Seaborn의
sns.pointplot(),sns.lineplot(),sns.barplot()및 Matplotlibplt.figure(figsize=...)를 활용하여 시각화하였습니다. - Mac(
AppleGothic)과 Windows(Malgun Gothic)의 OS별 한글 폰트 설정 및set_matplotlib_formats('retina')로 고해상도 출력을 적용하였습니다. - 데이터 슬라이싱(
-50:)을 통해 최근 50년간의 출생자 수와 사망자 수 교차 지점(데드크로스)을 시각적으로 검증하였습니다.
[2/6] 대한민국 출생아수 데이터 연도, 월, 성별, 텍스트 데이터 전처리
pd.melt()로 녹여낸 데이터의 베리어블 컬럼에서 문자열 접근자str.split('.')을 사용해 연도, 월, 성별 항목을 분리하였습니다.- 성별 컬럼의 결측치(
NaN)를fillna('전체')로 채우고, 문자 '1'과 '2'를replace()로 '남자', '여자' 텍스트로 변환하였습니다. - 판다스는 원본 변경을 위해 컬럼 재할당(
df['컬럼명'] = ...)을 명시적으로 수행해야 함을 확인하였습니다. rename(columns={...})을 활용해 컬럼명을 '기간', '출생아 수' 등 표준적이고 직관적인 명칭으로 수정하였습니다.- 단일 범주형 변수의 항목별 빈도수를 세기 위해
value_counts()함수를 적용하고 데이터의 치우침을 점검하였습니다.
통합 데이터지도 ② 중소중견기업 빅데이터 플랫폼 입사지원 공고 업종 및 직종 정보 API 활용 분석하기
- 통합 데이터지도 플랫폼에서 중소중견기업 빅데이터 플랫폼의 입사지원 공고 API를 발급받아 데이터를 수집하였습니다.
requests라이브러리로 500건 단위 페이징(from,to파라미터) 루프를 돌려 약 1만 건의 채용공고 데이터를 가져왔습니다.pd.concat()을 활용하여 여러 번 받아온 API 응답 JSON 리스트를 단일 데이터프레임으로 결합하였습니다.- 메모리 상의 수집 데이터를
to_csv(..., encoding='cp949')로 저장하여 엑셀 환경에서 한글 깨짐 없이 열 수 있도록 조치하였습니다. value_counts()및 Plotly Expresspx.histogram()을 활용해 경영·인사·총무·사무 및 IT/모바일 직군의 입사지원 빈도를 시각화하였습니다.
[통계청X오늘코드] 파이썬 활용 강좌 ④ 마이크로데이터 통합서비스(MDIS) 데이터 로드하기
- 통계청 MDIS(마이크로데이터 통합서비스) 사이트에 접속하여 경제활동인구조사 원자료(조사표 마이크로데이터) 추출 절차를 진행하였습니다.
- 비경제활동인구 중 취업 희망 여부, 취업 가능성, 구직 단념 사유, 구직 활동 유무 등 세부 설문 항목을 선별 수집하였습니다.
- 연령대 5세 단위 코드, 가중치 항목, 2020년 8월 특정 조사 연월 조건을 지정하여 추출 및 다운로드를 완료하였습니다.
- 주피터 노트북으로 원자료 CSV를 로드하여 정밀한 구직단념자 현황 분석 및 정책 데이터 가공 준비를 마쳤습니다.
[5/5] 추계 인구수 분석 1925년부터 인구추세는 어떻게 변화했을까?
- 위키피디아의 1925년~2019년 추계 인구 수 데이터를
sns.barplot(),sns.pointplot(),sns.lineplot()으로 시각화하였습니다. - 막대그래프 시각화 시
palette='Blues'그라데이션 옵션을 부여하여 연도별 인구 증가 추세를 직관적으로 표현하였습니다. - Matplotlib
plt.xticks(rotation=60)및figsize설정을 통해 축 라벨 겹침 문제를 깔끔하게 정리하였습니다. - 총인구수는 1,000만 명대에서 5,000만 명대로 꾸준히 성장했으나, 출생아 수 급감과 사망자 수 증가가 맞물리는 인구 구조 변화를 확인하였습니다.
- 웹 페이지 내 HTML 표를 파이썬 단 한 줄의
pd.read_html()로 수집하는 파이프라인의 효율성을 검증하였습니다.
[통계청X오늘코드] 파이썬 활용 강좌 ⑤ MDIS를 활용한 경제활동인구조사 데이터 전처리
- MDIS 경제활동인구조사 데이터의 연령대 5세 단위 코드를 파이썬 딕셔너리와
replace()로 구체적인 연령대 명칭으로 변경하였습니다. - 가중치(가중값 / 1,000) 연산을 적용하여 실제 추정 구직단념자 수 파생변수를 새로 생성하였습니다.
groupby('연령대')['구직단념자수'].sum()과reset_index()를 통해 연령대별 구직단념자 수를 집계하였습니다.- 문자열 접근자
str + '대'연산을 활용해 10대부터 60대 이상까지의 대범주 파생변수를 생성하고 재집계하였습니다. - 실제 언론 보도 시각화 수치와 일치하도록
round(-3)을 적용하여 천 단위 반올림 전처리를 수행하였습니다.
업무, 연구, 프로젝트에 대한 데이터가 필요할 때?! 어디에서 찾으시나요?! 통합데이터지도
- 공공 및 민간 데이터 플랫폼을 통합 연계해 주는 '통합 데이터지도(
bigdata-map.kr)' 플랫폼의 활용법을 다루었습니다. - 유통, 헬스케어, 소방안전, 환경 등 16대 빅데이터 플랫폼과 공공데이터포털, AI 허브 연계 데이터셋 탐색을 진행하였습니다.
- 연관 그래프, 연관도 점수, 융합 그래프, 데이터 내비게이션 기능을 이용한 유사 데이터셋 추천 및 탐색 기법을 확인하였습니다.
- 코로나19, ESG, 부동산 등 트렌드 이슈 데이터셋 및 우수 데이터 분석 사례(데이터 스토리)를 통한 아이디어 발굴법을 공유하였습니다.
지금까지 이런 데이터는 없었다?! 자원봉사자들이 한 땀 한 땀 모은 오픈와치 데이터
- 정보공개센터 자원봉사자들이 수집·정제하여 구축한 공직자 감시 전용 오픈 데이터 플랫폼 '오픈와치(
openwatch.kr)'를 소개하였습니다. - 국회의원 및 지방의원의 상세 이력, 겸직 현황(부동산 임대업 등), 재산 신고 내역, 정치후원금 집계 데이터를 탐색하였습니다.
- 의원들의 징계 의결 내역과 발의 안안 및 이해상충 가능성을 다각도로 분석할 수 있는 데이터 구조를 파악하였습니다.
- 권력 감시 및 공공성 강화를 목적으로 한 감시 데이터 활용 공모전과 시민 기술 참여의 사회적 가치를 확인하였습니다.
✈️ [2/2] 코로나 전후 🌏 지역별 항공수요 회복했을까?! 저가 항공사 여객, 편, 화물 수요 ChatGPT와 함께 국가통계포털 KOSIS 데이터 파이썬으로 분석하기 💺
- KOSIS 국제선 지역별(일본, 중국, 아시아, 미주, 유럽, 중동, 아프리카 등) 항공 통계 데이터를 수집하였습니다.
pd.read_csv()로드 후DT접근자(df['시점'].dt.year,df['시점'].dt.month)로 연도 및 월 파생변수를 정교하게 분리하였습니다.pd.crosstab()을 활용하여 연도별·지역별 여객 수, 운항 편수, 화물 톤수에 대한 교차표를 작성하였습니다.- Pandas Styler의
background_gradient(cmap='Oranges')및format('{:,.0f}')으로 천 단위 콤마와 히트맵을 적용하였습니다. - 2020~2021년 코로나19 여파로 국제선 여객 수가 급감했으나, 2023년 들어 코로나 이전(2019년) 수준으로 가파르게 회복되는 흐름을 확인하였습니다.
- 여객 수요 감소 시기에도 화물 운송량은 상대적으로 높은 수준을 유지하였던 차별적 특성을 시각화하였습니다.
[3/6] 대한민국 출생아수 분석 - 데이터 전처리 - 수치데이터 전처리 전국 전체 성별 색인하기
- KOSIS 출생아 수 데이터에서 수치형 컬럼이 문자열(오브젝트) 타입으로 인식된 원인을 점검하고 정제하였습니다.
- 수집 데이터 부재 항목에 들어간 대쉬(
-) 문자를np.nan결측치로 교체한 후astype(float)로 변환하였습니다. - 0으로 대체할 경우 평균값(
mean()) 계산 시 심각한 왜곡이 발생하므로 결측치(NaN)로 보존하는 전처리 원칙을 적용하였습니다. df.describe()를 통해 수치형 변수의 데이터 개수, 평균값(3,129명), 표준편차, 최소/최대값을 다각도로 확인하였습니다.- 불리언 인덱싱을 적용해 전국 단위 및 성별 '전체' 조건의 데이터만 색인(
df_all)하여 시각화 기반을 마련하였습니다.
[2/25] 서울 코로나19현황 파이썬으로 분석해 볼 내용들
- 서울시 홈페이지에서
pd.read_html()로 수집한 코로나19 확진자 현황 데이터의 전체 분석 로드맵을 수립하였습니다. - 확진일자 텍스트 데이터를 파이썬 날짜형(
datetime)으로 전환하여 월별, 주별, 요일별 파생변수를 생성하였습니다. - 일별 확진자 수, 누적 확진자 수 추이, 특정 날짜(3월 10일 등) 집단감염 최고 발생일 탐색 방안을 마련하였습니다.
- Pandas
style.background_gradient()를 사용하여 요일별·거주지별(구별) 확진자 빈도 히트맵을 구현하였습니다. - 접촉력, 입원 병원, 퇴원/사망 여부, 해외 유입 국가(유럽, 미주 등) 전처리 및 서브셋 분석 방향을 제시하였습니다.
[인프런 리뉴얼][7/10] 파리바게뜨와 뚜레쥬르 분석을 위한 텍스트 데이터 다루기
- 서울시 상권정보 데이터에서 제과점 대표 브랜드인 '파리바게뜨'와 '뚜레쥬르' 상호명 데이터를 추출하였습니다.
- 시리즈 문자열 접근자
str.contains('뚜레주르|뚜레쥬르'),str.contains('파리바게')를 활용해 검색 조건식을 작성하였습니다. - 얕은 복사로 인한 원본 데이터 오염을 방지하기 위해
.copy()를 명시적으로 써서 독립 데이터프레임(df_bread)을 생성하였습니다. - 상권업종대분류 중 제과점과 무관한 '학문/교육' 학원 매장 및 '파스쿠찌', '잠바주스' 등 타 브랜드 매장을 제거하였습니다.
loc색인을 활용하여 파리바게뜨와 뚜레쥬르 브랜드명을 명시하는 범주형 파생변수를 새로 정의하고fillna()로 보완하였습니다.
✈️ [1/2] 코로나 전후 🛩 항공사별 항공수요 회복했을까?! 저가 항공사 여객, 편, 화물 수요 ChatGPT 와 함께 국가통계포털 KOSIS 데이터 분석하기 💺
- KOSIS 항공사별(대한항공, 아시아나, 제주항공, 진에어, 티웨이 등) 운항 통계를 수집하고 합계 열을 제외하여 다운로드하였습니다.
glob모듈로 파일명을 자동 탐색하고, 인코딩 에러 발생 시 ChatGPT와의 대화를 통해cp949인코딩을 적용해 해결하였습니다.koreanize_matplotlib패키지 설치로 파이썬 시각화 시 발생하는 한글 폰트 깨짐 현상을 자동 보정하였습니다.str.split()과map(lambda x: ...)를 활용해 연도 및 월 수치형 파생변수를 정교하게 추출하였습니다.pd.crosstab()및background_gradient()로 연도별·항공사별 여객 수 추이를 히트맵으로 정밀하게 분석하였습니다.- 코로나19 기간 급감했던 LCC(저비용 항공사) 및 FSC(대형 항공사) 여객 수요가 2023년 들어 가파르게 회복되는 흐름을 관찰하였습니다.
[~/25] 서울시 코로나 19 발생동향 분석 소스코드, CSV 파일 다운로드 안내
- 서울시 코로나19 발생동향 데이터를 판다스만으로 웹 크롤링부터 전처리, 분석, 시각화까지 완료하는 프로젝트 구조를 안내하였습니다.
- 구글 코랩(Google Colab) 환경에서 즉시 실행 가능한 주피터 노트북(
.ipynb) 파일 및 CSV 데이터 다운로드 경로를 제공하였습니다. - 직접 코드를 타이핑하며 학습할 수 있는 실습용 파일과 모든 결과가 작성되어 있는 정답 코드를 구분하여 배포하였습니다.
- 인프런 강좌("단 2장의 문서로 데이터 분석과 시각화 뽀개기")를 통한 파이썬 소스코드 상세 해설 연계 방안을 제시하였습니다.
[통계청X오늘코드] 파이썬 활용 TIP_①국가통계포털(KOSIS)자료로 데이터 로드하기
- KOSIS(국가통계포털) 사이트 구조 및 주제별(인구, 사회, 물가, 노동 등) 공공 통계자료의 분석적 가치를 설명하였습니다.
- 소비자물가지수 품목별 통계표 조회 시 시점 컬럼 변수화를 위해 웹사이트 내 '행렬 전환' 옵션을 설정하였습니다.
- 2019년 9월부터 2021년 9월까지 전년 동월 대비 물가 변화율 분석을 위한 CSV 파일을 다운로드하고 로드하였습니다.
cp949한글 인코딩 지정 및df.info(),df.shape를 활용하여 12,150개 행의 데이터 구조를 정확히 점검하였습니다.
통합 데이터지도 ① 통신 빅데이터 플랫폼-기상정보를 활용한 배달 품목의 차이
- 통합 데이터지도에서 통신 빅데이터 플랫폼의 '날씨별 배달 품목 차이' 무료 데이터셋을 수집하였습니다.
glob모듈로 분할된 3개의 CSV 파일을 불러와pd.concat()으로 38만 건 규모의 데이터프레임으로 병합하였습니다.- 함께 제공되는 테이블 정의서 엑셀 파일을 로드하여 숫자 컬럼명(0~26)을 한글 음식 분류명(한식, 치킨, 피자 등)으로 자동 변환하였습니다.
pd.melt()를 적용해 와이드 폼 데이터를 롱 폼(타이디 데이터) 구조로 변환함으로써 분석 편의성을 극대화하였습니다.- 강수 유형 및 시간대별 배달 주문 건수 평균을 분석하여 눈/진눈깨비가 오는 날 기름진 음식 및 치킨 주문량이 늘어남을 확인하였습니다.
- Plotly Express
px.histogram()및 Seabornsns.barplot()을 활용하여 대화형 및 정적 배달 패턴 차트를 구현하였습니다.
[6/6] 출생아수가 늘어나는 지역이 있다? (feat.통계청)
- 저출산 현상 심화(신생아 수 27만 명, 합계출산율 0.8명 예상) 관련 기사 내용을 바탕으로 데이터 가설 검증을 수행하였습니다.
- KOSIS 시도별 출생아 수 데이터에서 전국 합계 데이터를 제외하고 시도별 서브셋(
df_local)만 추출하였습니다. sns.pointplot()시각화 시bbox_to_anchor옵션을 사용하여 범례(Legend)를 그래프 외부로 깔끔하게 정돈하였습니다.- 경기도와 서울특별시가 절대적인 인구 규모로 인해 출생아 수가 가장 많으나 전반적으로 급감하는 추세를 확인하였습니다.
- 세종특별자치시는 우수한 보육 여건 등의 요인으로 2012년 이후 전국에서 유일하게 출생아 수가 지속적으로 증가하는 양상을 검증하였습니다.
라벨 종합 정리
- 본 영상 모음은 KOSIS, MDIS, 통합데이터지도, 서울시 공공데이터, 위키피디아 등 다양한 공공·민간 데이터 원천을 수집하고 활용하는 실무 방법론을 다룹니다.
- 판다스(Pandas)의
melt(),crosstab(),read_html(), 문자열 접근자(str) 및 인코딩(cp949) 전처리를 통해 복잡한 데이터를 분석하기 좋은 타이디 데이터(Tidy Data)로 가공합니다. - Matplotlib, Seaborn, Plotly 시각화와 ChatGPT AI 도구를 결합하여 인구 구조 변화, 항공 수요 회복, 경기지수, 배달 패턴 등 현실 사회 및 비즈니스 문제의 핵심 인사이트를 효과적으로 도출합니다.