출처: NotebookLM 「오토코더의 인공지능 및 업무 자동화 완벽 가이드」 라벨 '데이터 추출 및 크롤링' (영상 7개, 중복 제외 7개) · 2026.10.04 생성
선택하신 7개 영상 소스의 내용을 바탕으로 요청하신 양식에 맞추어 작성한 요약본입니다.
챕터 1: 11번가 베스트 정보를 엑셀로 추출하는 방법을 보여드리겠습니다. (1) (Feat. RPA)
- 프로젝트 개요: MS Power Automate Desktop(PAD)을 활용해 11번가 베스트셀러 상품 정보를 엑셀로 자동 추출하는 RPA 워크플로우 기획 및 개념을 설명합니다.
- PAD 사용의 메리트: 윈도우 OS(Windows 11 내장, Win 10 다운로드 가능)에 무료로 제공되어 접근성이 뛰어나며, 코드 없이 그래픽 유저 인터페이스(GUI) 환경에서 자동화를 구현할 수 있습니다.
- 좌측 작업 창과 태스크 흐름: 좌측의 다양한 태스크 블록을 중앙 워크플로우 화면으로 드래그 앤 드롭하여 흐름을 유기적으로 배치하고 순차 실행하는 작동 원리를 다룹니다.
- 우측 변수 영역의 역할: 프로세스가 실행되면서 수집되거나 변경되는 데이터 값이 우측 변수 창에 실시간으로 저장 및 모니터링되어 로직 제어에 활용됩니다.
- RPA 실행 시 제약 사항: 실행 도중 사용자의 마우스/키보드 개입이 있으면 충돌 및 오류가 발생하므로, 실무 환경에서는 별도 가상 머신(VM)이나 전용 PC 환경 구축을 권장합니다.
- 하위 흐름(Sub-flow) 구조: 독립된 하위 흐름으로 점프하여 특정 모듈을 수행하고 다시 돌아오는 방식으로 복잡한 워크플로우를 체계적으로 관리할 수 있습니다.
- 단 3줄 흐름 기반 데이터베이스 수집 예고: 차회 실습에서 복잡한 코드 없이 불과 3개의 태스크 블록만으로 11번가 베스트셀러 전체 데이터베이스를 추출하는 과정을 예고합니다.
챕터 2: 실시간 검색어 자동 수집! 파이썬으로 주기적 엑셀 저장하기 (자동화 완전정복)
- 실습 목표 및 개요: 파이썬과 생성형 AI(ChatGPT)를 활용해 웹사이트(시그널 뉴스 등)의 실시간 검색어 데이터를 주기적으로 수집하고 엑셀 시트에 누적 저장하는 코드를 구축합니다.
- 웹 드라이버 매니저 및 셀레니움 연동:
selenium,webdriver_manager,pandas,openpyxl등 필요한 라이브러리를 임포트하고, 브라우저 버전 불일치 문제를 해결하기 위해 드라이버 매니저를 적용합니다. - X-Path 기반 정교한 요소 수집: HTML 구조가 복잡할 때 X-Path를 활용해 집계 시각 및 검색어 키워드 요소를 단수/복수(
find_elements)로 정확히 지정하여 추출합니다. datetime을 활용한 파일명 및 시트 구성: 연/월/일/시/분 형태의 타임스탬프 문자열을 생성하고, 엑셀 생성 시 해당 일시 정보로 시트 이름을 자동 생성합니다.try-except예외 처리를 통한 시트 추가: 지정 엑셀 파일이 이미 존재하면 기존 파일에 시트를 추가(mode='a')하고, 없으면 신규 엑셀 파일로 생성하는 예외 처리 구문을 구현합니다.schedule라이브러리를 통한 주기적 무한 루프:schedule.every().hour.do()및while True구문을 결합해 1시간마다 또는 지정 주기마다 자동으로 크롤링이 반복 실행되도록 스케줄링합니다.- AI 활용과 생코딩 기초의 중요성: ChatGPT가 제공하는 코드를 그대로 복사하기보다, 원리를 이해하고 디버깅하여 실무 조건에 맞게 프롬프팅 및 커스터마이징하는 능력이 핵심임을 강조합니다.
챕터 3: 아직도 파이썬 배우세요? 코딩 1도 몰라도 AI 말 한마디면 네이버 뉴스 싹 다 털어줍니다
- AI 시대의 웹 스크래핑 패러다임: 코드와 웹 태그 구조를 직접 분석하지 않고, 생성형 AI(Gemini 3 Pro 등)에게 자연어 프롬프트와 스크린샷 이미지를 전달하여 크롤링 코드를 자동 생성합니다.
- 셀레니움(Selenium) 라이브러리 채택: AI 추천에 따라 동적 페이지 및 다양한 브라우저 호환성이 뛰어난 셀레니움 기반 스크래핑 코드를 선택하여 실행 환경을 구성합니다.
- 네이버 뉴스 경제 섹션 자동 수집: 경제 뉴스 페이지 URL을 전달하여 기사 제목 및 원문 링크 데이터를 손쉽게 추출하고 콘솔 출력을 검증합니다.
- C드라이브 자동 저장 및 엑셀 출력:
pandas와openpyxl을 결합하여 C드라이브 지정 폴더 내에 네이버 뉴스 수집 결과(.xlsx)를 깔끔한 파일로 저장합니다. - 멀티 섹션 확장 및 멀티모달 이미지 분석: 뉴스 상단 탭 스크린샷을 Gemini에 업로드하여 정치, 경제, 사회, IT과학 등 개별 섹션별 시트를 자동 생성하는 고도화 코드를 도출합니다.
- 하이퍼링크 속성 자동 적용: 단순 텍스트로 저장되던 URL 항목에
openpyxl의 하이퍼링크 기능을 적용하여 엑셀에서 클릭 한 번으로 이동할 수 있도록 다듬습니다. - 텍스트 분석 및 요약 시트 추가 생성: 각 시트별 기사 제목에서 핵심 키워드 빈도수를 분석하여 명사 단위 주요 키워드와 요약 정보가 포함된 별도 요약 시트까지 자동 생성합니다.
챕터 4: 아직도 파이썬으로만 크롤링하세요? 이제 'MCP 서버'가 대세입니다. (feat. 엑셀 자동화)
- MCP(Model Context Protocol) 기반 크롤링: LLM이 직접 웹사이트 데이터나 외부 도구에 접근하여 크롤링을 대행하도록 만드는 차세대 연동 기술 실습입니다.
FastMCP및 필요 패키지 환경 설치: 파이썬 환경에서mcp,fastmcp,requests,beautifulsoup4,pandas패키지를 설치하여 MCP 서버용 스크립트를 작성합니다.- YES24 베스트셀러 전용 MCP 툴 작성:
@mcp.tool데코레이터와 독스트링(Docstring)을 작성하여 YES24 메인 페이지의 순위, 제목, 저자, 링크 데이터를 수집하고 JSON 문자열로 반환하는 파이썬 함수를 정의합니다. claude_desktop_config.json연동: 작성한 MCP 서버 파이썬 스크립트 실행 경로를 클로드 데스크탑 설정 파일에 등록하여 커넥터를 활성화합니다.- 클로드 데스크탑과의 연동 동작: 클로드 대화창에서 "YES24 베스트셀러 정보를 크롤링해 줘"라고 요청하면 AI가 MCP 서버 툴을 자동으로 호출하여 실시간 데이터를 수집합니다.
- 바이브 코딩을 통한 엑셀 디자인 및 다운로드: 수집된 JSON 데이터를 기반으로 클로드(LLM)가 알아서 깔끔한 서식과 링크가 포함된 엑셀 아티팩트를 디자인하고 파일 다운로드까지 완벽히 제공합니다.
- 크롤링 한계 극복 및 생산성 혁신: 기존 LLM의 웹 구조 인식 실패 에러를 MCP 서버 툴과 결합하여 완벽히 극복하고 실무 자동화 속도를 획기적으로 향상시킵니다.
챕터 5: 파이썬, 셀레니움 이제 몰라도 됩니다. Claude와 FireCrawl로 웹사이트 통째로 긁어오기! (feat. Smithery)
FireCrawl에이전트 AI 기반 크롤링: 웹사이트 태그 분석 및 셀레니움 코드 작성 없이, 웹사이트 구조를 대신 분석해 데이터를 긁어오는 파이어크롤(FireCrawl) API 기술을 활용합니다.- 스미더리(Smithery) 오픈 마켓 활용: MCP 서버 마켓인 스미더리에서 검증된 FireCrawl MCP 패키지를 탐색하고 클로드 데스크탑 환경에 한 줄 명령어로 간편 연동합니다.
- API 키 연동 및 무료 크레딧 사용: FireCrawl 공식 사이트 가입 후 무료 제공되는 500 크레딧의 API 키를 클로드 커넥터 환경에 등록하여 실행을 준비합니다.
- 웹 차단 기술 및 크롤링 거부 우회: 일반 LLM 접속이나 크롤러가 사이트 보안 정책으로 거부당할 때, FireCrawl API의 우회 접근 기술로 뉴스 기사 원문 및 비정형 데이터를 성공적으로 수집합니다.
- 최신 테크 뉴스 및 오퍼스 4.6 요약: 연합뉴스 등 최신 AI 관련 뉴스(엔스로픽 클로드 오퍼스 4.6 출시 기사 등) URL을 전송하여 핵심 내용을 요약 추출합니다.
- 보안 리스크 관리 및 공신력 툴 선택: 스미더리 오픈 마켓 이용 시 발생할 수 있는 데이터 스니핑 및 백도어 위험을 대비해 검증된 공신력 있는 MCP 툴만 선택해 활용할 것을 당부합니다.
챕터 6: 쿠팡의 모든 정보를 엑셀로 추출하는 방법을 보여드리겠습니다. (1) (Feat. RPA)
- 쿠팡 상품 정보 수집 프로젝트 개요: MS Power Automate Desktop(PAD)을 사용해 쿠팡에서 특정 키워드(물티슈 등)를 검색하고 상품 정보를 엑셀로 추출하는 자동화 프로젝트를 소개합니다.
- 노코드/로우코드 기반 자동화: 복잡한 파이썬 크롤링 코드 작성 없이 화면 상의 동작과 태스크 블록을 드래그 앤 드롭으로 배치하여 누구나 쉽게 자동화를 구축합니다.
- MS 엣지(Edge) 브라우저 우선 활용: 마이크로소프트 개발 생태계 간 최적의 호환성을 유지하기 위해 크롬 대신 MS 엣지 브라우저 제어를 기본으로 선택합니다.
- 수집 대상 데이터 정의: 상품 검색 결과 목록에서 실무적으로 가장 중요한 상품 제목, 가격, 그리고 숨겨진 상품 상세보기 URL 3가지 핵심 항목을 수집 목표로 잡습니다.
- 개발자 도구(F12) 속성 파악: 개발자 도구를 열어 검사점으로 상품 타이틀, 가격 태그 및
href속성에 숨겨진 URL 위치를 파악하는 사전 작업을 수행합니다. - 다중 페이지(Next Page) 이동 구상: 1페이지만 수집하는 데 그치지 않고 하단 페이지 번호나 넥스트 화살표 클릭 연산을 추가하여 5페이지 이상의 대량 데이터를 개더링하도록 설계합니다.
챕터 7: 쿠팡의 모든 정보를 엑셀로 추출하는 방법을 보여드리겠습니다. (2) (Feat. RPA)
- 엣지 브라우저 자동 접속 및 검색: '새 마이크로소프트 엣지 시작'으로 쿠팡 메인을 열고, '텍스트 필드 채우기'로 검색창에 "물티슈" 입력 후 '버튼 누르기'로 검색을 자동 실행합니다.
- 웹페이지 데이터 추출 및 라이브 웹 도우미: '웹페이지에서 데이터 추출' 액션을 활성화하여 라이브 웹 도우미 창에서 상품 제목과 가격 요소의 텍스트 값을 포착합니다.
- 상위 UI 요소 및
href속성 추출: 상위 UI 요소 선택을 거쳐href속성을 지정함으로써 화면에 노출되지 않는 상품 상세 URL 데이터를 깔끔하게 수집합니다. - 다중 제품 테이블 자동 인식: 두 번째 상품의 제목과 가격을 선택하는 즉시 PAD 알고리즘이 표 전체 구조를 인식하여 1페이지 내 수십 개 상품을 한 번에 데이터 테이블로 인식합니다.
- 페이지 선택기 기반 5페이지 자동 순회: 하단 다음 페이지 이동 버튼 UI를 '페이지 선택기'로 설정하고 최대 웹페이지 수를 5로 지정해 5페이지(총 180개 상품) 데이터를 자동 순회 수집합니다.
- 엑셀 스프레드시트 일괄 저장: 추출된 데이터 저장 모드를 '엑셀 스프레드시트'로 지정하고, C드라이브 지정 경로에
.xlsx파일로 자동 저장 및 인스턴스 종료를 완성합니다.
라벨 종합 정리
- 공통 핵심: 이 영상들은 파이썬(Python), Power Automate Desktop(RPA), 생성형 AI(Gemini, ChatGPT), MCP 서버(FastMCP, FireCrawl) 등 다양한 기술 스택을 활용하여 이커머스(11번가, 쿠팡, YES24) 및 웹 뉴스 데이터를 엑셀로 자동 추출하는 업무 자동화 솔루션을 다룹니다.
- 기술 패러다임의 변화: 전통적인 코드 베이스의 웹 태그 분석 방식에서 벗어나 노코드/로우코드 RPA 툴과 자연어·이미지 인식 기반 AI 프롬프팅, 그리고 AI가 도구를 직접 호출하는 MCP 에이전트 생태계로 크롤링 방식이 크게 진화하였습니다.
- 실무 생산성 혁신: 반복적이고 소모적인 수작업 수집 업무를 단순 몇 줄의 코드나 클릭 몇 번, 혹은 AI 대화 한 마디로 대체함으로써 데이터 수집부터 요약, 엑셀 시트 자동 구성까지 실무 생산성을 극대화할 수 있습니다.
💡 혹시 선택하신 영상들의 자동화 파이썬 코드나 RPA 흐름 추가 구현이 필요하시면 언제든 말씀해 주세요!