출처: NotebookLM 「오늘코드todaycode」 라벨 '머신러닝·딥러닝' (영상 11개, 중복 제외 10개) · 2026.10.05 생성
학위 없이 폼나게 AI를 구현 할 수 있는 fastai 란? fastai 책 역자 인터뷰
- fastai 책 역자인 김지현 님과의 인터뷰를 통해 비전공자도 AI 기술을 손쉽게 구현하고 실무에 활용할 수 있도록 돕는 fastai의 교육 철학과 가치를 다룹니다.
- 이론 및 수학 공식 중심의 전통적인 바텀업 교육 방식과 달리, 실전 예제(CNN 이미지 분류 등)를 먼저 실행해 보고 동작 원리를 점진적으로 익히는 탑다운(Top-down) 및 "Learn by doing" 학습 방식을 강조합니다.
- fastai 라이브러리는 파이토치(PyTorch)를 고수준(High-level)으로 감싸 몇 줄의 정돈된 코드만으로 최신 딥러닝 베이스라인 모델을 매우 빠르게 구축할 수 있게 지원합니다.
- 기술의 단순 활용을 넘어 의료 알림 서비스의 왜곡, 추천 시스템의 편향, 인종/성별 편견 학습 등 데이터 윤리(Data Ethics) 및 사회적 책임 문제를 도서 전반부에서 비중 있게 다룹니다.
- 알고리즘을 밑바닥부터 개발하는 생산자뿐만 아니라, 완성된 AI 기술을 비즈니스 및 현실 문제 해결에 유용하게 접목하는 서비스 생산자로서의 관점과 실행력이 중요함을 전합니다.
- fastai 커뮤니티 스터디 운영 노하우, 오픈소스 기여 경험 및 디스코드/페이스북 한국 사용자 모임 활동을 함께 공유합니다.
파이토치 학습시 넘파이 ndarray를 바로 쓸 수 없다?! - 텐서 torch.Tensor API 알아보기
- 텐서플로우와 달리 파이토치(PyTorch)는 넘파이
ndarray를 모델 입력으로 직접 다룰 수 없으므로 반드시torch.Tensor특수 자료구조로 변환해야 합니다. torch.Tensor는 GPU 및 하드웨어 가속기 기반의 고속 연산과 자동 미분(Autograd)을 지원한다는 점을 제외하면 넘파이ndarray와 API 문법 및 동작 방식이 매우 흡사합니다.torch.from_numpy()또는torch.tensor()를 통해 넘파이 배열이나 파이썬 리스트를 텐서로 변환하며, 텐서 객체에.numpy()를 호출하면 다시 넘파이 배열로 손쉽게 복원됩니다.- 텐서와 넘파이 배열은 동일한 내부 메모리를 공유하므로, 한쪽 데이터의 값을 수정하면 다른 쪽 변수에도 연동되어 동일하게 변경사항이 반영됩니다.
.to('cuda')또는.to(device)메소드를 사용하여 CPU 메모리에 생성된 텐서를 GPU(CUDA) 장치로 명시적으로 이동시켜 병렬 가속 연산을 수행합니다.torch.concat,torch.stack,torch.vstack,torch.hstack, 행렬곱(@,torch.matmul) 등 넘파이와 호환성이 뛰어난 연산 API들을 다채롭게 제공합니다.
SciPy Korea 2023 - 머신러닝을 위한 정형 데이터 사이킷런 쓸까? 판다스 쓸까?
- XGBoost, LightGBM, CatBoost 등 현대적인 그래디언트 부스팅 모델은 결측치가 존재하거나 별도의 스케일링을 거치지 않아도 우수한 베이스라인 성능을 제공합니다.
- 판다스의
get_dummies나 카테고리 코딩 전처리 시 트레인과 테스트 데이터셋을 통합해 처리하면 데이터 누수(Data Leakage)가 발생하고, 따로 처리하면 컬럼 매핑이 일치하지 않는 문제가 발생합니다. - 데이터 누수를 방지하기 위해 사이킷런의
OneHotEncoder,OrdinalEncoder및make_column_transformer를 활용하여 트레인 데이터셋에만.fit()하고 테스트 데이터셋에는.transform()만 적용하는 파이프라인을 구축해야 합니다. make_column_selector를 사용해 범주형 컬럼은 원-핫 인코딩하고, 수치형 컬럼은StandardScaler,MinMaxScaler,RobustScaler등으로 정제하는 통합 전처리 스키마를 다룹니다.- 수치 데이터 분석 시 단순 기술통계량에만 의존하지 않고, 앤스컴 쿼텟이나 데이터사우루스 예시처럼 시각화(EDA)를 병행하여 이상치와 분포 형태를 정밀하게 점검해야 합니다.
- 탐색적 데이터 분석(EDA), 결측치 확인, 메모리 절감(다운캐스팅 및 Parquet 저장)에는 판다스를 활용하고, 모델링과 피처 전처리에는 데이터 누수를 막아주는 사이킷런을 결합해 사용하는 것이 최선의 실무 결론입니다.
파이토치로 데이터셋 다루기 - 데이터셋 로더와 레이블 원핫인코딩
- 파이토치는 가독성과 모듈성을 확보하기 위해 데이터 가공 및 전처리 로직을 모델 학습 코드로부터 깔끔하게 분리해 주는
Dataset과DataLoader모듈을 제공합니다. Dataset객체는 샘플 데이터와 정답 레이블을 저장·관리하며,DataLoader는 이를 감싸 배치 크기(batch_size), 데이터 셔플(shuffle), 다중 프로세스 로딩을 자동화합니다.torchvision.datasets모듈 내에는 패션 MNIST(Fashion-MNIST), CIFAR-10 등 대표적인 표준 비전 데이터셋이 내장되어 있어 별도 크롤링 없이 즉시 실습에 활용할 수 있습니다.- 사용자 정의 커스텀 데이터셋 구축 시
__init__,__len__,__getitem__3가지 필수 메소드를 클래스 내에 구현하여 파일 경로 읽기, 이미지 변환 및 인덱스 색인을 제어합니다. - 이미지 픽셀 데이터와 정수형 정답 레이블을 모델 연산 및 손실 함수(Cross Entropy)에 적합한 형태로 가공하기 위해
ToTensor()및 원-핫 인코딩(target_transform) 변환을 적용합니다.
도서리뷰 [개정2판] 사이킷런(Scikit-Learn) 핵심 개발자가 쓴 머신러닝과 데이터 과학 실무서
- 사이킷런(Scikit-Learn) 핵심 개발자인 안드레아스 뮐러(Andreas Müller) 저, 박해선 님 번역의 대표적 머신러닝 실무서인 "파이썬 라이브러리를 활용한 머신러닝" 개정 2판 리뷰입니다.
- 사이킷런 1.x 버전 업데이트 내역과 한국어 번역 커뮤니티 피드백, 윤리적 이슈로 제거된 보스턴 집값 데이터셋 변경사항 등을 완벽히 반영하였습니다.
- 난해한 수학 공식에 치중하기보다 애플리케이션 개발자 및 실무 데이터 분석가가 현업에 즉시 적용할 수 있는 실용적이고 직관적인 머신러닝 코드 구현에 집중합니다.
- 지도학습(분류, 회귀) 및 비지도학습(군집화, 차원 축소)의 전체적인 지도 흐름을 한눈에 파악할 수 있는 사이킷런 알고리즘 치트시트(Cheat Sheet) 활용법을 제시합니다.
- 저자 및 역자의 깃허브(GitHub) 오픈소스 저장소를 통해 구글 콜랩(Google Colab) 실행 링크 및 한글 주석 코드를 구체적으로 제공합니다.
- 오픈소스 기여 및 학습 시 완벽주의에 빠지기보다 작고 쉬운 오타 수정이나 개선부터 시작하자는 실행 중심 철학("Done is better than perfect")을 강조합니다.
온라인 상에 공개된 꾸준히 업데이트가 되는 실습을 하며 배우는 딥러닝 책, 게다가 번역본도?! - Dive into Deep Learning
- 글로벌 오픈소스 대화형 교재 프로젝트인 "Dive into Deep Learning (D2L)"의 한국어 번역 온라인 전자책을 소개합니다.
- "Learning by doing(직접 실행하며 배운다)"이라는 교육 철학에 맞추어, 모든 핵심 이론과 수식을 주피터 노트북 실행 코드 및 시각화 결과와 함께 제공합니다.
- 딥러닝 기초 수학과 정형 데이터 분석부터 시작하여 다층 퍼셉트론(MLP), CNN, RNN, 최신 생성 모델 및 트랜스포머 아키텍처까지 커리큘럼을 단계적으로 확장합니다.
- 수식적 원리를 나열하기보다 실제 목적을 달성하는 시점에 필요한 개념을 배우는 "Just-in-Time" 실습 방식을 채택하고 있습니다.
- 웹사이트상에서 전체 본문과 주피터 노트북, PDF 파일이 무료로 다운로드 제공되며, 깃허브 저장소를 통해 한국어 번역 및 오탈자 정정 기여에 누구나 동참할 수 있습니다.
오픈소스 기여하는 가장 쉬운 방법?! - 파이토치 공식 문서 튜토리얼 한국어 번역
- 오픈소스 프로젝트 기여 입문 시 소스코드 전체 수정이나 복잡한 기능 구현보다 문맥상의 오타 및 오탈자를 정정하는 작업이 가장 쉽고 효과적입니다.
- 파이토치 한국어 공식 튜토리얼 문서에서 "복수할 필요가 없다"라는 오타를 발견하고 원문("no need to copy")과 비교하여 "복사할 필요가 없다"로 바로잡는 실전 기여 과정을 보여줍니다.
- 깃허브(GitHub) 저장소의 Issues 탭에서 기존에 동일한 오타 정정 요청이 등록되어 있는지 중복 여부를 먼저 검증하고 신규 이슈(Issue)를 작성합니다.
- 원본 저장소를 본인 계정으로 포크(Fork)한 뒤, 로컬 개발 환경으로 클론(Clone)하여 코드 수정을 수행하고 이슈 번호를 포함한 커밋 메시지 규칙에 맞춰 커밋 및 푸시를 진행합니다.
- 원본 저장소 방향으로 풀 리퀘스트(Pull Request, PR)를 작성하고 라이선스 동의 및 변경 내역 개요를 제출하여 최종 반영을 요청하는 전체 오픈소스 기여 프로세스를 전달합니다.
[책리뷰] 파이썬을 활용한 머신러닝 쿡북
- 크리스 알본(Chris Albon) 저, 박해선 님 번역의 "파이썬을 활용한 머신러닝 쿡북" 실무 가이드북 리뷰입니다.
- 파이썬 기초 문법을 익힌 사용자가 넘파이, 판다스, 사이킷런 및 케라스(Keras) 기반 딥러닝까지 필요한 테크닉을 요리책(Cookbook)처럼 손쉽게 찾아 적용할 수 있도록 예제 중심으로 구성되어 있습니다.
- CSV, 엑셀, JSON 파일 로드는 물론 SQL 데이터베이스 연동 및 웹 URL 기반의 다채로운 데이터 적재·전처리 기법을 다룹니다.
- 교재 내 20장 신경망(Neural Network) 단원을 통해 케라스 기반 IMDB 영화 리뷰 텍스트 이진 분류, 다중 분류, 회귀 모델 구축, 드롭아웃 및 얼리스탑핑(Early Stopping) 실습을 다룹니다.
- 역자의 깃허브 저장소를 통해 전체 주피터 노트북 코드가 공개되어 있으며, 구글 콜랩(Colab) 바로 실행 및 드라이브 복사 기능으로 편리한 학습 환경을 제공합니다.
파이토치 공식문서 번역된 한국어 문서로 보고 싶다면 어디다?! 👉 pytorch.kr
- 파이토치 한국 사용자 모임(
pytorch.kr)에서 관리 및 운영하는 공식 파이토치 한국어 튜토리얼 웹사이트를 소개합니다. - 구글이 직접 관리하는 텐서플로우 한국어 문서와 달리, 파이토치는 국내 독립 커뮤니티 사용자들의 자발적인 번역 봉사로 지속적인 업데이트가 이루어집니다.
- 빠른 시작(Quickstart), 텐서, 데이터셋과 데이터로더, 모델 구축, 오토그라드, 최적화 등 파이토치 핵심 입문 문서 대부분이 한글로 매끄럽게 번역되어 있습니다.
- 모든 한국어 튜토리얼 페이지 상단에 'Run in Google Colab' 버튼이 배치되어 있어 별도 로컬 환경 구축 없이 웹 브라우저에서 즉시 코드를 실행해 볼 수 있습니다.
- 아직 번역이 완료되지 않은 오디오 및 추천 시스템 등의 문서는 오픈소스 깃허브 저장소를 통해 사용자가 직접 오탈자 정정이나 번역 기여에 동참할 수 있습니다.
파이토치 - 빠른시작 따라하기! 한국 사용자 모임 공식문서 번역본
- 파이토치 한국 사용자 모임의 빠른 시작(Quickstart) 한국어 튜토리얼을 기반으로 패션 MNIST 의류 데이터셋 분류 딥러닝 모델의 전체 파이프라인을 구축합니다.
torchvision.datasets.FashionMNIST를 통해 6만 개의 학습 데이터와 1만 개의 테스트 데이터를 로드하고DataLoader로 64개 배치 단위 객체를 구성합니다.nn.Module을 상속받는 신경망 클래스를 정의하고, 28x28 이미지 평탄화(nn.Flatten), 선형 레이어(nn.Linear), 활성화 함수(nn.ReLU)를 결합해 10개 의류 클래스 출력 구조를 작성합니다.- 손실 함수로
nn.CrossEntropyLoss, 최적화 알고리즘으로torch.optim.SGD를 지정하고 학습률(Learning Rate)을 설정합니다. - 역전파(Backpropagation)와 가중치 갱신 과정을 거치며 에포크(Epoch)가 반복됨에 따라 손실값은 감소하고 예측 정확도(Accuracy)는 60% 이상으로 상승함을 검증합니다.
- 학습이 완료된 신경망의 내부 매개변수(Weight/Bias)를 파일로 저장(
torch.save)하고, 다시 불러와(torch.load) 새로운 이미지 입력 시 정확한 의류 클래스로 예측함을 확인합니다.
라벨 종합 정리
머신러닝과 딥러닝을 효과적으로 학습하고 실무에 적용하기 위해서는 완벽한 이론에 집착하기보다 직접 코드를 실행하고 오류를 고쳐나가는 실행 중심의 방식("Learn by doing" / "Done is better than perfect")이 핵심입니다.
정형 데이터 분석 시에는 데이터 누수(Data Leakage)를 방지하는 사이킷런 파이프라인과 판다스를 결합하고, 비정형 데이터 처리 시에는 파이토치(PyTorch)의 텐서(torch.Tensor), Dataset, DataLoader 모듈을 활용해 효율적인 모델 파이프라인을 구축해야 합니다.
오픈소스 생태계(pytorch.kr, fastai, Scikit-Learn 등)의 한글 번역 문서와 구글 콜랩 실습 환경을 적극 활용하고, 오타 수정부터 시작하는 커뮤니티 기여와 데이터 윤리(Data Ethics)에 대한 깊은 고민을 함께 가져가는 것이 유능한 AI 실무자로 성장하는 길입니다.