본문 바로가기

python12

[Pandas] 판다스(Pandas)와 데이터 구조 데이터 분석을 할 때 항상 빠지지 않는 삼대장 패키지가 있다. 바로 NumPy, Pandas, Matplotlib이다. 그 중 판다스는 데이터 조작 및 분석 작업을 매우 편리하게 만들어주는 패키지이다. 판다스의 공식문서는 아래 링크를 통해 들어갈 수 있다. User Guide와 API 모두 상당히 친절하고 자세하다. 판다스 공식문서: https://pandas.pydata.org/ pandas - Python Data Analysis Library pandas pandas is a fast, powerful, flexible and easy to use open source data analysis and manipulation tool, built on top of the Python programmi.. 2023. 1. 31.
[EDA Practice] 2023/W4 EDA Practice Data Source: 'https://query.data.world/s/h4cgvavgdnxywxbbjnnlztdahzzidg' EDA 연습을 위한 첫 번째 데이터셋은 Makeover Monday 웹사이트의 23년 넷째주 데이터셋인 'National Highway Traffic Safety Administration Automobile Recalls'이다. 미국의 자동차 리콜에 대한 데이터셋이고, 1966년부터의 리콜 정보를 담고 있다. 데이터셋에 대한 구체적인 정보는 아래의 링크를 통해 확인해볼 수 있다. National Highway Traffic Safety Administration : https://datahub.transportation.gov/Automobiles/Recalls-Data/6.. 2023. 1. 27.
[EDA Practice] EDA란? EDA(Explanatory Data Analysis, 탐색적 데이터 분석) : 통계 그래픽 및 기타 데이터 시각화 방법을 사용하여 주요 특성을 요약하기 위해 데이터 세트를 분석하는 접근 방식 처음 원본 데이터를 보면 무엇부터 시작해야 할지 막막하다. 원본 데이터는 생각보다 난잡하기 때문에, 데이터를 보자마자 바로 분석 기법을 정하고 데이터 분석에 들어가는 사람은 없을 것이다. 데이터 분석에 들어가기 앞서서, 어떤 특성(column)이 중요한 특성인지, 특성들끼리의 관계는 어떤지, 데이터의 분포는 어떤지 등등 데이터를 이해하며 인사이트를 얻는 과정이 필요하다. 데이터에 대한 이해를 잘할수록, 즉 EDA를 잘할수록 데이터 분석 프로젝트를 더 수월하게, 그리고 더 좋은 분석 결과물을 얻어낼 수 있을 거라는 .. 2023. 1. 20.
[Machine Learning] scikit-learn에 대하여 scikit-learn은 파이썬의 대표적인 머신러닝 패키지이다. 오픈소스 라이브러리이기 때문에 당연히 사용자도 많고 그만큼 관련 글도 쉽게 찾아볼 수 있다. 현재 시점으로, 가장 최근 버전인 1.2.0은 release date가 2022/12/08일 정도로 버전 업데이트도 자주 되는 편이다. 사이킷런 공식 홈페이지: https://scikit-learn.org/ 사이킷런 웹페이지에서 API를 누르면 다양한 라이브러리들을 볼 수 있다. 카테고리 별로 회귀, 분류, SVM, 클러스터링 등 머신러닝 기법부터 측정 지표에 관한 함수들까지 그 양이 매우 방대하다. 또한 공식문서의 API에 파라미터들부터 시작해서 활용할 수 있는 method들, 사용 예시까지 자세히 적혀있기 때문에 상당히 편리하고 친절하다. 사이킷.. 2023. 1. 18.