커뮤니티
포인트
쿠폰
내 강의실
국비 신청 내역
증명서
계정
로그아웃
학습 질문
개발 일지
나의 활동
답변 완료
데이터 전처리 과정에서 왜 리스트를 굳이 생성하는지 궁금합니다.
undefined주차
북마크
이*림
댓글
5
추천
0
조회수
19
조회수
19
답변 완료

* 겪고 있는 문제 상황을 최대한 자세하게 작성해주세요.

* 문제 해결을 위해 어떤 시도를 해보았는지 구체적으로 함께 알려주세요.




아래 내용은 강의록에 나온 코드입니다.


설명 : 20~30대가 우리 프로덕트에 관심이 있지만

'바빠서' 완주율이 떨어질 것이라는 가설을 토대로 데이터를 분석하는 자료


#나이대별로 수강률 합 구하기

progress_rate_by_age = sparta_data.groupby('age')['progress_rate'].sum()

progress_rate_by_age


#나이대별 수강인원 구하기

number_people_by_age = sparta_data.groupby('age')['_id'].count()

number_people_by_age


#나이대별 완주율 평균 구하기

average = progress_rate_by_age/number_people_by_age

average


위와 같이 코드가 길게 작성되어 있어

저는 아래와 같이 보다 간단하게 작성했는데요.


#나이대별 완주율 평균 구하기 (간단한 버전)

average = sparta_data.groupby('age')['progress_rate'].sum()/sparta_data.groupby('age')['_id'].count()

average


오류 없이 넘어갈 수 있었습니다.

(아래 전처리 과정에서 리스트를 생성해야만 간단하게 코드를 설정할 수 있는 줄 알았음.

근데 전처리를 거치지 않고도 간단하게 코드가 돌아가더라고요?)


이후 강의록에서는

'찐한 관리'를 하면 완주율이 높아진다는 가설을 토대로 데이터를 분석했는데요.






작성한 코드 및 에러 메세지


sparta_data = pd.read_csv('/content/sprata_data.csv')


#찐한관리의 유무로 분류한 각 그룹의 수강생 수 전처리 하기

managed = ['TRUE','FALSE']

managed


#관리 여부에 따라, 수강완료율 평균 구하기

managed_data_avg = sparta_data.groupby('managed')['progress_rate'].sum()/sparta_data.groupby('managed')['_id'].count()

managed_data_avg


위 과정에서 '전처리'가

비어있는 값을 처리하는 방법이 아니라

리스트를 생성하는 것으로 보입니다.


그런데 전처리 과정 코드를 제거해도 결과값은


managed
False    38.587119
True     68.466171


위와 같이 동일하게 나오는데요.


데이터셋에서 어떤 의미로 리스트를 생성하는지 궁금합니다.

취소
 공유
취소
댓글 0
댓글 알림
나의얼굴