
데이터 셋 분할시
Original Set에서 Traning(traning+validation) + Testing으로 총 training + validation + testing 조합으로 구분해야한다고 수강했습니다.
강의 중에서는 편의를 위해서 testing 제외하고 traning(80%) + validation(20%) 으로 하고있습니다.
이를 위한 코드는
from sklearn.model_selection import train_test_split
x_train, x_val, y_train, y_val = train_test_split(x_data, y_data, test_size=0.2, random_state=2021)
이렇게 구성되어 있더군요.
그럼 본격적인 질문으로
Original set을 training + validation + testing 조합으로 구분하기 위해서는 test_size=0.2 외에 train_test_split 함수 내에 어떤 인자가 더 포함되어야 하나요? 아니면 3가지 조합으로 구분하기 위해서 train_test_split 함수 외에 다른 함수를 사용해야하는 건가요?
그리고 일반적인 training + validation + testing 의 구성 비율은 어떻게 되나요?
