커뮤니티
포인트
쿠폰
내 강의실
국비 신청 내역
증명서
계정
로그아웃
학습 질문
개발 일지
나의 활동
답변 완료
기업명 크롤링 문의드립니다.
업무자동화 종합반 v0
5주차
북마크
H
댓글
3
추천
0
조회수
15
조회수
15
답변 완료

* 겪고 있는 문제 상황을 최대한 자세하게 작성해주세요.

* 문제 해결을 위해 어떤 시도를 해보았는지 구체적으로 함께 알려주세요.


from selenium import webdriver

from selenium.webdriver.common.by import By

from selenium.webdriver.common.keys import Keys

from selenium.webdriver.chrome.options import Options

import time

import pandas as pd


from openpyxl import load_workbook

from openpyxl.drawing.image import Image

import requests

from io import BytesIO



chrome_options = Options()

chrome_options.add_experimental_option("detach", True)

chrome_options.add_experimental_option("excludeSwitches", ["enable-logging"])

browser = webdriver.Chrome(options=chrome_options)


# 웹 사이트 열기

browser.get('https://www.rocketpunch.com/companies')

time.sleep(1)


new_window = browser.window_handles[0]

browser.switch_to.window(new_window)

browser.maximize_window()

time.sleep(5)


initial_scrollbar_height = browser.execute_script("return Math.max( document.body.scrollHeight, document.body.offsetHeight, document.documentElement.clientHeight, document.documentElement.scrollHeight, document.documentElement.offsetHeight );")


while True:

    # 페이지의 맨 아래로 스크롤합니다.

    browser.find_element(By.TAG_NAME, 'body').send_keys(Keys.END)

   

    # 콘텐츠가 로드되기를 기다리기 위해 시간을 지연합니다 (필요에 따라 조정).

    time.sleep(1)

   

    # 현재 스크롤 바 높이를 가져옵니다.

    current_scrollbar_height = browser.execute_script("return Math.max( document.body.scrollHeight, document.body.offsetHeight, document.documentElement.clientHeight, document.documentElement.scrollHeight, document.documentElement.offsetHeight );")


    # 스크롤 바 높이가 이전과 동일한지 확인합니다.

    if current_scrollbar_height == initial_scrollbar_height:

        break  # 스크롤 바 높이가 동일하면 루프를 종료합니다.

   

    # 다음 반복을 위해 초기 스크롤 바 높이를 업데이트합니다.

    initial_scrollbar_height = current_scrollbar_height


items = browser.find_elements(By.CSS_SELECTOR, '.company item')


for item in items:

    name = item.find_element(By.CSS_SELECTOR, 'header name nowrap').text

    print(name)


browser.quit()

--------------------------------------------------------------------------------

제가 https://www.rocketpunch.com/ 여기 사이트에서 기업명을 크롤링 하려고 하는데 강의영상(3주차 3-4 5분40초)처럼 텍스트 리스트가 수집이 안되고 그냥 창 확대만하고 꺼지는 것까지만 되는데 이유가 무엇인지 알 수 있을까요?

터미널 봐도 오류는 없고 딱히 문제 될 만한 코드가 없는거 같은데 뭐가 문제인지 모르겠습니다 ㅠㅠ


스파르타 즉문즉답


스파르타 즉문즉답







취소
 공유
취소
댓글 0
댓글 알림
나의얼굴