天天看点

python爬虫——使用selenium+chrome options爬取站长素材页面源码

一.站长素材

1.需要爬取的内容

python爬虫——使用selenium+chrome options爬取站长素材页面源码
python爬虫——使用selenium+chrome options爬取站长素材页面源码

2.代码

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
import time
# webdriver 路径
path = r'E:\chromedriver_win32\chromedriver.exe'
# 创建无界面浏览器
chrome_options = Options()
chrome_options.add_argument("--headless")
browser = webdriver.Chrome(executable_path=path, options=chrome_options)

# 站长素材高清图片-科技图片url
url = 'http://sc.chinaz.com/tupian/kejitupian.html'
browser.get(url)
time.sleep(3)
# 第一次保存html代码
with open('kejitupian1.html', 'w', encoding='utf8') as fp:
    fp.write(browser.page_source)
# 滚动,执行js
js = 'window.scrollTo(0,document.body.scrollHeight)'
browser.execute_script(js)
time.sleep(3)
# 第二次保存html代码
with open('kejitupian2.html', 'w', encoding='utf8') as fp:
    fp.write(browser.page_source)

# 关闭浏览器
browser.quit()
           

3.结果对比

第一次抓取:

python爬虫——使用selenium+chrome options爬取站长素材页面源码

第二次抓取:

python爬虫——使用selenium+chrome options爬取站长素材页面源码

继续阅读