Python爬取豆瓣熱映電影爬取效果

2023-08-06 01:43:55

Python爬取豆瓣熱映電影

Python爬取豆瓣熱映電影爬取效果

# encoding: utf-8

import requests
from lxml import etree

# 1. 将目标網站上的頁面抓取下來
headers = {
    'User-Agent': "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.131 Safari/537.36",
    'Referer': "https://movie.douban.com/"
}

url = "https://movie.douban.com/cinema/nowplaying/zhongshan/"
response = requests.get(url, headers=headers)
text = response.text
# print(response.text)
# response.text:傳回的是一個經過解碼後的字元串，是str（Unicode）類型
# response.content:傳回的是一個原生字元串，就是從網頁上抓取下來的，沒有經過處理的字元串，是bytes類型

# 2. 将抓取下來的資料根據一定的規則進行抓取
html = etree.HTML(text)
ul = html.xpath("//ul[@class='lists']")[0]
lis = ul.xpath("./li")
movies = []
for li in lis:
    title = li.xpath("@data-title")[0]
    score = li.xpath("@data-score")[0]
    duration = li.xpath("@data-duration")[0]
    region = li.xpath("@data-region")[0]
    director = li.xpath("@data-director")[0]
    actors = li.xpath("@data-actors")[0]
    thumbnail = li.xpath(".//img/@src")[0]
    movie = {
        'title': title,
        'score': score,
        'duration': duration,
        'region': region,
        'director': director,
        'actors': actors,
        'thumbnail': thumbnail
    }
    movies.append(movie)

print(movies)

爬取效果

Python爬取豆瓣熱映電影爬取效果

Python爬取豆瓣熱映電影爬取效果

爬取效果

繼續閱讀

YAML簡介和PyYAML安全操作YAML支援的類型YAML的優點：yaml的基本文法python操作

Small tricks

libsvm for python 安裝

學習軟體測試基礎測試第七天

Zeppelin 配置通路 REST APIApache Zeppelin Configuration REST API

【Torch】最簡潔logging使用指南

27. Remove Element(清單)題目代碼

對象鎖和全局鎖

sort()函數到底是怎樣進行數字排序的

iview背景管理模版

Cloud Studio初體驗

使用 ctypes 進行 Python 和 C 的混合程式設計

【python】【資料處理】畫多元資料分布圖

【python】netconf協定對接管理裝置

「Python 網絡自動化」NETCONF —— Python 使用 NETCONF 管理配置 H3C 網絡裝置

在python中建立excel并寫入