<進擊的蟲師>輿情監測之擷取資料

2018-04-18 23:50:00

輿情監測是對網際網路上公衆的言論和觀點進行監視和預測的行為.監測技術大多是基于爬蟲的, 如果我們把相關熱點事件的關鍵詞, 用搜尋引擎進行搜尋, 并将結果儲存到本地,就實作了輿情監測的第一環節:實時擷取網際網路資料

輿情監測.png

初步實作效果

擷取資料.gif

實作代碼

import requests
from lxml import etree
import os
import sys

def getData(wd):
    # 設定使用者代理頭
    headers = {
        # 設定使用者代理頭(為狼披上羊皮)
        "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36",
    }
    # 構造目标網址
    target_url = "https://www.baidu.com/s?wd="+str(wd)
    # 擷取響應
    data = requests.get(target_url, headers = headers)
    # xpath格式化
    data_etree = etree.HTML(data.content)
    # 提取資料清單
    content_list = data_etree.xpath('//div[@id="content_left"]/div[contains(@class, "result c-container")]')
    # 定義傳回的字元串
    result = ""
    # 擷取标題, 内容, 連結
    for content in content_list:
        result_title = "<标題>  "
        bd_title = content.xpath('.//h3/a')
        for bd_t in bd_title:
            result_title += bd_t.xpath('string(.)')

        result_content = "<内容>  "
        bd_content = content.xpath('.//div[@class="c-abstract"]')
        for bd_c in bd_content:
            result_content += bd_c.xpath('string(.)')

        result_link = "<連結>  "+str(list(content.xpath('.//div[@class="f13"]/a[@class="c-showurl"]/@href'))[0])


        result_list = [result_title, "\n" , result_content , "\n", result_link, "\n", "\n"]
        for result_l in result_list:
            result += str(result_l)
    return result


# 儲存為檔案

def saveDataToFile(file_name, data):
    # 建立檔案夾
    if os.path.exists("./data/"):
        pass
    else:
        os.makedirs("./data/")

    with open("./data/"+file_name+".txt", "w+") as f:
        f.write(data)

def main():
    wd = ""
    try:
        wd = sys.argv[1]
    except:
        pass
    if (len(wd) == 0):
        wd = "火影"
    str_data = getData(wd)
    print(str_data)
    saveDataToFile(wd, str_data)

if __name__ == '__main__':
    main()

<進擊的蟲師>輿情監測之擷取資料

初步實作效果

實作代碼

繼續閱讀

安裝tensorflow1.12出現illegal hardware instruction python錯誤1、問題2、定位問題3、問題解決4、驗證

如何解決使用mac聚焦搜尋無法搜尋軟體的情況

Mac 不能進入睡眠模式，如何修複?

蘋果Mac如何使用Tuxera NTFS 格式化磁盤？

如何恢複出廠設定并還原Apple Silicon M1 Mac？

Mac無法開機？如何修複

[學習筆記—Objective-C]《Objective-C 程式設計第6版》第六章選擇結構課後題6-4&6-6&6-7

如何為您的Android手機建立自定義鈴聲

AppCode的使用

iOS FDMB添加新字段

iOS開發之送出App前需要準備的材料

iOS APP送出上架最新流程

VirtualBox for macOS NS_ERROR_FAILURE (0x80004005) 問題解決記錄系統環境問題描述解決思路小結

K-近鄰算法以及圖像分類應用

EGORefreshTableHeaderView 解讀代碼解讀 ELTableViewController 的使用寫在最後

今日頭條iOS用戶端啟動速度優化技術調研實測資料

&lt;進擊的蟲師&gt;輿情監測之擷取資料

初步實作效果

實作代碼

繼續閱讀

<進擊的蟲師>輿情監測之擷取資料