麻豆黑色丝袜jk制服福利网站-麻豆精品传媒视频观看-麻豆精品传媒一二三区在线视频-麻豆精选传媒4区2021-在线视频99-在线视频a

千鋒教育-做有情懷、有良心、有品質的職業教育機構

手機站
千鋒教育

千鋒學習站 | 隨時隨地免費學

千鋒教育

掃一掃進入千鋒手機站

領取全套視頻
千鋒教育

關注千鋒學習站小程序
隨時隨地免費學習課程

當前位置:首頁  >  技術干貨  > Python爬蟲原理

Python爬蟲原理

來源:千鋒教育
發布人:xqq
時間: 2023-11-07 07:33:56 1699313636

簡單來說互聯網是由一個個站點和網絡設備組成的大網,我們通過瀏覽器訪問站點,站點把HTML、JS、CSS代碼返回給瀏覽器,這些代碼經過瀏覽器解析、渲染,將豐富多彩的網頁呈現我們眼前;

一、爬蟲是什么?

如果我們把互聯網比作一張大的蜘蛛網,數據便是存放于蜘蛛網的各個節點,而爬蟲就是一只小蜘蛛,

沿著網絡抓取自己的獵物(數據)爬蟲指的是:向網站發起請求,獲取資源后分析并提取有用數據的程序;

從技術層面來說就是通過程序模擬瀏覽器請求站點的行為,把站點返回的HTML代碼/JSON數據/二進制數據(圖片、視頻)爬到本地,進而提取自己需要的數據,存放起來使用;

二、爬蟲的基本流程:

用戶獲取網絡數據的方式:

方式1:瀏覽器提交請求--->下載網頁代碼--->解析成頁面

方式2:模擬瀏覽器發送請求(獲取網頁代碼)->提取有用的數據->存放于數據庫或文件中

1、發起請求

使用http庫向目標站點發起請求,即發送一個Request

Request包含:請求頭、請求體等

Request模塊缺陷:不能執行JS和CSS代碼

2、獲取響應內容

如果服務器能正常響應,則會得到一個Response

Response包含:html,json,圖片,視頻等

3、解析內容

解析html數據:正則表達式(RE模塊),第三方解析庫如Beautifulsoup,pyquery等

解析json數據:json模塊

解析二進制數據:以wb的方式寫入文件

4、保存數據

數據庫(MySQL,Mongdb、Redis)

文件

三、http協議請求與響應

Request:用戶將自己的信息通過瀏覽器(socketclient)發送給服務器(socketserver)

Response:服務器接收請求,分析用戶發來的請求信息,然后返回數據(返回的數據中可能包含其他鏈接,如:圖片,js,css等)

ps:瀏覽器在接收Response后,會解析其內容來顯示給用戶,而爬蟲程序在模擬瀏覽器發送請求然后接收Response后,是要提取其中的有用數據。

四、request

1、請求方式:

常見的請求方式:GET/POST

2、請求的URL

url全球統一資源定位符,用來定義互聯網上一個唯一的資源例如:一張圖片、一個文件、一段視頻都可以用url唯一確定

url編碼

https://www.baidu.com/s?wd=圖片

圖片會被編碼(看示例代碼)

網頁的加載過程是:

加載一個網頁,通常都是先加載document文檔,

在解析document文檔的時候,遇到鏈接,則針對超鏈接發起下載圖片的請求

3、請求頭

User-agent:請求頭中如果沒有user-agent客戶端配置,服務端可能將你當做一個非法用戶host;

cookies:cookie用來保存登錄信息

注意:一般做爬蟲都會加上請求頭

請求頭需要注意的參數:

(1)Referrer:訪問源至哪里來(一些大型網站,會通過Referrer做防盜鏈策略;所有爬蟲也要注意模擬)

(2)User-Agent:訪問的瀏覽器(要加上否則會被當成爬蟲程序)

(3)cookie:請求頭注意攜帶

4、請求體

請求體

如果是get方式,請求體沒有內容(get請求的請求體放在url后面參數中,直接能看到)

如果是post方式,請求體是formatdata

ps:

1、登錄窗口,文件上傳等,信息都會被附加到請求體內

2、登錄,輸入錯誤的用戶名密碼,然后提交,就可以看到post,正確登錄后頁面通常會跳轉,無法捕捉到post

五、響應Response

1、響應狀態碼

200:代表成功

301:代表跳轉

404:文件不存在

403:無權限訪問

502:服務器錯誤

2、responeheader

響應頭需要注意的參數:

(1)Set-Cookie:BDSVRTM=0;path=/:可能有多個,是來告訴瀏覽器,把cookie保存下來

(2)Content-Location:服務端響應頭中包含Location返回瀏覽器之后,瀏覽器就會重新訪問另一個頁面

3、preview就是網頁源代碼

JSO數據

如網頁html,圖片

二進制數據等

六、總結

1、總結爬蟲流程:

爬取--->解析--->存儲

2、爬蟲所需工具:

請求庫:requests,selenium(可以驅動瀏覽器解析渲染CSS和JS,但有性能劣勢(有用沒用的網頁都會加載);)

解析庫:正則,beautifulsoup,pyquery

存儲庫:文件,MySQL,Mongodb,Redis

以上內容為大家介紹了Python爬蟲原理,希望對大家有所幫助,如果想要了解更多Python相關知識,請關注IT培訓機構:千鋒教育。http://www.dietsnews.net/

tags: python培訓
聲明:本站稿件版權均屬千鋒教育所有,未經許可不得擅自轉載。
10年以上業內強師集結,手把手帶你蛻變精英
請您保持通訊暢通,專屬學習老師24小時內將與您1V1溝通
免費領取
今日已有369人領取成功
劉同學 138****2860 剛剛成功領取
王同學 131****2015 剛剛成功領取
張同學 133****4652 剛剛成功領取
李同學 135****8607 剛剛成功領取
楊同學 132****5667 剛剛成功領取
岳同學 134****6652 剛剛成功領取
梁同學 157****2950 剛剛成功領取
劉同學 189****1015 剛剛成功領取
張同學 155****4678 剛剛成功領取
鄒同學 139****2907 剛剛成功領取
董同學 138****2867 剛剛成功領取
周同學 136****3602 剛剛成功領取
相關推薦HOT
主站蜘蛛池模板: 一个人晚上在线观看的免费视频| 男女猛烈xx00免费视频试看| 伊人动漫| 国产馆在线观看免费的| 亚洲免费观看在线视频| 7777精品伊人久久久大香线蕉| 强挺进小y头的小花苞漫画| 午夜精品在线| 美女扒开尿口给男人桶爽视频| 彩虹男gary网站| 草樱免费视频| 没有被爱过的女人在线| 精品日韩欧美一区二区三区| 日韩美香港a一级毛片| 亚洲毛片免费观看| 日韩福利影院| 老阿姨哔哩哔哩b站肉片茄子芒果| 久久精品一区二区三区四区| 国产盗摄女厕美女嘘嘘在线观看| 日韩三级| 国内一级黄色片| 波多野吉衣在线电影| 月夜直播在线看片www| 被公侵幕岬奈奈美中文字幕| 久久精品国产久精国产| 北条麻妃大战黑人| 午夜阳光电影在线观看| 老师我好爽再深一点视频| 试看91福利区体验区120秒| 久久蜜桃| 2019天堂精品视频在线观看| 久久精品国产99国产精偷| 麻豆天美精东果冻星空| 亚洲国产精品久久网午夜| 国产破外女出血视频| 色丁香在线视频| 免费啪啪社区免费啪啪手机版| 伊人久久中文大香线蕉综合| 色牛影院| 亚洲欧美一二三区| 欧美aa在线观看|