怎麽利用爬蟲技術抓取淘寶搜索頁面的產品信息

可以通過requests庫re庫進行淘寶商品爬蟲爬取

import requests

import re

def getHTMLText(url):

try:

r= requests.get(url,timeout=30)

r.raise_for_status()

r.encoding = r.apparent_encoding

return r.text

except:

return ""

def parsePage(ilt,html):

try:

plt = re.findall(r'\"view_price\":\"[\d+\.]*\"',html)

tlt = re.findall(r'\"raw_title\"\:\".*?\"',html)

for i in range(len(plt)):

price = eval(plt[i].split(':')[1])

title = eval(tlt[i].split(':')[1])

ilt.append([price,title])

except:

print("F")

def printGoodsList(ilt):

tplt = "{:4}\t{:8}\t{:16}"

print(tplt.format("序號","價格","商品名稱"))

count = 0

for g in ilt:

count = count +1

print(tplt.format(count,g[0],g[1]))

def main():

goods = '書包'

depth = 2

start_url = "/search?q="+ goods

infoList = []

for i in range(depth):

try:

url = start_url +'&s='+str(44*i)

html = getHTMLText(url)

parsePage(infoList,html)

except:

continue

printGoodsList(infoList)

main()

這段代碼在過去是可以爬取淘寶商品信息，但是因為淘寶的反扒技術升級，便不能讓妳大搖大擺地進出自如了。

此外也可以借助采集實現采集

上一篇:為企業和員工的文章、短篇、詩歌、散文、時事通訊等正面稿件點贊！~

下一篇:如何談與物流公司的合作？

相关文章

公職人員可以經商嗎？

河北省市場主體信用信息公示系統官網登錄地址

航天信息(山東)科技有限公司德州分公司怎麽樣？

鶴壁山城招聘核酸采樣員咨詢電話多少？

有多少家國有銀行

廣州增城區民辦幼兒園招生對象

幾個月前面試壹家公司失敗，最近這家公司又在招聘。妳想再去壹次嗎？

copyright 2024法律諮詢服務網