微客导航 » 文章资讯 » python爬虫实现爬取同一个网站的多页数据的实例讲解

python爬虫实现爬取同一个网站的多页数据的实例讲解

2023-07-06 16:06:02 360

对于一个网站的图片、文字音视频等，如果我们一个个的下载，不仅浪费时间，而且很容易出错。Python爬虫帮助我们获取需要的数据，这个数据是可以快速批量的获取。本文小编带领大家通过python爬虫获取获取总页数并更改url的方法，实现爬取同一个网站的多页数据。

一、爬虫的目的

从网上获取对你有需要的数据

二、爬虫过程

1、获取url（网址）。

2、发出请求，获得响应。

3、提取数据。

4、保存数据。

三、爬虫功能

可以快速批量的获取想要的数据，不用手动的一个个下载(图片、文字音视频等)

四、使用python爬虫爬取同一网站多页数据

1、需要定位至该标签并获得总页数

defget_page_size(soup):
pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')
pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')
foriinpcxt1[:-1]:
link=i.get('href')
s=str(i)
page=re.sub('','',page1)
page3=re.sub('','',page2)
pagesize=int(page3)
print(pagesize)
returnpagesize
Pass

2、更改url来访问网址，也就是进行主函数的编写

if__name__=='__main__':
url="http://www.sheknows.com/baby-names/browse/a/"
soup=get_requests(url)
page=get_page_size(soup)
foriinrange(1,page+1):
url1=url+"page/"+str(i)+"/"
soup1=get_requests(url1)
draw_base_list(soup1)

实例扩展：

importrequests
fromlxmlimportetree
importre

url="https://movie.douban.com/top250"
header={"User-Agent":"Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/79.0.3945.130Safari/537.36"}

allMovieList=[]
flag=True
whileflag:
html=requests.get(url,headers=header).text
list=etree.HTML(html)
lis=list.xpath('//ol[@class="grid_view"]/li')
foroneSelectorinlis:
name=oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]
score=oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]
people=oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]
people=re.findall("(.*?)人评价",people)[0]
oneMovieList=[name,score,people]
allMovieList.append(oneMovieList)
#获取下一页地址
try:
next_url=list.xpath('//span[@class="next"]/a/@href')[0]
ifnext_url:
url="https://movie.douban.com/top250"+next_url
except:
flag=False
print(allMovieList)

到此这篇关于python爬虫实现爬取同一个网站的多页数据的实例讲解的文章就介绍到这了,更多相关python爬虫如何实现爬取同一个网站的多页数据内容请搜索毛票票以前的文章或继续浏览下面的相关文章希望大家以后多多支持毛票票！

返回顶部
3162201930
czq8825@qq.com

python爬虫实现爬取同一个网站的多页数据的实例讲解

一、爬虫的目的

二、爬虫过程

三、爬虫功能

四、使用python爬虫爬取同一网站多页数据

热门推荐

随机推荐