Python使用scrapy抓取网站sitemap信息的方法
本文实例讲述了Python使用scrapy抓取网站sitemap信息的方法。分享给大家供大家参考。具体如下:
importre
fromscrapy.spiderimportBaseSpider
fromscrapyimportlog
fromscrapy.utils.responseimportbody_or_str
fromscrapy.httpimportRequest
fromscrapy.selectorimportHtmlXPathSelector
classSitemapSpider(BaseSpider):
name="SitemapSpider"
start_urls=["http://www.domain.com/sitemap.xml"]
defparse(self,response):
nodename='loc'
text=body_or_str(response)
r=re.compile(r"(<%s[\s>])(.*?)(</%s>)"%(nodename,nodename),re.DOTALL)
formatchinr.finditer(text):
url=match.group(2)
yieldRequest(url,callback=self.parse_page)
defparse_page(self,response):
hxs=HtmlXPathSelector(response)
#MockItem
blah=Item()
#Doallyourpageparsingandselectingtheelemtentsyouwant
blash.divText=hxs.select('//div/text()').extract()[0]
yieldblah
希望本文所述对大家的Python程序设计有所帮助。
热门推荐
7 简短的二胎祝福语
10 简短霸气女儿生日 祝福语
11 祝福语高考小众诗句简短
12 元旦祝福语20秒简短
13 老师过年祝福语大全 简短
14 一生祝福语简短
15 产检祝福语简短霸气
16 朋友店开张祝福语简短
17 生日爱情祝福语大全简短
18 朋友女儿生日祝福语 简短