scrapy自定義pipeline類實現將采集數據保存到mongodb的方法

2020-02-23 00:46:23

字體：大中小

來源：轉載

供稿：網友

本文實例講述了scrapy自定義pipeline類實現將采集數據保存到mongodb的方法。分享給大家供大家參考。具體如下：

# Standard Python library imports# 3rd party modulesimport pymongofrom scrapy import logfrom scrapy.conf import settingsfrom scrapy.exceptions import DropItemclass MongoDBPipeline(object):  def __init__(self):    self.server = settings['MONGODB_SERVER']    self.port = settings['MONGODB_PORT']    self.db = settings['MONGODB_DB']    self.col = settings['MONGODB_COLLECTION']    connection = pymongo.Connection(self.server, self.port)    db = connection[self.db]    self.collection = db[self.col]  def process_item(self, item, spider):    err_msg = ''    for field, data in item.items():      if not data:        err_msg += 'Missing %s of poem from %s/n' % (field, item['url'])    if err_msg:      raise DropItem(err_msg)    self.collection.insert(dict(item))    log.msg('Item written to MongoDB database %s/%s' % (self.db, self.col),        level=log.DEBUG, spider=spider)    return item

希望本文所述對大家的python程序設計有所幫助。

上一篇：詳解Python中__str__和__repr__方法的區別

下一篇：python獲取當前計算機cpu數量的方法