你应该知道什么是网络爬虫？怎样使用？

2023-02-25 11:23 作者:Python_利亚 0人读过 | 我要投稿

你应该知道什么是爬虫？

爬虫（又称为网页蜘蛛，网络机器人，在 FOAF 社区中间，更经常的称为网页追逐者）；它是一种按照一定的规则，自动地抓取网络信息的程序或者脚本。

如果我们把互联网比作一张大的蜘蛛网，那一台计算机上的数据便是蜘蛛网上的一个猎物，而爬虫程序就是一只小蜘蛛，他们沿着蜘蛛网抓取自己想要的猎物/数据。

网络爬虫，其实叫作网络数据采集更容易理解。

就是通过编程向网络服务器请求数据（HTML表单），然后解析HTML，提取出自己想要的数据。

归纳为四大步：

根据url获取HTML数据

解析HTML，获取目标信息

存储数据

重复第一步

这会涉及到数据库、网络服务器、HTTP协议、HTML、数据科学、网络安全、图像处理等非常多的内容。但对于初学者而言，并不需要掌握这么多。

python要学习到什么程度

如果你不懂python，那么需要先学习python这门非常easy的语言（相对其它语言而言）。

编程语言基础语法无非是数据类型、数据结构、运算符、逻辑结构、函数、文件IO、错误处理这些，学起来会显枯燥但并不难。

刚开始入门爬虫，你甚至不需要去学习python的类、多线程、模块之类的略难内容。找一个面向初学者的教材或者网络教程，花个十几天功夫，就能对python基础有个三四分的认识了，这时候你可以玩玩爬虫喽！

当然，前提是你必须在这十几天里认真敲代码，反复咀嚼语法逻辑，比如列表、字典、字符串、if语句、for循环等最核心的东西都得捻熟于心、于手。

爬虫的总流程可以理解为：蜘蛛要抓某个猎物-->沿着蛛丝找到猎物-->吃到猎物；即爬取-->解析-->存储；

在爬取数据过程中所需参考工具如下：

爬虫框架：Scrapy

请求库：requests、selenium

解析库：正则、beautifulsoup、pyquery

存储库：文件、MySQL、Mongodb、Redis……

标签：

你应该知道什么是网络爬虫？怎样使用？的评论 (共条)