《Python爬虫工程师从入门到进阶》是一套系统化、实战型的Python网络爬虫课程,面向希望学习网络数据采集、自动化处理和爬虫工程开发的初学者及进阶开发者。课程以Python为核心,从基础语法和网络请求入手,逐步深入网页解析、数据提取、异步爬虫、反爬机制以及大型爬虫项目开发,帮助学员建立完整的爬虫技术知识体系。
课程前期将从Python基础知识开始,结合爬虫实际应用场景学习Requests、HTTP协议、URL、Cookie、Session等核心内容,掌握网页请求与响应的基本原理。在数据解析部分,将深入学习XPath、BeautifulSoup、正则表达式等常用技术,实现对HTML页面中的文本、图片、链接及结构化数据进行高效提取。同时结合JSON、Ajax等技术,理解动态网页的数据加载方式。
随着课程深入,还将学习Selenium、Playwright等浏览器自动化技术,以及Scrapy爬虫框架,掌握项目化、模块化的爬虫开发方式,并进一步学习多线程、多进程、异步协程等技术,提高数据采集效率。针对真实开发中经常遇到的问题,课程还会介绍请求频率控制、代理、请求头、Cookie管理、验证码等反爬相关知识,帮助学员理解如何在遵守网站规则和法律法规的前提下设计稳定的数据采集程序。
课程通过多个综合项目进行实战,将数据采集、解析、清洗、存储和自动化任务串联起来,并结合MySQL、Redis等数据库技术完成数据持久化。通过系统学习,学员能够逐步掌握从简单脚本到工程化爬虫项目的开发思路,为从事Python开发、数据采集、自动化测试、数据分析及爬虫工程相关工作打下扎实基础。

课程目录:
└── 325 – 从零起步 系统入门Python爬虫工程师/
├── 第01章 从零开始 系统入门python爬虫工程师-课程导学/
│ └── 1-1 从零开始 系统入门python爬虫工程师-课程导学.mp4
├── 第02章 开发环境搭建 视频+文档教程/
│ ├── 2-1 python的安装.mp4
│ ├── 2-2 python的安装和配置 – linux.doc
│ ├── 2-3 python的安装和配置 – mac.doc
│ ├── 2-4 pycharm的安装和配置 .mp4
│ ├── 2-5 课程中用到的pycharm快捷键.mp4
│ ├── 2-6 mysql和navicat的安装和使用.mp4
│ ├── 2-7 mysql和navicat的安装和配置 – linux.doc
│ ├── 2-8 mysql和navicat的安装和配置 – mac.doc
│ ├── 2-9 虚拟环境的安装和配置.mp4
│ ├── 2-10 虚拟环境的安装和配置 – linux.doc
│ └── 2-11 虚拟环境的安装和配置 – mac.doc
├── 第03章 彻底了解网络爬虫/
│ ├── 3-1 爬虫能做什么? .mp4
│ ├── 3-2 Python网络爬虫需要学习的知识和解决的问题 .mp4
│ └── 3-3 爬虫是万能的吗? .mp4
├── 第04章 爬虫工程师基本功–计算机网络协议基础/
│ ├── 4-1 为什么我们需要学习计算机网络.mp4
│ ├── 4-2 一个完整的网络请求过程.mp4
│ ├── 4-3 ip地址和url详解 – 为什么网站一般不会封ip?.mp4
│ ├── 4-4 有哪些网络协议?.mp4
│ ├── 4-5 我们经常看到的tcp-ip协议是什么?.mp4
│ ├── 4-6 socket编程 – 客户端和服务端通信 – 1.mp4
│ ├── 4-7 socket编程 – 客户端和服务端通信-2.mp4
│ ├── 4-8 基于tcp自定义第一个协议 – 模拟qq服务器和客户端 – 1.mp4
│ ├── 4-9 基于tcp自定义第一个协议 – 模拟qq服务器和客户端 – 2.mp4
│ ├── 4-10 基于tcp自定义第一个协议 – 模拟qq服务器和客户端 – 3.mp4
│ ├── 4-11 正确认识http协议 – 1.mp4
│ ├── 4-12 正确认识http协议 -2.mp4
│ └── 4-13 本章课后作业.mp4
├── 第05章 爬虫工程师基本功–前端基础/
│ ├── 5-1 html、css和JavaScript之间的关系…1.mp4
│ ├── 5-2 浏览器的加载过程.mp4
│ ├── 5-3 dom树和JavaScript操作dom树.mp4
│ ├── 5-4 ajax、json和xml.mp4
│ ├── 5-5 动态网页和静态网页.mp4
│ ├── 5-6 GET、POST方法和Content-type详解.mp4
│ ├── 5-7 ajax方式提交表单数据.mp4
│ └── 5-8 本章课后作业.mp4
├── 第06章 爬虫前置知识讲解&爬虫初体验/
│ ├── 6-1 爬虫采集方案分类 .mp4
│ ├── 6-2 requests功能详解 .mp4
│ ├── 6-3 正则表达式-基本语法 .mp4
│ ├── 6-4 正则表达式 – python接口 .mp4
│ ├── 6-5 beautifulsoup用法 – find方法 .mp4
│ ├── 6-6 beautifulsoup用法 – 父子节点和兄弟节点获取 .mp4
│ ├── 6-7 xpath基本语法 – 1 .mp4
│ ├── 6-8 xpath基本语法 – 2 .mp4
│ └── 6-9 css选择器提取元素 .mp4
├── 第07章 项目实战1 – 论坛网站,实现静态网页数据抓取/
│ ├── 7-1 需求分析.mp4
│ ├── 7-2 pymysql的简单使用.mp4
│ ├── 7-3 peewee自动生成表_1.mp4
│ ├── 7-4 通过peewee对数据进行增、删、改、查.mp4
│ ├── 7-5 models表结构设计.mp4
│ ├── 7-6 分析和获取所有的版块 – 1.mp4
│ ├── 7-7 分析和获取所有的版块 – 2.mp4
│ ├── 7-8 论坛网站-反爬的分析.mp4
│ ├── 7-9 获取和解析列表页-1.mp4
│ ├── 7-10 获取和解析列表页 – 2.mp4
│ ├── 7-11 获取和解析详情页 – 1.mp4
│ ├── 7-12 获取和解析详情页 – 2.mp4
│ ├── 7-13 获取个人信息详情-1.mp4
│ └── 7-14 获取个人信息详情 – 2.mp4
├── 第08章 多线程和线程池编程 – 进一步改造爬虫/
│ ├── 8-1 并发和并行.mp4
│ ├── 8-2 多线程编程.mp4
│ ├── 8-3 python的GIL真的会导致多线程慢吗?.mp4
│ ├── 8-4 线程同步 – Lock.mp4
│ ├── 8-5 使用多线程重构csdn爬虫 – 1.mp4
│ ├── 8-6 使用多线程重构csdn爬虫 – 2.mp4
│ ├── 8-7 使用多线程和Queue重构csdn爬虫.mp4
│ ├── 8-8 进一步的思考 – 课后作业.mp4
│ ├── 8-9 ThreadPoolExecutor的基本功能.mp4
│ └── 8-10 ThreadPoolExecutor线程池重构爬虫.mp4
├── 第09章 项目实战2-电商网站,实现动态网网站的数据抓取/
│ ├── 9-1 需求分析 .mp4
│ ├── 9-2 表结构设计 .mp4
│ ├── 9-3 chrome的f12后的调试工具栏介绍 .mp4
│ ├── 9-4 京东的商品详情页接口分析 .mp4
│ ├── 9-5 通过requests完成京东详情页数据的获取 .mp4
│ ├── 9-6 selenium的安装和使用 .mp4
│ ├── 9-7 通过selenium解析商品详情页 – 1 .mp4
│ ├── 9-8 通过selenium解析商品详情页 – 2 .mp4
│ ├── 9-9 通过selenium解析商品详情页 – 3 .mp4
│ ├── 9-10 通过selenium解析商品详情页 – 4 .mp4
│ ├── 9-11 通过selenium解析商品详情页 – 5 .mp4
│ ├── 9-12 chromedirver的headless模式和设置不加载图片 .mp4
│ └── 9-13 课后作业和总结 .mp4
├── 第10章 实战项目3-社区网站,实现模拟登陆和验证码/
│ ├── 10-1 章节目标和为什么需要模拟登录.mp4
│ ├── 10-2 模拟登录的原理- session和cookie的原理.mp4
│ ├── 10-3 requests模拟登录豆瓣.mp4
│ ├── 10-4 将cookie保存到文件中并从文件中读取cookie.mp4
│ ├── 10-5 selenium模拟登录豆瓣.mp4
│ ├── 10-6 滑动验证码识别 和selenium模拟登录B站 – 1.mp4
│ ├── 10-7 滑动验证码识别 和selenium模拟登录B站 – 2.mp4
│ ├── 10-8 滑动验证码识别 和selenium模拟登录B站 – 3.mp4
│ ├── 10-9 第三方验证码识别服务商推荐camproj.mp4
│ └── 10-10 课后作业和总结.mp4
├── 第11章 先懂反爬再应对反爬/
│ ├── 11-1 反爬和反反爬.mp4
│ ├── 11-2 常见的反爬方案.mp4
│ ├── 11-3 通过user-agent反爬.mp4
│ ├── 11-4 通过收费的代理ip绕过反爬 – 1.mp4
│ ├── 11-5 通过收费的代理ip绕过反爬 – 2.mp4
│ └── 11-6 通过一个实际的案例分析一下反爬策略是什么.mp4
├── 第12章 学会用框架,scrapy实现快速开发爬虫/
│ ├── 12-1 新建scrapy项目 .mp4
│ ├── 12-2 通过pycharm调试scrapy .mp4
│ ├── 12-3 编写spider的逻辑 .mp4
│ ├── 12-4 item和pipeline .mp4
│ └── 12-5 scrapy集成随机useragent和ip代理 .mp4
├── 第13章 帮你规划一条通往高级爬虫工程师的进阶之路/
│ ├── 13-1 课程总结.mp4
│ └── 13-2 成为高级爬虫工程师的学习建议.mp4
└── 资料及代码/
└── resources/
├── PPT/
│ ├── 第二章 – 开发环境配置.pptx
│ ├── 第七章 多线程和多进程.pptx
│ ├── 第三章 – 什么是爬虫?.pptx
│ ├── 第四章 – 计算机网络基础.pptx
│ ├── 第四章 – 前端基础.pptx
│ ├── 第四章 – http协议详解.pptx
│ ├── 第五章 – 爬虫前置知识.pptx
│ ├── 第一章 – 课程总览.pptx
│ ├── 第一章 导学.pptx
│ └── 课后作业.pptx
└── spider/
├── anti_spider/
│ ├── __init__.py
│ ├── ip_test.py
│ ├── requests_test.py
│ └── ua_test.py
├── csdn_spider/
│ ├── __pycache__/
│ │ ├── __init__.cpython-36.pyc
│ │ └── models.cpython-36.pyc
│ ├── __init__.py
│ ├── how_to_improve.md
│ ├── models.py
│ ├── peewee_test.py
│ ├── pymysql_test.py
│ └── spider.py
├── html_test/
│ ├── __pycache__/
│ │ └── __init__.cpython-36.pyc
│ ├── __init__.py
│ ├── ajax_test.html
│ ├── dom_test.html
│ ├── hello-html.html
│ ├── http_server.py
│ ├── js_post.html
│ └── mycss.css
├── jd_spider/
│ ├── __pycache__/
│ │ ├── __init__.cpython-36.pyc
│ │ └── models.cpython-36.pyc
│ ├── __init__.py
│ ├── bilibili_selenium_spider_new
│ ├── bilibli_selenium_login.py
│ ├── captcha1.png
│ ├── jd_selenium_spider.py
│ ├── jd.html
│ ├── models.py
│ ├── re_test.py
│ ├── selenium_test.py
│ └── spider.py
├── scrapy_test/
│ ├── .idea/
│ │ ├── inspectionProfiles/
│ │ │ └── Project_Default.xml
│ │ ├── encodings.xml
│ │ ├── misc.xml
│ │ ├── modules.xml
│ │ ├── scrapy_test.iml
│ │ └── workspace.xml
│ ├── scrapy_test/
│ │ ├── __pycache__/
│ │ │ ├── __init__.cpython-36.pyc
│ │ │ ├── items.cpython-36.pyc
│ │ │ ├── models.cpython-36.pyc
│ │ │ ├── pipelines.cpython-36.pyc
│ │ │ └── settings.cpython-36.pyc
│ │ ├── spiders/
│ │ │ ├── __pycache__/
│ │ │ │ ├── __init__.cpython-36.pyc
│ │ │ │ └── csdn.cpython-36.pyc
│ │ │ ├── __init__.py
│ │ │ └── csdn.py
│ │ ├── __init__.py
│ │ ├── items.py
│ │ ├── middlewares.py
│ │ ├── models.py
│ │ ├── pipelines.py
│ │ └── settings.py
│ ├── main.py
│ └── scrapy.cfg
├── socket_test/
│ ├── __init__.py
│ ├── http_server.py
│ ├── json_server.py
│ ├── myqq_client.py
│ ├── myqq_client2.py
│ ├── myqq_client3.py
│ ├── myqq_server.py
│ ├── socket_client.py
│ ├── socket_http.py
│ ├── socket_server.py
│ └── xuqiu.py
├── spider_login/
│ ├── __init__.py
│ ├── douban_login.py
│ ├── douban_slenium_login.py
│ ├── douban.cookie
│ └── json_server.py
├── spider_start/
│ ├── __init__.py
│ ├── bs_test.py
│ ├── cssselect_test.py
│ ├── reg_test.py
│ └── requests_test.py
└── threading_spider/
├── __init__.py
├── gil_test.py
├── queue_test.py
├── thread_test_back.py
├── thread_test.py
├── threading_spider_queue.py
├── threading_spider.py
├── threading_sync.py
├── threadpool_spider.py
└── threadpool_test.py
侵权联系与免责声明: 1、本站资源所有内容均收集于网络,与本网站立场无关 2、本站所有资源收集于互联网,由用户分享,该帖子作者与IT课程网不享有任何版权,如有侵权请联系本站删除 3、本站部分内容转载自其它网站,但并不代表本站赞同其观点和对其真实性负责 4、如本帖侵犯到任何版权问题,请立即告知本站,本站将及时予与删除并致以最深的歉意。如有侵权请联系联系客服QQ:1960026872或登录本站账号进入个人中心提交工单留言反馈,我们将第一时间处理!
