新闻中心

python中如何使用XPath爬取小说

2025-11-16
浏览次数:
返回列表
答案:使用Python的requests和lxml库,通过发送请求、XPath解析提取小说标题和正文,可批量爬取并保存内容。需注意动态加载、反爬机制及版权问题。

python中如何使用xpath爬取小说

在Python中使用XPath爬取小说,主要是借助requests获取网页内容,再用lxml库解析HTML并使用XPath提取章节标题、正文等信息。下面是一个实用的流程说明。

安装所需库

你需要先安装requestslxml

pip install requests lxml

基本步骤与代码示例

以爬取某小说网站的一章内容为例(注意:仅用于学习,请遵守目标网站的robots协议和法律法规)。

1. 发送请求获取页面

使用requests模拟浏览器访问小说章节页面:

import requests
from lxml import html

headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36'
}

url = 'https://www.php.cn/link/319bb7e0f80716c134117d14a22d461e' # 替换为实际网址
response = requests.get(url, headers=headers)
response.encoding = 'utf-8' # 根据网页编码调整,常见为 utf-8 或 gbk
tree = html.fromstring(response.text)

2. 使用XPath提取内容

通过浏览器开发者工具(F12)查看小说标题和正文所在的HTML标签,构造XPath表达式。

Whimsical Whimsical

Whimsical推出的AI思维导图工具

Whimsical 182 查看详情 Whimsical # 提取章节标题,假设标题在


title = tree.xpath('//h1[@class="title"]/text()')
title = title[0].strip() if title else '未知标题'

提取正文内容,假设段落在 内的 p 标签中

content_list = tree.xpath('//div[@id="content"]//p/text()')
content = '\n'.join([line.strip() for line in content_list if line.strip()])

3. 保存到本地文件

with open('chapter_1.txt', 'w', encoding='utf-8') as f:
f.write(f"{title}\n\n{content}")

批量爬取多章节

如果要爬整本小说,可先获取目录页的所有章节链接:

catalog_url = 'https://www.php.cn/link/a58269cb74a093b377cd217b72bd15b9/catalog'
response = requests.get(catalog_url, headers=headers)
tree = html.fromstring(response.text)

假设章节链接在

links = tree.xpath('//div[@class="list"]//a/@href')

for i, link in enumerate(links[:10]): # 先测试前10章
chapter_url = 'https://www.php.cn/link/a58269cb74a093b377cd217b72bd15b9' + link

重复上面的请求和提取逻辑

# ...

注意事项

使用XPath爬取小说时需注意以下几点:

  • 部分网站使用J*aScript动态加载内容,requests + lxml无法获取,需改用SeleniumPlaywright
  • 频繁请求可能触发反爬机制,建议添加time.sleep()延时
  • 尊重版权,仅限个人学习或测试,不要大规模传播或商用
  • 检查robots.txt,避免抓取禁止内容

基本上就这些。掌握XPath语法和网页结构分析能力后,爬取小说会变得很直接。

以上就是python中如何使用XPath爬取小说的详细内容,更多请关注其它相关文章!


# 小说爬取  # xpath  # 工具  # app  # 浏览器  # 编码  # windows  # html  # java  # python  # javascript  # 龙岗社区网站建设  # sem和seo自学视频  # 宜昌网站推广优化找哪家  # 肇庆网站建设立项  # seo西装  # 奉贤seo优化价格  # 贵阳关键词网站优化排名  # 黑龙江品牌网站推广平台  # 本地网站建设运营方案  # 杨浦区网站优化排名  # 中文网  # 得很  # 相关文章  # 所需  # 加载  # 是一个  # 与非  # 如何用  # 有何  # 如何使用 


相关栏目: 【 科技资讯46185 】 【 网络学院92790


相关推荐: C++如何检测键盘输入_C++ _kbhit与_getch函数非阻塞输入  poki网页游戏推荐_poki免费游戏平台入口  J*a 递归快速排序中静态变量的状态管理与陷阱  解决深度学习模型训练初期异常高损失与完美验证准确率问题  vivo手机互传视频怎么操作_vivo手机互传视频详细传输方法  Excel如何用迷你图显趋势_Excel用迷你图显趋势【趋势小图】  J*aScript类型检查_j*ascript代码规范  如何创建没有密码的Windows本地账户_跳过微软账户登录的技巧【教程】  高德地图沿途添加点失败如何解决 高德多点规划方法  PDO预处理语句中冒号的正确处理:区分SQL函数格式与命名占位符  Python vgamepad库按键模拟:正确使用XUSB_BUTTON常量  ArchiveofOurOwn小说阅读-ArchiveofOurOwn同人作品访问链接  PyTorch模型训练准确率不提升:诊断与修复常见指标计算错误  汽水音乐车机版横屏版7.1 汽水音乐车机版横屏版下载入口  Golang如何优雅处理error_Golang error处理最佳实践总结  必由学网页版入口 必由学官方平台直接访问  晋江读书网页版在线登录 晋江读书电脑版官网  Descript怎样用AI剪辑自动去噪_Descript用AI剪辑自动去噪【自动降噪】  微博网页版官方账号登录 微博网页版内容浏览使用指南  苹果手机如何防止被恶意App追踪  蛙漫漫画免费阅读入口_蛙漫官方正版无广告纯净版  深入理解J*a编译器的兼容性选项:从-source到--release  AO3访问入口汇总 AO3网页版同人作品一键直达  天猫双十一预售商品怎么退款_天猫双十一预售退款操作指南  中兴Axon42Ultra怎样在文件App筛图_iPhone中兴Axon42Ultra文件App筛图【图片筛选】  拼多多视频播放卡顿如何处理 拼多多视频播放优化技巧  不会效仿卡普空!《铁拳》制作人澄清:不采取赛事付费|直播|  现代化 SciPy 一维插值:interp1d 的替代方案与最佳实践  抖音未来赚钱的新趋势 2025年值得关注的变现风口分析  QQ邮箱电脑版登录入口_QQ邮箱官方网站登录平台  从J*aScript对象中精确提取指定属性的教程  不同用户不同价格! 索尼开启账户个性化定价测试  php源码怎么在电脑上测试_电脑测试php源码方法步骤【教程】  没有大陆身份证/银行卡如何实名微信? 亲测有效的几种方法分享  CSS Grid如何控制元素对齐_align-items与justify-items组合使用  QQ邮箱官方邮箱登录入口 QQ邮箱网页版快速访问  Excel函数批量查找替换超快方法_Excel用REPLACE和FIND函数秒级替换  将HTML动态表格多行数据保存到Google Sheet的教程  Win11怎么安装Linux子系统 Win11 WSL2安装Ubuntu及环境配置指南  Win11蓝牙耳机断连怎么解决 Win11蓝牙设置重新配对与驱动更新【技巧】  qq游戏跨平台入口_qq游戏多设备同步登录  使用CSS更改登录屏幕输入框中PNG图标颜色的策略与局限性  百度浏览器字体显示异常偏小_百度浏览器字体渲染修复方案  c++中的std::forward_list和std::list有什么不同_c++ forward_list与list区别分析  在J*a中如何使用Stream.map转换元素_Stream映射操作解析  Composer的 "conflict" 字段有什么用_如何声明不兼容的包以避免依赖冲突  自定义Bag-of-Words实现:处理带负号的词汇权重  如何使用J*aScript精确选择并批量修改特定父元素下子链接的样式  Golang如何实现Web文件静态资源服务器_Golang静态资源服务器开发与实践  React列表渲染与独立状态管理:避免全局状态影响局部更新 

搜索