当前位置: 首页 > news >正文

python爬取贝壳中二手房的数据

前言:通过代码爬取贝壳中二手房的数据,以此给更多需要了解爬虫或者二手房信息的人提供便利。

第一部分:爬取地址

1.1贝壳首页地址

jiujiang.ke.com

第二部分:爬取数据

2.1输入要爬多少页

int(input('输入一共要多少页,输入整数:'))

2.2找到要请求的网址

wangzhi = f'https://jiujiang.ke.com/ershoufang/pg{y}/'

2.3定位多个房源信息位置

page.eles('xpath://div[@class="info clear"]', timeout=20)

2.4设置要爬的信息

​ for x in loc: # 标题 biaoti = x.ele('xpath:.//div[@class="title"]/a').text # 地址 address = x.ele('xpath:.//div[@class="positionInfo"]/a').text # 概述 info = x.ele('xpath:.//div[@class="houseInfo"]').text # 总价 price = x.ele('xpath:.//div[@class="totalPrice totalPrice2"]/span').text ​ # 详情页链接 lianjie = x.ele('xpath:.//div[@class="positionInfo"]/a').attr('href')

第三部分:保存信息

pandas.DataFrame(kong_list).to_csv('贝壳二手房(九江).csv', index=False)

全部的代码见文章末尾

更多信息请关注......,本篇文章的源码如下

from DrissionPage import ChromiumPage import time import pandas kong_list = [] num = int(input('输入一共要多少页,输入整数:')) for y in range(1, num+1): page = ChromiumPage() wangzhi = f'https://jiujiang.ke.com/ershoufang/pg{y}/' page.get(wangzhi) # 遇到需要验证的页码,就跳过进入下一页 loc = page.eles('xpath://div[@class="info clear"]', timeout=20) # 定位多个房源信息的位置 for x in loc: # 标题 biaoti = x.ele('xpath:.//div[@class="title"]/a').text # 地址 address = x.ele('xpath:.//div[@class="positionInfo"]/a').text # 概述 info = x.ele('xpath:.//div[@class="houseInfo"]').text # 总价 price = x.ele('xpath:.//div[@class="totalPrice totalPrice2"]/span').text # 详情页链接 lianjie = x.ele('xpath:.//div[@class="positionInfo"]/a').attr('href') print('\n', biaoti, address, info, price, lianjie) kong_list.append({ '标题': biaoti, '地址': address, '概述': info, '总价': price+'万', '详情链接': lianjie, }) time.sleep(3) # 写入文件 pandas.DataFrame(kong_list).to_csv('贝壳二手房(九江).csv', index=False)
http://www.jsqmd.com/news/1284950/

相关文章:

  • (2026最新)韶关本地人必选的靠谱漏水检测维修推荐:正规防水补漏防水-卫生间/厨房/屋顶/阳台/外墙渗漏水精准测漏,本地人的信赖之选 - 安佳防水
  • 推荐一下桥用超长吊篮供应商 - 品牌推广大师
  • Python子域名探测实战:从基础脚本到智能侦察兵的进阶之路
  • 如何在Windows平台上实现智能化的演示时间管理?
  • HDMI 2.1核心技术解析:FRL、DSC、VRR与ALLM如何重塑影音游戏体验
  • 32.最长有效括号(序列dp)
  • 判断力 + 可测试性:AI 研发浪潮下的工程师终极壁垒
  • 关于HTML,你应该知道的基础知识
  • Android 7系统休眠唤醒(八)内核层—Alarm定时唤醒与硬件唤醒源
  • 2026年7月市面上口碑好的自动化装备实力厂家推荐,液压数控折弯机/数控液压剪板机,自动化装备生产厂家推荐 - 品牌推荐师
  • DDrawCompat完整指南:三步让经典DirectX游戏在现代Windows上重生
  • AI推理框架选型指南:OpenVINO、TensorRT与MediaPipe深度对比
  • 2026年7月海口全铝防白蚁板材/全铝蜂窝板材厂家口碑推荐_海口龙华湘派家居定制厂 - 品牌宣传支持者
  • 从玩具到工程思维:用Boson Kit带孩子理解数字信号与逻辑门
  • LangGraph实战:从零构建多步AI工作流与智能体开发指南
  • 如何快速创建专业节点图:3个简单步骤完成可视化
  • C++通讯录管理系统:从零实现面向对象编程与STL容器应用
  • 68.高级RAG-父子索引优化
  • 隐藏技巧:Kafka云原生技术解析与性能优化秘籍
  • 3大核心功能揭秘:BilibiliCommentScraper如何帮你获取完整B站评论数据
  • C++命令行解析库cmdline:轻量级工具开发利器
  • 2026年7月海口本地工厂全铝定制/海南全铝定制厂家推荐案例_海口龙华湘派家居定制厂 - 品牌宣传支持者
  • 基于Dify与RAG技术构建游戏智能助手实战指南
  • 简单计算器-计算竞对每日推广花费
  • Arduino入门实战:从硬件思维到项目开发的全流程解析
  • Cognistack的自述:我是谁
  • VMware vcpu-0错误排查:从虚拟化原理到系统化修复指南
  • Python lxml库从入门到精通:高效处理XML与HTML数据
  • RK3568 Android 15嵌入式Linux驱动开发实战:从内核到HAL完整指南
  • 服装档口数字化转型:微信抖音双平台运营实战指南