当前位置: 首页 > news >正文

虚假工作预测数据集

摘要:该数据集用于识别虚假招聘信息,包含职位标题、描述、要求等文本特征和公司Logo、远程办公等结构化特征,存在类别不平衡和缺失值问题,适合文本分类和欺诈检测任务。

数据集简介

数据集概述

该数据集包含17,880条招聘信息,共18个特征列,文件大小约50MB。数据集旨在识别虚假招聘信息,其中真实职位17,014条(95.16%),虚假职位866条(4.84%),存在显著的类别不平衡问题。特征包括职位标题、地点、公司简介、职位描述、要求、福利等文本字段,以及远程办公、公司Logo、就业类型等结构化字段。

数据集存在大量缺失值,其中薪资范围缺失率高达83.96%,部门缺失64.58%,学历要求缺失45.33%,福利缺失40.34%。文本类特征(描述、要求)相对完整,缺失率低于15%。结构化特征显示79.53%的职位有公司Logo,仅4.29%支持远程办公,就业类型以全职为主(11,620条)。

数据集适合文本分类和欺诈检测任务。建议使用SMOTE或类权重技术处理类别不平衡,对文本字段应用TF-IDF或BERT进行特征提取,高缺失率特征可考虑删除或创建缺失指示器。推荐模型包括逻辑回归、随机森林、XGBoost或基于Transformer的深度学习模型,评估指标应关注精确率、召回率和F1分数而非准确率

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-166
文件大小:6M
原创声明:本数据集为整理作品

http://www.jsqmd.com/news/1356564/

相关文章:

  • AI图表分析提示词实战指南:从模糊指令到精准洞察
  • Android Studio中文界面设置终极指南:3步实现完整汉化体验
  • 基于Canvas与PixiJS构建高性能Web GUI菜单系统实战指南
  • OpenClaw安装使用教程一次学会,TopClaw三分钟满血对接钉钉
  • 数学建模竞赛全流程指南:从零基础到完整工作流
  • Docker部署Pix2Text:打造本地OCR与Markdown生成工作站
  • 抖店自动下单工具怎么选?抖掌柜助力商家简化订单处理提升经营效率 - 抖掌柜一键下单
  • G01|外贸陪跑服务是什么意思?一文讲清楚
  • Spring Cloud Alibaba架构优化:百万级QPS淘客平台实战
  • 半导体制造AI大脑——AI Agent:从CIM 1.0到CIM 3.0的跃迁
  • 工业相机彩色图像采集异常解析与配置优化
  • Unity游戏翻译终极指南:XUnity.AutoTranslator从入门到精通
  • 为什么 Agent REPL 要上 Ink:好处、用法与内部设计
  • 免费pdf转图片靠这七款就够了:在线网站、电脑软件、小程序实测盘点
  • 基于FFmpeg与多屏管理技术实现16屏视频墙分割与同步播放
  • 两行代码实现网站国际化:translate.js的AI自动翻译解决方案
  • 山海万灵 HarmonyOS 文化知识设计续篇(22):知识图谱孤立节点、缺边与冲突关系检测
  • 手把手教你用Ollama本地部署Qwen3.5-9B大模型:从GGUF量化到WebUI实战
  • 如何快速集成条码扫描:Delphi开发者的完整解决方案
  • 本科生论文降AI率工具与写作技巧全指南
  • Spring Boot自动装配原理与面试高频问题解析
  • 抖店一键下单怎么高效落地?抖掌柜助力商家简化订单处理流程 - 抖掌柜一键下单
  • DCMM模型解析:企业数据管理能力成熟度评估指南
  • 从零构建语音驱动AI智能体:ASR、LLM与TTS的集成实践
  • 探寻武夷山口碑绝佳的酒店,哪家才是你的心仪之选?
  • UE4 C++开发中指针与引用的核心区别、应用场景与最佳实践
  • 2024年杭州集团网站建设指南:从战略规划到技术落地的全解析
  • Python数据分析实战:爬取B站视频数据,解析播放量Top榜单
  • FastAPI 性能扩展 Redis 缓存、Celery 异步任务与容器部署
  • AI Agent的“缰绳”:高效实现Agent Harness工程化