当前位置: 首页 > news >正文

8-机器学习之聚类

目录

一 Kmeans 算法原理

二 k-means 应用于非分离的数据集

三 优化目标函数

四 如何设置初始聚类中心

五 初始化K值的方法


背景:有监督的学习中,训练数据需要有标签,而无监督学习中,训练数据不需要任何标签。

一 Kmeans 算法原理

1.生成随机点(聚类中心)

2.迭代执行如下两步until 聚类中心不再发生变化

  • 遍历每一个样本,计算每一个样本与不同聚类中心的距离,然后分配给相应的类
  • 在类别内部遍历每一个样本,将类别中心移动到簇的中心(求类别内样本的均值即可)

二 k-means 应用于非分离的数据集

如下图右侧的数据集,没有明显的分割区间的情况下如何处理?

虽然看似不可分,但如果执行k-means 之后还是会分成如下的不同类别

三 优化目标函数

优化的目标是让簇内的样本离簇中心的举例最小

四 如何设置初始聚类中心

1.随机挑选k个训练样本(k<m(样本总数))

2.尝试多次初始化,避免落在局部最优解

五 初始化K值的方法

通常,聚类的目的是为下游处理决策服务的,因此可以根据实际权衡来设定K。举例如下:

通常可以把衣服尺寸分为S\M\L三类出售,由于尺寸较少,所以成本便宜,但是顾客穿起来不一定合身。也可以选择把衣服尺寸分为XS\S\M\L\XL五类,此时尺寸较多,成本较高,但是顾客的满意度可能会变高。这样就根据你的权衡来选择分三类还是五类

http://www.jsqmd.com/news/1281963/

相关文章:

  • Godot 4 CharacterBody2D 角色移动:输入、碰撞与八方向控制实战
  • 2026成都郫都区管道疏通避坑指南:真实测评推荐本地靠谱师傅 - 余生黄金回收
  • 资源全、音质好的点读笔怎么选?宝宝巴士 G4 从早教到哄睡一支搞定
  • 什么是中间件
  • 原来重庆口碑好的会议系统厂家这么多,究竟哪个好呢?
  • MySQL——基础知识
  • GEO优化服务商推荐:哪个系统能真正量化效果? - 行业深度分析
  • AI短剧创作系统:源码交付与全流程自动化实践
  • EncodingChecker:3步解决文件乱码问题的终极指南
  • Opencv进阶篇---轮廓检测
  • Axure RP 中文汉化终极指南:三分钟解锁专业中文界面
  • 物联网设备超低功耗设计:NBM7100A与PIC18F47Q10方案解析
  • numpy 2019.9,1
  • 数据中心CDU配套阀门品牌排名:2026横评对比 - 行业深度分析
  • 基于LlamaIndex和OpenAI的AI智能体自我评估系统开发
  • C++引用:从基础别名到现代移动语义的深度解析与实战指南
  • 杭州企业财税业务服务商推荐|2026 正规财税公司十个甄选浙江乘风财务咨询有限公司:疑难税务代办/资质代办/补贴代办财税 - 栗子测评
  • 2026精选金牛区保洁公司综合实力排行名单一览 - 起跑123
  • MongoDB 4.2——持久性
  • 健康咨询数字人落地复盘:魔珐星云让“小星”先像服务入口,再补准认知层
  • 【剑指Offer】斐波那契数列之青蛙跳台阶
  • 5分钟掌握OpenUtau:开源虚拟歌手编辑器的完整使用指南
  • 前端转网安真的快吗,JavaScript 技能在渗透测试中到底能省多少力
  • 智能自动化助手:Twitch Drops Miner如何解放你的游戏时间
  • NBM7100A芯片在纽扣电池物联网设备中的能量优化方案
  • GetQzonehistory:3步完成QQ空间数据备份的终极解决方案
  • 从“听得清”到“智会通”:重庆会议系统场景深耕与技术跃迁
  • WordPress独立站搭建成本全解析:从域名到运维的完整预算方案
  • 不手写代码的第 30 天,我才明白前端这个岗位还剩什么
  • [数据结构] 树和二叉树-哈夫曼树和哈夫曼编码