机器学习的一些基本术语

举报
川川菜鸟 发表于 2022/06/05 22:47:50 2022/06/05
【摘要】 以西瓜数据集为例,据,例如:(色泽=青绿;根蒂=蜷缩;敲声=浊响), (色泽=乌黑;根蒂=稍蜷;敲声=沉闷), (色泽=浅自;根蒂=硬挺;敲声=清脆)……每对括号内是一个西瓜的记录。定义如下: 所有记录...

以西瓜数据集为例,据,例如:(色泽=青绿;根蒂=蜷缩;敲声=浊响), (色泽=乌黑;根蒂=稍蜷;敲声=沉闷), (色泽=浅自;根蒂=硬挺;敲声=清脆)……每对括号内是一个西瓜的记录。定义如下:

  1. 所有记录的集合为:数据集
  2. 每一条记录为:一个实例(instance)或样本(sample)
  3. 例如:色泽或敲声,单个的特点为特征(feature)或属性(attribute)
  4. 对于一条记录,如果在坐标轴上表示,每个西瓜都可以用坐标轴中的一个点表示,一个点也是一个向量,例如(青绿,蜷缩,浊响),即每个西瓜为:一个特征向量(feature vector)
  5. 一个样本的特征数为:维数(dimensionality),该西瓜的例子维数为3

计算机程序学习经验数据生成算法模型的过程中,每一条记录称为一个“训练样本”,同时在训练好模型后,我
们希望使用新的样本来测试模型的效果,则每一个新的样本称为一个“测试样本”。定义如下:

  1. 所有训练样本的集合为:训练集(trainning set)
  2. 所有测试样本的集合为:测试集(test set)
  3. 机器学习出来的模型适用于新样本的能力为:泛化能(generalization),即从特殊到一般

西瓜的例子中,我们是想计算机通过学习西瓜的特征数据,训练出一个决策模型,来判断一个新的西瓜是否是好瓜。可以得知我们预测的是:西瓜是好是坏,即好瓜与差瓜两种,是离散值。同样地,也有通过历年的人口数据,来预测未来的人口数量,人口数量则是连续值。定义如下:

  1. 预测值为离散值的问题为:分类(classification)
  2. 预测值为连续值的问题为:回归(regression)

我们预测西瓜是否是好瓜的过程中,很明显对于训练集中的西瓜,我们事先已经知道了该瓜是否是好瓜,学习器通过学习这些好瓜或差瓜的特征,从而总结出规律,即训练集中的西瓜我们都做了标记,称为标记信息。但也有
没有标记信息的情形,例如:我们想将一堆西瓜根据特征分成两个小堆,使得某一堆的西瓜尽可能相似,即都是好瓜或差瓜,对于这种问题,我们事先并不知道西瓜的好坏,样本没有标记信息。定义如下:

  1. 训练数据有标记信息的学习任务为:监督学习(supervised learning)
  2. 训练数据没有标记信息的学习任务为:无监督学习(unsupervised learning)

文章来源: chuanchuan.blog.csdn.net,作者:川川菜鸟,版权归原作者所有,如需转载,请联系作者。

原文链接:chuanchuan.blog.csdn.net/article/details/125112975

【版权声明】本文为华为云社区用户转载文章,如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。