《Spark机器学习进阶实战》——2.5 本章小结

举报
华章计算机 发表于 2019/05/31 01:42:16 2019/05/31
【摘要】 本书摘自《Spark机器学习进阶实战》——书中的第2章,第2.5节,作者是马海平、于俊、吕昕、向海。

2.5 本章小结

本章从数据分析概念出发,总结了常用的数据分析流程,并对数据分析流程相关步骤进行了说明。本章中的流程只是作者的经验总结,可能和其他资料中的流程有所区别,一切以做好数据分析为核心,请在做好数据分析的情况下自主总结流程。

同时,本章对数据分析基本方法进行了说明,以统计分析为主,兼顾机器学习,不仅对结果进行解释,让人更加直观、清晰地认识世界,同时对模型进行评估,着眼于预测未来,并提出决策性建议。

对于一些可以从Spark官网上获取的算法示例代码,我们没有进行展示,需要的读者可以从https://github.com/datadance上下载。

本章使用的数据集是:从stanford爬取下来的gowalla数据。数据下载地址为https://snap.stanford.edu/data/loc-gowalla.html。

在下一章中,我们将重点研究使用MLlib构建分类模型。




【版权声明】本文为华为云社区用户原创内容,转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息, 否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。