《Spark机器学习进阶实战》——2.5 本章小结
【摘要】 本书摘自《Spark机器学习进阶实战》——书中的第2章,第2.5节,作者是马海平、于俊、吕昕、向海。
2.5 本章小结
本章从数据分析概念出发,总结了常用的数据分析流程,并对数据分析流程相关步骤进行了说明。本章中的流程只是作者的经验总结,可能和其他资料中的流程有所区别,一切以做好数据分析为核心,请在做好数据分析的情况下自主总结流程。
同时,本章对数据分析基本方法进行了说明,以统计分析为主,兼顾机器学习,不仅对结果进行解释,让人更加直观、清晰地认识世界,同时对模型进行评估,着眼于预测未来,并提出决策性建议。
对于一些可以从Spark官网上获取的算法示例代码,我们没有进行展示,需要的读者可以从https://github.com/datadance上下载。
本章使用的数据集是:从stanford爬取下来的gowalla数据。数据下载地址为https://snap.stanford.edu/data/loc-gowalla.html。
在下一章中,我们将重点研究使用MLlib构建分类模型。
【版权声明】本文为华为云社区用户原创内容,转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息, 否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱:
cloudbbs@huaweicloud.com
- 点赞
- 收藏
- 关注作者
评论(0)