一.数据科学的学科地位
数据科学(英语:data science)是一门利用数据学习知识的学科,其目标是通过从数据中提取出有价值的部分来生产数据产品。 它结合了诸多领域中的理论和技术,包括应用数学、统计、模式识别、机器学习、数据可视化、数据仓库以及高性能计算。
数据科学将逐渐应用到几乎所有行业,包括健康医疗、金融、通信、教育、工业制造等。所以从就业前途发展来看,就业面广,就业前景非常好。从学科发展的角度看,数据科学将逐渐成为一门独立的学科,采用数据的方法作为研究范式将是很多其他学科的基本工具
二.统计学
统计学是通过搜索、整理、分析、描述数据等手段,以达到推断所测对象的本质,甚至预测对象未来的一门综合性科学。统计学用到了大量的数学及其它学科的专业知识,其应用范围几乎覆盖了社会科学和自然科学的各个领域。
前二者过于笼统,且不细,本文主要对机器学习和数据可视化进行探讨
三.机器学习
1、线性代数基础,如果没的话,还是先学了这门课在研究吧,不然会哭的。
2、学会python就行了。R也可以用用。
3、英语。起码能基本的听和读吧,感觉中文的资料还不够多,很难避免要看很多英文资料。建议学习某些教程时看英文版的tutorial,YouTube可以开字幕。
飞桨AI Studio - 人工智能学习实训社区 (baidu.com)
在之上的基础上,会学习更多的算法:
- 线性回归算法 Linear Regression
- 支持向量机算法 (Support Vector Machine,SVM)
- 最近邻居/k-近邻算法 (K-Nearest Neighbors,KNN)
- 逻辑回归算法 Logistic Regression
- 决策树算法 Decision Tree
- k-平均算法 K-Means
- 随机森林算法 Random Forest
- 朴素贝叶斯算法 Naive Bayes
- 降维算法 Dimensional Reduction
- 梯度增强算法 Gradient Boosting
四.数据可视化
数据可视化,是关于数据视觉表现形式的科学技术研究。其中,这种数据的视觉表现形式被定义为,一种以某种概要形式抽提出来的信息,包括相应信息单位的各种属性和变量。
它是一个处于不断演变之中的概念,其边界在不断地扩大。主要指的是技术上较为高级的技术方法,而这些技术方法允许利用图形、图像处理、计算机视觉以及用户界面,通过表达、建模以及对立体、表面、属性以及动画的显示,对数据加以可视化解释。与立体建模之类的特殊技术方法相比,数据可视化所涵盖的技术方法要广泛得多。
主要工具有如下:Excel 、Gephi、 CartoDB 、Google Chart API 、D3、Crossfilter、Raphael等
数据可视化能督促数据治理和管理提升,因为展现出来的数据要是有问题,要么是数据质量问题,要么是管理上存在问题,通过可视化还可以倒逼数据质量,或者提出指标的改进方案和行动计划,以此提升关键指标,数据的可视化是管理者最好的利器。



