会算数就能混成IT界科学家?

企业动态
“数据科学家是指能采用科学方法、运用数据挖掘工具对复杂多量的数字、符号、文字、网址、音频或视频等信息进行数字化重现与认识,并能寻找新的数据洞察的 工程师或专家(不同于统计学家或分析师)。

 两年前,一项来自LinkedIn的调查结果显示,“统计分析和数据挖掘”是2014年***的求职法宝。在大数据技术飞速发展的今天,数据科学家成了炙手可热的大红人。

[[171993]]

数据科学家是谁?干嘛的?真的不是算命的?他们好找工作吗?

度娘说

“数据科学家是指能采用科学方法、运用数据挖掘工具对复杂多量的数字、符号、文字、网址、音频或视频等信息进行数字化重现与认识,并能寻找新的数据洞察的 工程师或专家(不同于统计学家或分析师)。一个优秀的数据科学家需要具备的素质有:懂数据采集、懂数学算法、懂数学软件、懂数据分析、懂预测分析、懂市场 应用、懂决策分析等。”

度娘还是666啊!!!!

不过太严肃了,我都没听懂,and what about you?还有一种听起来就像人话的多了:

“你擅长数学,会用Python编程,而且还对某个行业了如指掌?如果你拥有这样的技能集,那你就有可能当上数据科学家。”

“技能集”。技能集?!能吃吗?

[[171994]]

是不是对当上数据科学家再不敢奢望,但如果我告诉你,有一些看上去站着说话不腰疼的人说了这样的话:

“数据科学家大多只做算术,这是件好事。”

比如这位——在Basecamp(37signals公司旗下一款项目管理软件 )团队工作的Noah。很多时候他被人称为“数据科学家”,但在他自己看来,大部分情况下他只是做做算术,而且他也很喜欢。

这是Noah在过去几周里所做的一些工作,每一项都是为了应对Basecamp在实际业务中面临的问题:

  • 分析来自不同国家用户的对话内容、试用完成度和平均帐单数量
  • 确定人们当人们登录至一个现有帐户时偶然注册Basecamp的比例,以及长期以来这个现象的变化情况
  • 分析和报告一些Basecamp产品的财务业绩
  • 对帐户所有者进行调查并分析
  • 对一项影响Basecamp用户行为特征的AB测试进行分析

在过去的两周里,Noah所做过的最“复杂”的数学是一些有力的分析和重要测试。他工作的大部分是写SQL queries 来获取数据,对数据进行基本的运算(计算差异,百分比等),绘制结果,并写下注释或建议。

注意昂~可没有编码任何算法、构建推荐引擎昂~也没有部署深度学习系统,或是建立一个神经网络昂~

为什么没有?可能因为现在 Basecamp 还不需要那些东西吧。

在繁花似锦的“数据科学”下有个不怎么光彩的小秘密,那就是大多数人谈论的所谓的数据科学,并不是企业实际需要的东西。企业需要的是准确和可操作的信息,来帮助他们决定如何花费他们的时间和资源。通常一个通过机器学习解决业务中小问题的***解决方案,往往只需要高质量的数据,以及一个如何使用最简单的方法解决问题的理念。

也行有人会说,Noah描述的价值并不来自“数据科学”,而是“商业智能”或“数据分析”。我没有资格对数据妄下主观定义,但不管你叫它什么 - 它仍然是对那些花费时间从事数据工作的人,最有价值的方式。

在Noah他们那儿,相当多希望进入“数据科学”领域的朋友都给他发来邮件,希望得到一些建议。在这些邮件中不乏这样的问题:

Dear诺亚

我是应该先得到一个硕士学位?还是应该参加一堆Kaggle比赛?

Noah的建议非常简单:

兄弟,都不用!!!

你就学习最基础的数学就行了。然后你再知道如何编写基本的SQL查询,了解企业的经营方式,以及想要成功它需要什么。如果你想成为一名对企业有价值的贡献者,就利用你的周末时间真正进入一家小企业“体验生活”,实际工作一把,而不是参加什么数据挖掘竞赛。去与客户交谈,去注意哪些产品畅销,哪些没有。去试着想想推动业务的经济形式,以及你如何能帮助它更得更多的成功。

所以,知道问题是什么才是迈入精英数据科学家梯队的关键一步。但不要那么傻白甜,因为上面说的技能集,该攒还是得攒!

文章转载自微信公众号“一斑”(ID: yiban51CTO)

责任编辑:武晓燕 来源: 一斑
相关推荐

2017-08-04 15:53:10

大数据真伪数据科学家

2012-12-06 15:36:55

CIO

2012-12-26 10:51:20

数据科学家

2022-11-03 14:13:24

腾讯科学家

2018-12-24 08:37:44

数据科学家数据模型

2018-02-28 15:03:03

数据科学家数据分析职业

2019-08-02 09:25:57

机器人人工智能系统

2018-10-16 14:37:34

数据科学家数据分析数据科学

2012-06-12 09:33:59

2023-07-26 14:00:47

模型研究

2023-05-23 09:34:16

科学家AI

2012-12-27 09:52:23

数据科学家大数据

2019-08-26 09:47:56

数据科学家数据分析

2014-07-03 09:38:19

2020-03-20 14:40:48

数据科学Python学习

2020-04-09 15:32:20

数据科学AutoML代智能

2016-08-02 17:00:12

Hadoop大数据系统

2015-08-28 09:22:07

数据科学

2015-08-25 13:20:29

数据科学
点赞
收藏

51CTO技术栈公众号