HBTC2012:大数据的挑战问题和发展趋势

文章正文
发布时间:2024-09-22 07:14

这是我们提炼出14个侯选项广泛地参与意见和投票之后提炼出的大数据时代的核心问题,这是目前的认识,也许未来这个问题包括在座的每一位同仁们可能有自己的想法,我们只是抛砖引玉,对大数据的核心问题提炼出八点。

第一个方面的议题是发展趋势。任何的预测都是有问题的,我们发布的时候其实心里面是没有底气的,题目是在2013年在最近的距离内可预测的大数据的 发展趋势是哪些方面,搜集了一些相关的内容,包括了70多位专家以及跟数学领域的专家合作,大家提炼出的发展趋势有37项,包括大数据的整体态势和发展趋 势,大数据与学术、大数据与人类的活动,大数据的安全隐私、关键应用、系统处理和整个产业的影响。这方面总共有37项。大数据的整体态势上,数据的规模更 大,数据资源化、数据的价值凸显、数据私有化出现和联盟共享。大数据有没有形成新的学科,当然仁者见仁智者见智,有很多人提出很多的想法。跟学术相关的包 括数据科学的兴起,数学学科发生了很多的变革,由于数据学科的产生反过来影响为物理学和数学提出的新的要求,需求促使了技术学科的发展和变革。颗粒度不太 一样,还有一些自主计算,基于海量知识的智能的革命性的方法。有更奇妙的人机互联。大数据的隐私安全及跟国家安全相关的问题,我们也希望提出一个问号,总 令人瞩目的大数据的应用到底是什么。还有基于大数据的决策支持、大数据的预测和清洗,大数据跟大企业的信息的推荐。大数据的系统处理上处理能力难以满足需 要,处理模式多样化以及带来的网络带宽的压力。如果大数据来了以后把数据的价值充分发挥出来,网络的传输、网络的管理会带来一些非常突出的压力。资本会不 会高度关注大数据,已经有一些资本界的朋友们过来了,产业结构和政策出现新的变化的时候以及数据产品的丰富和新的数据外部产业的分析师和新的职业的产生, 这是对整个大数据领域提出的37个侯选项。

大家关心的大数据既跟学术有关,也是跟社会相关的。基于前面的侯选项可以看到T6最令人瞩目的学科是什么,T19。比如说2013年最令人注目的学 科是大数据的分析与预测。第二个是分布式系统,写法上大家更喜欢叫云计算,实际上对大数据的支持不见得是新的学科但是是非常重要的问题。

第二方面是最令人注目的应用是什么。我们只是给了一个表让大家填,并不是说给了几个内容让大家投票,所以有很多惊人一致的地方。大家认为大数据在医 疗领域被认为是最有可能产生重要价值的。之后在金融领域有14人投票,电子商务和城市管理有10人投票,当然还有其他的问题,我们把最重要的、大家认为最 关键的题目拿出来。之后再来看发展趋势的侯选项,这个倒过来排,第11、12的是发展趋势2013年,一个是大企业大数据,大企业对数据的使用使得大数据 成为大企业的核心竞争力,描述中不只是大企业大数据、而是大政府大数据。有一些问题还是比较粗放的,大数据大企业以及资本的高度关注都得到了22票的支 持。大家预测2013年的时候资本开始真正投资大数据。

第八个侯选项的趋势叫更大的数据,大家可能会觉得大数据的观念会使得大家更关注和更清晰。

第七位是大数据新职业,会产生数据分析师、数据科学家、数据工程师,有非常丰富的数据经验的人才会成为稀缺人才。

第六项是数据共享联盟,这个应该是比较确定的,数据共享联盟将逐渐壮大成为产业的核心一环。之前在科研界一直在强调数据共享,有共同的 benchmark,但一直没有形成非常有效的环境,价格的驱动环境下,也许在产业界的数据共享联盟比研究界的数据共享联盟更容易一些,当然我们在研究界 也会推荐数据共享联盟的建立。数据的兴起会有很多人讲写数据科学的书,讲我做的是数据科学,我的方向是数据科学,所以是不是数据科学很清晰这不知道,但数 据科学这个词会越来越热。

第五位是大数据安全。只要是大数据真正地走向应用一定是一波新的技术革命。第五项是大数据分析的革命性方法。大家觉得大数据分析方面也会出现一些革命性的新的情况,但这在2013年是不是就会出现,很难说。也是方法在量变的同时会呈现质变。

第四的是基于海量的知识智能。也就是说基于大数据的知识智能。

第三项是大数据与云计算等资源的深度融合。

第二是大数据的隐私问题,比如说每天手机产生的通话、位置等等。但这给带来了便利的同时也给带来了个人隐私的问题,这已经不是说在纸上谈兵了,已经成为了一个非常重要的问题了。

第一个是数据资源化,大数据在国家和企业和社会层面成为重要的战略资源,成为新的战略制高点和抢购的新焦点。

我总结一下,刚才从热点问题和近期的发展趋势给出了这样的总结。热点问题上,通过大家的提炼,我们发现了八个热点问题,数据科学与大数据的学科边 界,数据计算的基本模式与范式、大数据的作用力和变换反对。大数据特性与数据态,大数据安全和隐私问题,大数据对IT技术架构的挑战,大数据的生态环境问 题,大数据的应用及产业链。至少我们在搜集这些问题的时候邮件大概发了上千次,多次地交流和讨论。发展趋势这块,我们排名前三位的是数据的资源化、大数据 的隐私问题突出、大数据与云计算等深度融合,至少在2013年是非常明显的趋势。技术的机遇大数据的智能会陆陆续续地有一些发展和变化。当然了,我们是希 望未来每年将对大数据的热点问题和大数据的下个年度的发展趋势进行充分的调研,我们也希望每年都在Hadoop与大数据技术大会发布。今年的时间相对比较 仓促,前后大概在一个多月,邮件有上千封,我们也希望明年再组织热点问题和发展趋势的时候,在座的每位同仁都可以积极地参与,奉献自己的创意,这不是靠几 个专家就可以点出方向,希望每参与进来以后,可以形成真正的有影响力和震撼力的,不是像某些学科一个新的概念来了以后都在炒作,而是希望能够经过大家的共 同的智慧、群体的智慧,对方向的概念和问题形成一些共识,变成我们共同努力的目标,共同奋斗的方向。这是大数据专家委之所以发起这个问题的初衷,也是希望 我们每年做这项活动的时候,未来的一些手段能够更加地灵活,时间上会提前邀请大家共同来做这样的事情。

最后,讲到了大数据的共享联盟,今天的Hadoop与大数据技术大会上专家委员会有成立了一个组织,叫“大数据共享联盟”,我们的宗旨是搜集大数 据、展示大数据、促进大数据的研究与开发,同时我们要构建联盟,这个完全是志愿的,我们也希望更多在座的百度、阿里、腾讯、雅虎、Facebook等企业 参与,也希望国内国际的大企业,你们在业界上做得非常好,而且有很多公信力和社会公益,我们能不能共同推动大数据的共享,建立共享平台。大家热心地参与到 联盟里来,为我们来源于大家、服务于大家、构建更好的大数据的深层发展和生态环境。