在大数据时代,你需要这样思考

  维克托?迈尔?舍恩伯格和肯尼斯?库克耶在《大数据时代》中告诉我们大数据的4V特点,即Volume(大量)、Velocity(高速)、 Variety(多样)、Veracity(真实)。相比小数据,大数据一定是复杂的。然而,复杂性对于我们来说,绝对是一个机会而不应是一个问题。面对 大数据时代的扑面而来,如何拥抱大数据,从思考方式的转变开始。

  从“基于预设的结构化数据库”到“无需预设的非关系型数据库”

  小数据时代,我们对于数据的存储与检索一直依赖于分类法和索引法,分类和索引是一种清晰获取数据的机制设计,这种机制是以预设场域为前提的。这 种结构化数据库的预设场域能够卓越地展示数据的整齐排列与准确存储,毫无疑问,这与追求数据的精确性目标是完全一致的,在数据稀缺与问题清晰的年代,这种 基于预设的结构化数据库能够有效的回答人们的问题,并且这种数据库在不同的时间能够提供一致的结果。

  面对大数据,由于数据的海量、混杂等特征会使预设的数据库系统崩溃。其实,数据的纷繁杂乱才真正呈现出世界的复杂性和不确定性特征,想要获得大 数据的价值,承认混乱而不是对抗或避免混乱才是一种可行的路径。为此,伴随着大数据的涌现,出现了非关系型数据库,它不需要预先设定记录结构,而且允许处 理各种各样形形色色参差不齐的数据。因为包容了结构的多样性,这些无需预设的非关系型数据库设计能够处理和存储更多的数据,成为大数据时代的重要应对手 段。如微软的数据库设计专家PatHelland所言:“我们再也不能假装活在一个齐整的世界里。”

  从“随机样本”到“全量数据”

  统计学家通过分析发现,采样分析的精确性随着采样随机性的增加而大幅提高,但与样本数量的增加关系不大。这个发现对于小数据时代无疑是非常鼓舞 人心的,随机采样获得了巨大的成功,并成为现代社会测量领域的核心思想。随机样本的基础是采样的绝对随机性,然而,如此严格意义的随机实现起来是非常困难 的,一旦采样过程存在任何偏见,分析结果将相去甚远,况且随机样本带给我们的只能是事先预设问题的答案。这种缺乏延展性的结果,无疑会使我们错失更多的问 题域。

  大数据时代,数据的收集问题不再成为我们的困扰,采集全量的数据成为现实。全量数据带给我们视角上的宏观与高远,这将使我们可以站在更高的层级 全貌看待问题,看见曾经被淹没的数据价值,发现藏匿在整体中有趣的细节。因为拥有全部或几乎全部的数据,就能使我们获得从不同的角度更细致更全面的观察研 究数据的可能性,从而使得大数据的分析过程成为惊喜的发现过程和问题域的拓展过程。

  从“数据的精确性和结果的准确性”到“数据的混杂性和结果的容错性”

  小数据时代,由于可获得的数据量比较小,为此我们必须尽量准确的记录下所获得的所有数据,从而引发了测量工具的优化工作;由于数据处理手段的限 制,能被我们利用的数据基本限于能适用于传统数据库的结构化数据;由于采用的是随机采样,因此采样过程的精确度被放在重要的地位。显然,这种对精确性的执 着是信息缺乏时代和模拟时代的产物。

  大数据时代,海量数据的涌现一定会增加数据的混乱性且造成结果的不准确性,如果仍然执迷的依循准确性,那么我们将无法应对这个新的时代。与数据 的混杂性可能带来的结果错误性的增加相比,由数据量的扩张带给我们的新洞察、新趋势和新价值更有意义,因为大数据通常都用概率说话,何况大数据的处理之前 是可以对之进行数据清洗从而减少部分的错误数据。所以,与致力于避免错误相比,对错误的包容将会带给我们更多信息。其实,允许数据的混杂性和容许结果的不 精确性才是我们拥抱大数据的正确态度,只有让步和接受甚至欣赏不精确性,才能看到大数据带给我们的美好前景,未来我们应当习惯这种思维。

  从“复杂算法”到“简单算法”

  算法是挖掘数据价值的工具,因此算法的研究一直以来是提升数据利用效率的重要路径。小数据时代,在数据的限制无法突破的情形下,对数据信息和价 值的获取渴求使得对算法的研究越来越深入,发明的算法越来越复杂。而事实表明,当数据量以指数级扩张时,原来在小数量级的数据中表现很差的简单算法,准确 率会大幅提高;与之相反的是,在少量数据情况下运行得最好的复杂算法,在加入更多数据时,其算法的优势则不在显现。为此,更多的数据比算法系统显得更智能 更重要,大数据的简单算法比小数据的复杂算法更有效。

  从“为什么”到“是什么”

  小数据时代,由于数据可获得性和计算能力的有限性,使得我们对于问题的研究需要在假设的基础上进行验证,并探究“为什么”,而始于假设的分析研究非常容易受偏见支配。

  大数据时代,快速发展的数据存储、数据传输、数据获取、数据处理等系列技术群,为我们对于问题的研究提供了新的视野和有价值的预测,并使我们获得更多以往所不曾被关注的联系与动态,探究“是什么”成为我们发现世界了解世界的更便捷的途径,且不会受先验假设的偏见影响。

  从“因果关系”到“相关关系”

  小数据时代,信息的匮乏会使我们趋向于采用因果关系范式去快速理解问题并做出决策,虽然这种因果关系可能并不存在,但这是我们理解和解释世界的 一条捷径。在人类力量有限性凸显的时候,这种认知捷径往往能带给我们一种认知上的安慰感和安全感,仿佛世界就是因果性的存在着。

  由于大数据时代对于数据的研究不再拘泥于对因果关系的探究,这将会使我们完全有条件向关联、非关联等相关关系探究的转变。类似啤酒与尿布存在相 关性的经典案例不胜枚举。海量数据不断被制造与我们对于数据搜集、存储、传输、处理能力的日益提高,是大数据时代的当下特征。基于互联网、云计算等现代化 手段,对海量的数据进行统计性的搜索、比较、分析、归纳,我们会发现,原本似乎毫不相干的事物之间存在着较高的关联度,这是传统的因果分析、逻辑推理调研 难以解释也无法企及的。

  当然,相关关系并不是大数据洞察的终结目标。在很多情况下,一旦我们完成了对大数据的相关关系分析,而又不再满足于仅仅“是什么”时,我们就会 继续朝向因果关系的研究,寻求“为什么”,并且基于相关关系的分析,进一步寻求因果关系将会大大降低其分析成本。其实,因果关系就是一种特殊的相关关系。

  从“审慎的决策与行动”到“快速的决策与行动”

  小数据时代,我们基于对社会运作情境的假设,通过收集和分析数据来验证这种假设;通过数据的检验,原有假设不成立,意味着我们将重新开始新的假设并重新收集和分析新的数据,直到我们的验证通过为止。因此,小数据时代,我们的决策与行动是审慎的。

  大数据时代,我们不再受限于传统的思维模式和隐含的假定,我们需要对大数据分析的工具理论,通过对大数据的分析,大数据会为我们呈现出新的深刻 洞见和释放出巨大的价值。我们在大数据的指导下探索世界并且不再受制于各种假设,这将使我们势必要以积极的姿态随时接收着来自数据的洞察,并做出快速的决 策与行动,因为机会和价值很快就会被刷新,大数据的价值也正是在于将及时的信息及时的传递给及时需要的人手中并及时的做出决策和行动。可以预见的未来必然 是,得数据者得天下。

  其实,我们只是站在一个很长过程的起点上。

时间: 2024-10-20 16:28:49

在大数据时代,你需要这样思考的相关文章

大数据时代的思考

大数据时代的基本表象是数据的智能化,即我们可以通过海量数据的收集和分析,来有效的描述一件事情当前的状态,相对准确的预测其未来的结果.从这个角度来思考大数据,我们就不能简单的用数据的体量来理解大数据,在从数据到信息.从信息到知识.再从知识到智慧的演化过程中,我们需要跨学科.跨领域整合众多人类智慧,我们所面对的计算机世界将再也不是冰冷的键盘.鼠标.显示器加主机了,一个丰富多彩的带有智能感知和情感的计算时代正在悄然向我们走近.

大数据时代带给我们的思考

1)大数据通过全局的数据让人类了解事物背后的真相 相对于过去的样本代替全体的统计方法,大数据分析将使用全局的数据,其统计出来的结果更为精确,更接事物真相,帮助科学家了解事物背后的真相.大数据带来的统计结果将纠正过去人们对事物错误的认识,影响过去人类行为.社会行为的结论,带来全新的认知.有利于政府.企业.科学家对过去人类社会的各种历史行为真正原因的了解,大数据统计将纠正样本统计误差,为统计结论不断纠错.大数据可以让人类更加接近了解大自然,增加对自然灾害原因的了解. 2)大数据提供了同事物的连接,客

大数据时代新闻采编人员职业能力培训

原文  http://datameng.com/info/2014/03/big-data-xinwen-caibian/ 据统计,到2013年,全世界储存的信息如果记录在光盘上,再把这些光盘叠加起来,高度等于从地球到月球的距离.美国互联网数据中心指出,目前世界 上90%以上的数据是近几年才产生的.互联网上的数据每年将增加50%,每两年翻一番.因此有学者认为,人类进入了大数据时代.一般意义上,大数据是指无 法在可容忍的时间内用传统IT技术和软硬件工具对其进行感知.获取.管理.处理和服务的数据集合

决胜大数据时代:Hadoop&Yarn&Spark企业级最佳实践(8天完整版脱产式培训版本)

Hadoop.Yarn.Spark是企业构建生产环境下大数据中心的关键技术,也是大数据处理的核心技术,是每个云计算大数据工程师必修课. 课程简介 大数据时代的精髓技术在于Hadoop.Yarn.Spark,是大数据时代公司和个人必须掌握和使用的核心内容. Hadoop.Yarn.Spark是Yahoo!.阿里淘宝等公司公认的大数据时代的三大核心技术,是大数据处理的灵魂,是云计算大数据时代的技术命脉之所在,以Hadoop.Yarn.Spark为基石构建起来云计算大数据中心广泛运行于Yahoo!.阿

《大数据时代》读书笔记

大数据开启了一次重大的时代转型.就像望远镜让我们能够感受宇宙,显微镜让我们能够 观测微生物一样,大数据正在改变我们的生活以及理解世界的方式,成为新发明和新服务的源 泉,而更多的改变正蓄势待发-- 大数据的精髓在于我们分析信息时的三个转变,这些转变将改变我们理解和组建社会的方法. 第一个转变就是,在大数据时代,我们可以分析更多的数据,有时候甚至可以处理和第一个转变就是,在大数据时代,我们可以分析更多的数据,有时候甚至可以处理和 某个特别现象相关的所有数据,而不再依赖于随机采样. 某个特别现象相关的

第29本:《大数据时代》

第29本:<大数据时代> 最近大数据火了,还经常听到Hadoop和Mapreduce,我经常勘探地震资料处 理后的地震数据体,动不动几十个G,算不算大数据?好像与现在说的这个大数据概念相差太远,就一直想了解一下这个大数据到底是什么含义.从SUN那里借来 <大数据时代>读了一读,明白了不少基本概念和示例,与我们的数GB的地震数据体不是一回事,想把大数据应用于石油行业,看来还得琢磨琢磨. <大数据时代>这本书的章节划分非常清晰,主要讲了思维.商业和管理方面的变革,每一章有一

转文峰——读《大数据时代》有感

我在大数据领域已经工作五年多了,可如果一个外行朋友让我给他解释一 下什么是大数据,我还真不好讲.我能说就是海量数据的格式化.传输.存储.查询.展示吗?还是过于抽象.我能说数据量大就叫大数据吗?其实也不一定,一台 机器上的传感器收集到的数据可能每天都有几个TB,但也仅仅是监控了一个机器的状态.而全国各个市一天的苹果价格,可能也只是几MB大小,但它就是一个大 数据的例子. 这本书的观点很鲜明.首先是样本等于总体.在大数据时代以前,如果想要了解某个市场的情况,一般是采用抽样调查的方式,这种方式难免出现

移动大数据时代最IN编程语言必读书单

移动大数据时代最IN编程语言必读书单 这是一个快速更迭,快鱼吃慢鱼的时代.从IT 时代演变成 DT 时代,再到现在的智能时代.急速革新的各种新技术.新工具.新平台,需要程序员掌握良好的编程思想和学习方法,不断学习新技术.补充新知识,才能努力跟上时代的步伐,找到自我实现的际遇.读书依然是我们获取知识的最方便和有效的途径之一.既要读经典,也要读新书,前者让你沉淀,发现正确的方法,后者让你紧跟前沿,掌握最新的技术.可你是不是担心,不能找到真正值得读的新书而浪费时间?在此,我们汇总了当下最In的编程语言

金融大数据时代,金融BI强势来袭——奥威Power-BI

4月8日,“掘金大数据时代”远大愿景的“金融大数据高峰论坛暨可以融资的BI”产品发布会在武汉成功举办.作为国内最早的大数据与商业智能知名厂商奥威软件响应广大号召,与深圳亚洲保理联合主办发起这场金融BI交流盛宴,携手六度人和以及行业大咖围绕移动互联高速发展下大数据时代的技术及应用根本,解决数据分析痛点,更好地挖掘金融大数据时代等议题交流经验想法.吸引了近百家来自五湖四海的为中小企业提供管理信息化服务或金融服务的厂商们齐聚一堂,就企业融资发展和深化信息管理等热门话题做主题分享,聚焦运用保理工具助力中