来自大数据的反思:需要你读懂的10个小故事

摘要:随着各种技术发展,很多人都在吹捧大数据。然而如同股市一样,越是高涨,越是需要警醒,在大数据热火朝天前行的路上,多一点反思,多一份冷静,或许能让这路走的更好、更远。本文的10个小故事,或许能让你有所得。

自2011年以来,大数据旋风以“迅雷不及掩耳之势”席卷中国。毋庸置疑,大数据已然成为继云计算、物联网之后新一轮的技术变革热潮,不仅是信息领域,经济、政治、社会等诸多领域都“磨刀霍霍”向大数据,准备在其中逐得一席之地。

中国工程院李国杰院士更是把大数据提升到战略的高度,他表示【1】,数据是与物质、能源一样重要的战略资源。从数据中发现价值的技术正是最有活力的软技术,在数据技术与产业上的落后,将使我们像错过工业革命机会一样延误一个时代。

在这样的认知下,“大数据”日趋变成大家“耳熟能详”的热词。图1所示的是谷歌趋势(Google Trends)显示的有关大数据热度的趋势,从图1中可以看到,在未来的数年里,“大数据”的热度可能还是“高烧不退”(图1中虚线为未来趋势)。

图1 大数据趋势(图片来源:作者截图)

在大数据热火朝天前行的路上,多一点反思,多一份冷静,或许能让这路走的更好、更远?例如,2014年4月,大名鼎鼎的《纽约时报》发表题为《大数据带来的八个(不,是九个!)问题》(Eight
(No, Nine!) Problems With Big Data
)”的反思文章【2】,其中文中的第九个问题,就是所谓的“大数据的炒作(we almost forgot one last problem: the hype)”。同样为重量级的英国报刊《财经时报》(Financial Times,FT)也刊发了类似反思式的文章“大数据:我们正在犯大错误吗?(Big
data: are we making a big mistake?
)”【3】

在大数据热炒之中,大数据的价值是否被夸大了?是否存在人造的“心灵鸡汤”?大数据技术便利带来的“收之桑榆”,是否也存在自己的副作用——“失之东隅”——个人的隐私何以得到保障?大数据热炒的“繁华过尽”,数据背后的巨大价值是否还能“温润依旧”?在众声喧哗之中,我们需要冷静审慎地思考上述问题。

太多的“唐僧式”的说教,会让很多人感到无趣。下文分享了10个从“天南地北”收集而来的小故事(或称段子),从这些小故事中,可对热炒的大数据反思一下,这或许能让读者更加客观地看待大数据。有些小故事与结论之间的对应关系,或许不是那么妥帖,诸位别太较真,读一读、乐一乐、想一想就好!

故事01:大数据都是骗人的啊——大数据预测得准吗?

从前,有一头不在风口长大的猪。自打出生以来,就在猪圈这个世外桃源里美满地生活着。每天都有人时不时地扔进来一些好吃的东西,小猪觉得日子惬意极了!高兴任性时,可在猪圈泥堆里打滚耍泼。忧伤时,可趴在猪圈的护栏上,看夕阳西下,春去秋来,岁月不争。“猪”生如此,夫复何求?

根据过往数百天的大数据分析,小猪预测,未来的日子会一直这样“波澜不惊”地过下去,直到它从小猪长成肥猪……在春节前的一个下午,一次血腥的杀戮改变了猪的信念:尼玛大数据都是骗人的啊……惨叫嘎然而止。

图2 大数据预测:都是骗人的

这则“人造寓言”是由《MacTalk·人生元编程》一书作者池建强先生“杜撰”而成的【4】。池先生估计是想用这个搞笑的小寓言“黑”一把大数据。

我们知道,针对大数据分析,无非有两个方面的作用:(1)面向过去,发现潜藏在数据表面之下的历史规律或模式,称之为描述性分析(Descriptive Analysis);(2)面向未来,对未来趋势进行预测,称之为预测性分析(Predictive Analysis)。把大数据分析的范围从“已知”拓展 到了“未知”,从“过去” 走向 “将来”,这是大数据真正的生命力 和“灵魂” 所在。

那头“悲催”的猪,之所以发出“大数据都是骗人的啊”呐喊,是因为它的得出了一个错误的“历史规律”:根据以往的数据预测未来,它每天都会过着“饭来张口”的猪一般的生活。但是没想到,会发生“黑天鹅事件”——春节的杀猪事件。

黑天鹅事件(Black Swan Event) 通常是指,难以预测的但影响甚大的事件,一旦发生,便会引起整个局面连锁负面反应甚至颠覆。读者可阅读纳西姆·尼古拉斯·塔勒布(Nassim Nicholas Taleb)所著的畅销书《黑天鹅》,来获得对“黑天鹅事件”更多的理解。

其实,我们不妨从另外一个角度来分析一下,这个搞笑的小寓言在“黑”大数据时,也有失败的地方。通过阅读知道,舍恩伯格教授在其著作《大数据时代》的第一个核心观点就是:大数据即全数据(即n=All,这里n为数据的大小),其旨在收集和分析与某事物相关的“全部”数据,而非仅分析“部分”数据。

那头小猪,仅仅着眼于分析它“从小到肥”成长数据——局部小数据,而忽略了“从肥到没”的历史数据。数据不全,结论自然会偏,预测就会不准。

要不怎么会有这样的规律总结呢:“人怕出名,猪怕壮”。猪肥了,很容易先被抓来杀掉。这样的“猪”血泪史,天天都上演的还少吗?上面的小寓言,其实是告诉我们:数据不全,不仅坑爹,还坑命啊!

那么,问题来了,大数据等于全数据(即n=All),能轻易做到吗?

故事02:颠簸的街道——对不起,“n=All”只是一个幻觉

波士顿市政府推荐自己的市民,使用一款智能手机应用——“颠簸的街道(Street Bump,网站访问链接:http://www.streetbump.org/)”。这个应用程序,可利用智能手机中内置的加速度传感器,来检查出街道上的坑洼之处——在路面平稳的地方,传感器加速度值小,而在坑坑洼洼的地方,传感器加速度值就大。热心的波士顿市民们,只要下载并使用这个应用程序后,开着车、带着手机,他们就是一名义务的、兼职的市政工人,这样就可以轻易做到“全民皆市政”。市政厅全职的工作人员就无需亲自巡查道路,而是打开电脑,就能一目了然的看到哪些道路损坏严重,哪里需要维修,如图3所示。

图3 颠簸的街道 (图片来源:作者截图)

波士顿市政府也因此骄傲地宣布,“大数据,为这座城市提供了实时的信息,它帮助我们解决问题,并提供了长期的投资计划”。著名期刊《连线》(Wired)也毫不吝啬它的溢美之词【5】:这是众包(Crowdsourcing)改善政府功能的典范之作。

众包是《连线》杂志记者Jeff Howe于2006年发明的一个专业术语,用来描述一种新的商业模式。它以自由自愿的形式外包给非特定的大众网络的做法。众包利用众多志愿员工的创意和能力——这些志愿员工具备完成任务的技能,愿意利用业余时间工作,满足于对其服务收取小额报酬,或者暂时并无报酬,仅仅满足于未来获得更多报酬的前景。

然而,从一开始,“颠簸的街道”的产品设计就是有偏的(bias),因为使用这款App的对象,“不经意间”要满足3个条件:(1)年龄结构趋近年轻,因为中老年人爱玩智能手机的相对较少;(2)使用App的人,还得有一部车。虽然有辆车在美国不算事,但毕竟不是每个人都有;(3)有钱,还得有闲。前面两个条件这还不够,使用者还得有“闲心”, 想着开车时打开“颠簸的街道”这个App。想象一下,很多年轻人的智能手机安装的应用程序数量可能两位数以上,除了较为常用的社交软件如Facebook或Twitter(中国用户用得较多的是微博、微信等)记得开机运行外,还有什么公益软件“重要地”一开车就记得打开?

“颠簸的街道”的理念在于,它可以提供 “n=All(所有)”个坑洼地点信息, 但这里的“n=All(所有)”也仅仅是满足上述3个条件的用户记录数据,而非“所有坑洼点”的数据,上述3个条件,每个条件其实都过滤了一批样本,“n=All”注定是不成立的。在一些贫民窟,可能因为使用手机的、开车的、有闲心的App用户偏少,即使有些路面有较多坑洼点,也未必能检测出来。

《大数据时代》的作者舍恩伯格教授常用“n=All”,来定义大数据集合。如果真能这样,那么就无需采样了,也不再有采样偏差的问题,因为采样已经包含了所有数据。

畅销书《你的数字感:走出大数据分析与解读的误区》(Numbersense: How to Use Big Data to Your Advantage)的作者、美国纽约大学统计学教授Kaiser Fung,就毫不客气地提醒人们,不要简单地假定自己掌握了所有有关的数据: “N=All(所有)”常常仅仅是对数据的一种假设,而不是现实。

微软-纽约首席研究员Kate Crawford也指出,现实数据是含有系统偏差的,通常需要人们仔细考量,才有可能找到并纠正这些系统偏差。大数据,看起来包罗万象,但“n=All”往往不过是一个颇有诱惑力的假象而已。

“n=All”,梦想很丰满,但现实很骨感!

但即使具备全数据,就能轻易找到隐藏于数据背后的有价值信息吗?请接着看下面的故事。

故事03:醉汉路灯下找钥匙——大数据的研究方法可笑吗?

一天晚上,一个醉汉在路灯下不停地转来转去,警察就问他在找什么。醉汉说,我的钥匙丢了。于是,警察帮他一起找,结果路灯周围找了几遍都没找到。于是警察就问,你确信你的钥匙是丢到这儿吗?醉汉说,不确信啊,我压根就不知道我的钥匙丢到哪儿。警察怒从心中来,问,那你到这里来找什么?醉汉振振有辞:因为只有这里有光线啊!

图4 醉汉路灯下找钥匙(图片来源:经济学人)

这个故事很简单,看完这个故事,有人可能会感叹醉汉的“幼稚”、“可笑”。但不好笑的是,“乌鸦笑猪黑,自己不觉得”,这个故事也揭示了一个事实:在面临复杂问题时,我们的思维方式也常同这个醉汉所差无几,同样也是先在自己熟悉的范围和领域内寻找答案,哪怕这个答案和自己的领域“相隔万里”!

还有人甚至认为,醉汉找钥匙的行为,恰恰就是科学研究所遵循的哲学观。前人的研究成果,恰是是后人研究的基石,也即这则故事中的“路灯”。到路灯下找钥匙,虽看来有些荒唐,但也是“无奈之下”的明智之举。

数据那么大,价值密度那么低,你也可以去分析,但从何分析起?首先想到的方法和工具,难道不是当下你最熟悉的?而你最熟悉的,就能确保它就是最好的吗?

沃顿商学院著名教授、纽约时报最佳畅销书作者乔纳╤

版权声明:欢迎转载,希望在你转载的同时,添加原文地址,谢谢配合

时间: 2024-12-25 04:27:46

来自大数据的反思:需要你读懂的10个小故事的相关文章

一篇文章让你读懂什么是餐饮小程序

小程序火了,餐饮+小程序也火了! 作为连接线下消费场景和线上营销的新工具,小程序出现后,迅速赢得了餐饮商家的青睐.与其说,小程序对餐饮行业"情有独钟":不如说,两者是"情投意合". 20天16次更新,随着微信不断地为小程序赋予新功能,越来越多的餐饮商家渴望拥有自己的小程序. 过去,餐饮企业吸引客流有三宝:"打折促销.媒体.美团". 先说打折促销吧,是会吸到一批对价格敏感的人光顾,可一旦活动停止,生意一夜之间又回到了解放前: 找媒体发布软文,也是很

用数字读懂一切 大数据的世界

自20世纪90年代初以来,数字技术已从根本上改变了我们的生活方式.如今,我们即将开始全面转型——将所有以模拟形式记录的人类知识,转换为数字形式.<未来之窗>带您一起回首往昔,畅想未来. 楚泽(Zuse).欧洲核子研究中心(CERN)和扎克伯格(Zuckerberg)——这三个名字标志着数字革命进程中的重要里程碑. 早在1941年,Konrad Zuse在柏林研制出了世界上第一台可以正常工作的计算机.他称这台外形庞大的数字计算机器为“Zuse Z3”.1991年,就职于瑞士欧洲核子研究中心的Ti

大数据究竟是什么?一篇文章让你认识并读懂大数据[转]

来源:互联网分析沙龙     日期:2013-11-10 在写这篇文章之前,我发现身边很多IT人对于这些热门的新技术.新趋势往往趋之若鹜却又很难说的透彻,如果你问他大数据和你有什么关系?估计很少能说出一二三来.究其原因,一是因为大家对新技术有着相同的原始渴求,至少知其然在聊天时不会显得很“土鳖”:二是在工作和生活环境中真正能参与实践大数据的案例实在太少了,所以大家没有必要花时间去知其所以然. 我希望有些不一样,所以对该如何去认识大数据进行了一番思索,包括查阅了资料,翻阅了最新的专业书籍,但我并不

Json数据如果作为配置文件比较难读懂,XML文件作为配置文件有先天的优势,容易读懂和配置,因此不考虑效率时,在页面中宁可用XML文件作为配置文件再用JS做一次转化把XML转成JSON使用

比如如下相对比较复杂的XML <myobjects> <!--object 1--> <myobject> <id>yourID_1</id> <name>your name</name> <description> <![CDATA[Merck Biologics Pilot Plant ]]> </description> <locations> <location

《Hadoop高级编程——构建与实现大数据解决方案》有奖试读

一. 活动主题: <Hadoop高级编程--构建与实现大数据解决方案>有奖试读,点击查看图书详情 二. 活动时间: 2014年8月6日至2014年9月5日(为期1个月) 三. 参与方式 : 您可以选择下面任何一种方式来参加我们的活动! 1. 阅读我们精选的<Hadoop高级编程>试读章节(点击下载PDF文档),并将书评发布在本篇博客的评论区,每位用户可发表多一条或多条书评,书评优秀可重复获奖. 2. 将活动转发至新浪微博并关注@清华大学出版社第五事业部,或者关注官方微信@清华书友(

【bigdata学习记录1】【转】 一篇对大数据深度思考的文章,让你认识并读懂大数据

在写这篇文章之前,我发现身边很多IT人对于这些热门的新技术.新趋势往往趋之若鹜却又很难说的透彻,如果你问他大数据和你有什么关系?估计很少能说出一二三来.究其原因,一是因为大家对新技术有着相同的原始渴求,至少知其然在聊天时不会显得很"土鳖";二是在工作和生活环境中真正能参与实践大数据的案例实在太少了,所以大家没有必要花时间去知其所以然. 我希望有些不一样,所以对该如何去认识大数据进行了一番思索,包括查阅了资料,翻阅了最新的专业书籍,但我并不想把那些零散的资料碎片或不同理解论述简单规整并堆

一文读懂工业大数据 (转)

无论是欧美老牌国家制造业的重振,还是中国制造业的转型提升,工业大数据都将发挥不可替代的作用. 当前,全球主要国家掀起了新一轮以“信息技术与制造业融合”为共同特征的工业革命,加速发展新一代信息技术,并推动其与全球工业系统的深入融合,以期抢占新一轮产业竞争的制高点.无论是欧美老牌国家制造业的重振,还是中国制造业的转型提升,工业大数据都将发挥不可替代的作用. 何为工业大数据 工业大数据是指在工业领域中,围绕典型智能制造模式,从客户需求到销售.订单.计划.研发.设计.工艺.制造.采购.供应.库存.发货和

读懂TCP状态转移

读懂TCP状态变换的过程,对于理解网络编程颇有帮助,本文将对TCP状态转移过程进行介绍,但各个状态(总共11个)的含义不在本文介绍的范围. 内容来源:<UNIX网络编程>第一卷第二章2.6节,若是读者对某个知识点不太理解,请参考原文. TCP状态转换图(state transition diagram) 1. 建立连接(three-way hand shake) 主动打开(passive open):服务器必须准备好接受外来的连接,通常通过socket.bind和listen完成. 被动打开(

一张图读懂今日头条推荐机制

影响推荐量的因素是比较复杂的,总体来说投入运营精力更大,内容质量越高,推荐效果就越好. 当然,这是个大道理,关系的是内功.具体到短期内的推荐量增长,还是需要一些hack式的技巧: 1.内容是给人看的,但首先机器要能读懂,目前基本上机器只能理解文字,所以你的内容是给哪部分受众看的,一定要表达清楚,比如你是写足球的,你就少提科比,你就少写段子,否则机器理解错了,推错人群,读者不感兴趣,点击率一点,很快就不推荐了. 2.读者停留很重要,点进去就退出来的点击是无效的,甚至是负面效果.所以标题党要有限度,