1703947200
1703947201
[4] 泽字节,一般记作ZB,等于270字节。——译者注
1703947202
1703947203
[5] 模拟数据也称为模拟量,相对于数字量而言,指的是取值范围是连续的变量或者数值,例如声音、图像、温度、压力等。模拟数据一般采用模拟信号,例如用一系列连续变化的电磁波或电压信号来表示。——译者注
1703947204
1703947205
[6] 数字数据也称为数字量,相对于模拟量而言,指的是取值范围是离散的变量或者数值。数字数据则采用数字信号,例如用一系列断续变化的电压脉冲(如用恒定的正电压表示二进制数1,用恒定的负电压表示二进制数0)或光脉冲来表示。——译者注
1703947206
1703947207
[7] 亚历山大图书馆藏书丰富,有据可考的超过50000卷(纸草卷),包括《荷马史诗》、《几何原本》等。亚历山大图书馆建成之时正是中国战国时代的末期,此时百家争鸣,较有影响的十大家(儒、道、墨、法、名、阴阳、纵横、杂、农、小说)多有著述,且已出现如《诗经》、《楚辞》、《离骚》等文学作品,虽没有像亚历山大图书馆一样的集中式藏书中心,但也占据了世界知识量的相当份额。——译者注
1703947208
1703947209
[8] 据《中国出版史》记载,中国的毕昇早在11世纪40年代就发明了泥活字印刷,远远早于古登堡15世纪30年代发明的铅活字。——编者注
1703947210
1703947211
[9] 这是一个美妙有趣的例子,但是对于学习物理的人来说总是有些怪异。显然,万有引力一如既往起着作用,不过是因为空气阻力在不同密度和体积的物体上产生了不同的效果。如果把蟑螂从真空环境的高楼往下扔,恐怕也是凶多吉少。——译者注
1703947212
1703947213
1703947214
1703947215
1703947217
大数据时代:生活、工作与思维的大变革 预测,大数据的核心
1703947218
1703947219
大数据的核心就是预测。它通常被视为人工智能的一部分,或者更确切地说,被视为一种机器学习。但是这种定义是有误导性的。大数据不是要教机器像人一样思考。相反,它是把数学算法运用到海量的数据上来预测事情发生的可能性。一封邮件被作为垃圾邮件过滤掉的可能性,输入的“teh”应该是“the”的可能性,从一个人乱穿马路时行进的轨迹和速度来看他能及时穿过马路的可能性,都是大数据可以预测的范围。当然,如果一个人能及时穿过马路,那么他乱穿马路时,车子就只需要稍稍减速就好。这些预测系统之所以能够成功,关键在于它们是建立在海量数据的基础之上的。此外,随着系统接收到的数据越来越多,它们可以聪明到自动搜索最好的信号和模式,并自己改善自己。[1]
1703947220
1703947221
在不久的将来,世界许多现在单纯依靠人类判断力的领域都会被计算机系统所改变甚至取代。计算机系统可以发挥作用的领域远远不止驾驶和交友,还有更多更复杂的任务。别忘了,亚马逊可以帮我们推荐想要的书,谷歌可以为关联网站排序,Facebook知道我们的喜好,而LinkedIn可以猜出我们认识谁。[2]当然,同样的技术也可以运用到疾病诊断、推荐治疗措施,甚至是识别潜在犯罪分子上。
1703947222
1703947223
就像互联网通过给计算机添加通信功能而改变了世界,大数据也将改变我们生活中最重要的方面,因为它为我们的生活创造了前所未有的可量化的维度。大数据已经成为了新发明和新服务的源泉,而更多的改变正蓄势待发。
1703947224
1703947225
[1] 系统可以通过一种“反馈学习”的机制,利用自己产生的数据判断自身算法和参数选择的有效性,并实时进行调整,持续改进自身的表现。——译者注
1703947226
1703947227
[2] 这些任务都和个性化技术相关,包括个性化排序和个性化推荐。个性化技术是大数据时代最重要的技术,这里向专业读者推荐吕琳媛等人2012年在《Physics Reports》上发表的名为“Recommender Systems”的综述。——译者注
1703947228
1703947229
1703947230
1703947231
1703947233
大数据时代:生活、工作与思维的大变革 大数据,大挑战
1703947234
1703947235
大数据的精髓在于我们分析信息时的三个转变,这些转变将改变我们理解和组建社会的方法。
1703947236
1703947237
第一个转变就是,在大数据时代,我们可以分析更多的数据,有时候甚至可以处理和某个特别现象相关的所有数据,而不再依赖于随机采样。这部分内容将在第1章阐述。19世纪以来,当面临大量数据时,社会都依赖于采样分析。但是采样分析是信息缺乏时代和信息流通受限制的模拟数据时代的产物。以前我们通常把这看成是理所当然的限制,但高性能数字技术的流行让我们意识到,这其实是一种人为的限制。与局限在小数据范围相比,使用一切数据为我们带来了更高的精确性,也让我们看到了一些以前无法发现的细节——大数据让我们更清楚地看到了样本无法揭示的细节信息。
1703947238
1703947239
第二个改变就是,研究数据如此之多,以至于我们不再热衷于追求精确度。这部分内容将在第2章阐述。当我们测量事物的能力受限时,关注最重要的事情和获取最精确的结果是可取的。如果购买者不知道牛群里有80头牛还是100头牛,那么交易就无法进行。直到今天,我们的数字技术依然建立在精准的基础上。我们假设只要电子数据表格把数据排序,数据库引擎就可以找出和我们检索的内容完全一致的检索记录。
1703947240
1703947241
这种思维方式适用于掌握“小数据量”的情况,因为需要分析的数据很少,所以我们必须尽可能精准地量化我们的记录。在某些方面,我们已经意识到了差别。例如,一个小商店在晚上打烊的时候要把收银台里的每分钱都数清楚,但是我们不会、也不可能用“分”这个单位去精确度量国民生产总值。随着规模的扩大,对精确度的痴迷将减弱。
1703947242
1703947243
达到精确需要有专业的数据库。针对小数据量和特定事情,追求精确性依然是可行的,比如一个人的银行账户上是否有足够的钱开具支票。但是,在这个大数据时代,很多时候,追求精确度已经变得不可行,甚至不受欢迎了。当我们拥有海量即时数据时,绝对的精准不再是我们追求的主要目标。
1703947244
1703947245
大数据纷繁多样,优劣掺杂,分布在全球多个服务器上。拥有了大数据,我们不再需要对一个现象刨根究底,只要掌握大体的发展方向即可。当然,我们也不是完全放弃了精确度,只是不再沉迷于此。适当忽略微观层面上的精确度会让我们在宏观层面拥有更好的洞察力。
1703947246
1703947247
第三个转变因前两个转变而促成,即我们不再热衷于寻找因果关系。这部分内容将在第3章阐述。寻找因果关系是人类长久以来的习惯。即使确定因果关系很困难而且用途不大,人类还是习惯性地寻找缘由。相反,在大数据时代,我们无须再紧盯事物之间的因果关系,而应该寻找事物之间的相关关系,这会给我们提供非常新颖且有价值的观点。相关关系也许不能准确地告知我们某件事情为何会发生,但是它会提醒我们这件事情正在发生。在许多情况下,这种提醒的帮助已经足够大了。
1703947248
1703947249
如果数百万条电子医疗记录显示橙汁和阿司匹林的特定组合可以治疗癌症,那么找出具体的药理机制就没有这种治疗方法本身来得重要。同样,只要我们知道什么时候是买机票的最佳时机,就算不知道机票价格疯狂变动的原因也无所谓了。大数据告诉我们“是什么”而不是“为什么”。在大数据时代,我们不必知道现象背后的原因,我们只要让数据自己发声。
[
上一页 ]
[ :1.7039472e+09 ]
[
下一页 ]