全网唯一标准王
译者序 本书是以非计算机专业人士(尤其是社会科学领域的研究者)为目标读者的,但它对于广大开发者也有很好的参考价值。本书介绍的思路 和方法并不仅仅局限于R语言的应用,在很多其他开发平台上也不难实现。 对我个人来说,这本书让我对社会科学和信息技术都有了全新的认识,开阔了眼界。大数据技术的应用领域除了搜索、电商、社交网络、 垂直应用,还可以和很多专业领域结合起来,挖掘出非常有价值的信息。开源社区已经有了支持各种技术需求的现成组件,大大简化了所需的 编程工作。可以说,这本书介绍的技术让大数据、网页抓取、机器学习这些貌似高大上和高深莫测的概念变得具体实际了。 在翻译本书过程中我最大的收获与其说是技术上的,不如说是理念上的:学科之间的交叉能够产生如此奇妙的反应,让很多我们以前想得 到却做不到甚至根本不敢想的事情能够轻松地实现。尤其是在大数据时代,自动化数据抓取和文本挖掘技术为各专业领域的研究者提供了前所 未有的强大工具,让社会科学家也能像自然科学家一样通过建模、采集数据、分析统计的过程产生量化的结果,以此来支持他们的分析和结 论。 本书的核心内容是自动化数据抓取和分析的方法,R语言及其一些组件在其中承担了基础架构的作用。比如,书中介绍了通过定期抓取 Twitter相关推文对奥斯卡奖得主进行预测的案例,我们同样可以利用新浪微博提供的开放接口做到类似的事情(请参 阅 http://open.weibo.com/wiki/2/search/topics )。利用R语言及其众多组件提供的支持,我们可以避开大量技术细节,专注于研究主题,真正需 要编写的代码其实是相当简单的。 管中窥豹,可见一斑。我们还可以看到一个趋势:编程将不再是计算机专业人士的专利,而是一种越来越方便、越来越简单的工具。随着 各种编程语言(如本书用到的R语言)及其配套工具的完善,几乎每个人都有机会具备基本的编程能力,就像现在大部分人都能学会开车和使用 电脑上网一样。 本书就反映了上述趋势。在书中,作者给出了简洁的代码、详细的讲解以及真实的例子,让我们切切实实地看到大数据在社会科学领域运 用的效果。作者尽可能回避晦涩的术语和高深的理论,为我们提供了非常实用的组件,并探讨了一些很有趣的实际问题。这样的讲解方式非常 有利于我们快速上手、循序渐进学习,并且马上就能把学到的技术运用到实际研究项目中。 在翻译的过程中,我尽了最大努力让译文通顺易懂且忠于原文,但是,由于本人水平有限,难免会有不足和遗漏之处,望读者不吝指正, 我在此先行感谢。另外,我在GitHub开辟了一个讨论区: https://github.com/coderLMN/AutomatedDataCollectionWithR/issues ,欢迎读者在这里提 出自己的疑问和观点并参与讨论。 最后,我要感谢我的父母、妻子和儿子在本书翻译过程中给予我的支持和理解。翻译是个精益求精的工作,是他们帮我分担了很多事情, 才让我能全力以赴地投入。 前言 过去20年,互联网的快速发展改变了我们分享、收集和发布数据的方式。企业、政府机构和个人用户都提供了各种类型的信息,新的沟通 渠道也带来了有关人类行为的大量数据。社会科学领域曾经的根本性问题——观测数据稀缺和难以获取的情况——正在快速扭转为数据取之不 尽用之不竭的局面。这种翻天覆地的形势也并非尽善尽美。例如,传统的数据采集和分析技术可能不足以应对复杂的大量数据。对这种大数据 的需求进行分析的结果之一是所谓“数据科学家”的诞生,他们能对数据进行筛选,在研究者和企业那里都很受欢迎。 随着互联网的高歌猛进,我们还见证了第二个趋势,那就是像R这样的开源软件越来越流行,越来越有影响力。对计量社会科学家来说,R 是最重要的分析软件之一。它得益于有一个不断发布新组件的活跃社区,而且该社区一直在快速成长。到现在,R已经不仅仅是一个免费统计软 件包,它还包含了许多其他编程语言和软件包的接口,这样就大大简化了对各种来源的数据进行处理的工作。从个人角度来说,我们对社会科学数据所做的工作的特点可以总结如下: ·资金比较稀缺。 ·既没有时间也没有意愿进行数据的手工采集。 ·感兴趣的是利用最新、高质量和海量的数据来源。 ·需要记录从开始(数据采集)到结束(发布结果)的整个研究过程,这样它就可以被重现。 在过去,我们经常受困于对各种来源的数据进行手工整理,还要寄希望于手工整理不可避免带来的编码和复制-粘贴错误只是非系统性的。 最终,我们越来越厌倦那种不可重现的研究数据采集方式,这种方式易于出错、缓慢复杂,而且提高了因烦躁而死的风险。因此,我们不断地 把数据采集和发布流程纳入在统计分析过程中已熟悉的软件环境——R。这个程序提供了一套很好的基础架构,可以把日常工作流程扩展为实际 数据分析前后的一系列步骤。 虽然目前R本身还不是用来采集数据或进行实验的,但我们还是认为本书讲述的技术不仅仅是对于成本高昂的调查、实验和学生助理编程者 的“穷人的替代品”。我们相信它们是现代数据分析工具组合的有力补充。我们推崇对在线资源的数据进行采集,不仅认为它是比传统数据采 集方法性价比更高的解决方案,更将其视为从新的和不断开发中的数据源中整合数据集的特有方法。此外,我们重视基于电脑程序的解决方 案,因为它们能确保可靠性、重现能力、时间效率以及对高质量数据集的整合。除了工作效率,你还会发现自己乐于通过写代码和设计算法方 案替代乏味的手工劳动。简而言之,我们相信,如果你愿意花时间学习和采用本书中推荐的技术,在数据分析的简便性和质量上得到的持续提 升一定会让你受益匪浅。 假定你已经确定在线数据是你的项目所适用的资源,那么是否真的有必要采用网络抓取或统计性文本处理技术,以及随之而来的自动化或 半自动化数据采集流程?虽然我们不能指望拿出一锤定音的准则,但下面是一些有用的判断条件。如果你发现自己符合其中的多个条件,那么 自动化的方法很可能就是正确选择: ·你是否计划经常重复这项任务?比如,需要通过它来保持数据库的更新。 ·你是否需要让其他人能重复你的数据采集过程? ·你是否经常处理在线的数据源? ·这项任务在规模和复杂度上是否非同小可? ·如果这项任务也可以手工完成……你是否缺乏必要的资源来调动其他人参与? ·你是否愿意通过编程的手段实现自动化流程? 理想情况下,本书讲述的技术让你能够以相当合理的成本创建强大的数据集,这些数据集来自现有的、非结构化或未排序的数据,之前也 没有人分析过它们。在很多情况下,根据你的研究主题的特点,你需要对本书讲述的技术重新思考、提炼和组合,才能有所成效。在任何情况 下,我们都希望你能发现本书的主题对你有所启发,能开阔你的眼界:网络的街道是用数据铺成的,这些数据正迫不及待地等着被采集。 你从本书中不会学到的内容 当你浏览目录的时候,你会对阅读本书之后有望学到的东西有个初步的印象。虽然我们很难确定哪些部分是你希望看到却不在本书讨论范 围内的,但是我们还是会指出你在本书中找不到的某几个方面的内容。 你在本书中不会看到对R环境的介绍。这方面已经有很多出色的介绍材料——不管是印刷版的还是在线的——本书不再赘述。如果你之前没 有用过R语言,也大可不必失望地将此书束之高阁。我们还会推荐一些写得很好的R入门教材。 你也不要指望本书针对网络抓取或文本挖掘进行全面讲解。首先,我们专门使用了一套软件环境,而它并不是为实现这些目的量身定制 的。在一些应用需求下,R对于你要完成的任务并非理想解决方案,其他软件包可能更合适。我们也不会用如PHP、Python、Ruby或Perl等替代 环境来干扰你。要想知道本书是否对你有帮助,你应该扪心自问,你是否已经或计划把R用在日常工作中。如果对这两个问题的答案都是否定 的,很可能你就应该考虑替代方案了。但是,如果你已经在用或倾向于使用R了,你就可以省下学习另一个开发语言的精力,留在熟悉的开发环境里。 本书也不会严谨地介绍数据科学。在这个主题上也有一些出色的教材,例如O’Neil and Schutt(2013)、Torgo(2010)、Zhao(2012), 以及Zumel and Mount(2014)。在这些书中偶尔缺失的部分是如何在真实环境中获取数据科学中用到的数据。在这方面,本书可以作为数据分 析的准备阶段的参考书,它还给出了关于如何管理可用信息并让它们保持及时更新的指导原则。 最后,你最不可能从本书看到的是针对你的具体问题的完美解答。在数据采集过程中,获取数据的领域从来都不会完全相似,而且其形式 有时也会快速变化,这都是固有的问题。我们的目标是让你能改写例子和案例分析中提供的代码,并创建新的代码,以此帮助你在采集自己所 需数据的工作中获得成功。 为什么使用R 对于本书中涵盖的问题,R是一个很好的解决方案,我们这么考虑是有很多原因的。对我们来说,最重要的几点原因如下: ·R可以自由和简便地获得。你可以按自己的需要随时随地下载、安装和使用它。不去钻研那些昂贵的专有软件对你是大有裨益的,因为你 不需要依赖于雇主支付软件版权费的意愿。 ·作为一个主要专注于统计学的软件环境,R拥有一个巨大而且持续繁荣的社区。R被用于各种专业领域,如社会科学、医学科学、心理 学、生物学、地理学、语言学以及商业等。这样大的专业范围让你能与很多开发者共享代码,并从文档完善的多领域应用中获益。 ·R是开源的。这意味着你能够轻松地分析函数的工作原理并毫不费力地修改它们。这也意味着对程序的修改不会被一个维护产品的独家程 序员团队所控制。即使你无意为R的开发贡献代码,你仍然可以从种类繁多的可选扩展项(组件)中获益。组件的数量与日俱增,很多已有的组 件也会经常更新。你能

.pdf文档 基于R语言的自动数据收集:网络抓取和文本挖掘实用指南.html

文档预览
中文文档 5 页 50 下载 1000 浏览 0 评论 309 收藏 3.0分
温馨提示:本文档共5页,可预览 3 页,如浏览全部内容或当前文档出现乱码,可开通会员下载原始文档
基于R语言的自动数据收集:网络抓取和文本挖掘实用指南.html 第 1 页 基于R语言的自动数据收集:网络抓取和文本挖掘实用指南.html 第 2 页 基于R语言的自动数据收集:网络抓取和文本挖掘实用指南.html 第 3 页
下载文档到电脑,方便使用
本文档由 人生无常 于 2026-01-06 11:50:21上传分享
友情链接
站内资源均来自网友分享或网络收集整理,若无意中侵犯到您的权利,敬请联系我们微信(点击查看客服),我们将及时删除相关资源。