一分钟了解互联网数据挖掘流程.docx

下载文档

3
0
约1.9千字
约 3页
2024-08-05 发布于上海
举报
版权申诉
保障服务

一分钟了解互联网数据挖掘流程.docx

1、本文档共3页，可阅读全部内容。
2、有哪些信誉好的足球投注网站（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。
3、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。

一分钟了解互联网数据挖掘流程

1、爬虫抓取网络数据

真实的数据挖掘项目，一定是从获取数据开始的，除了通过一些渠道购买或者下载专业数据外，常常需要大家自己动手爬互联网数据，这个时候，爬虫就显得格外重要了。

Nutch爬虫的主要作用是从网络上抓取网页数据并建立索引。我们只需指定网站的顶级网址，如，爬虫可以自动探测出页面内容里新的网址，从而进一步抓取链接网页数据。nutch支持把抓取的数据转化成文本，如（PDF、WORD、EXCEL、HTML、XML等形式）转换成纯文字字符。

Nutch与Hadoop集成，可以将下载的数据保存到hdfs，用于后续离线分析。使用步骤为：

向hdfs中存入待抓取的网站url

$hadoopfs-puturldirurldir

注：

第一个urldir为本地文件夹，存放了url数据文件，每行一个url地址第二个urldir为hdfs的存储路径。

启动nutch，在NUTCH_HONE目录下执行以下命令

$bin/nutchcrawlurldir–dircrawl-depth3–topN10

命令成功执行后，会在hdfs中生成crawl目录。

2、MapReduce预处理数据

对于下载的原始文本文档，无法直接进行处理，需要对文本内容进行预处理，包括文档切分、文本分词、去停用词（包括标点、数字、单字和其它一些无意义的词）、文本特征提取、词频统计、文本向量化等操作。

常用的文本预处理算法是TF-IDF，其主要思想是，如果某个词或短语在一篇文章中出现的频率高，并且在其他文章中很少出现，则认为此词或者短语具有很好的类别区分能力，适合用来做分类。

输入原始文本内容：

Againitseemsthatcocoadelivered??

执行TF-IDF预处理：

hadoopjar$JARSparseVectorsFromSequenceFiles??

输出文本向量:

9219:0.246453:0.09810322:0.2111947:0.272??

每一列是词及其权重，使用冒号分隔，例如“9219:0.246”表示编号为9219的词，对应原始单词为“Again”，其权重值为0.246。

3、Mahout数据挖掘

预处理后的数据就可以用来做数据挖掘。Mahout是一个很强大的数据挖掘工具，是分布式机器学习算法的集合，包括：协同过滤、分类、聚类等。

以LDA算法为例，它可以将文档集中每篇文档的主题按照概率分布的形式给出。它是一种无监督学习算法，在训练时不需要手工标注主题，需要的仅仅是指定主题的数量K。此外LDA的另一个优点则是，对于每一个主题均可找出一些词语来描述它。

输入预处理后的数据:9219:0.246453:0.098??

执行LDA挖掘算法：mahoutcvb–k20??

输出挖掘结果：

topic1{computer,technology,system,internet,machine}topic2{play,film,movie,star,director,production,stage}

我们可以获知用户的偏好是哪些主题，这些主题是由一些关键词组成。

4、Sqoop导出到关系数据库

在某些场景下，需要把数据挖掘的结果导出到关系数据库，用于及时响应外部应用查询。

sqoop是一个用来把hadoop和关系型数据库中的数据相互转移的工具，可以将一个关系型数据库（例如：MySQL,Oracle等）中的数据导入到hadoop的hdfs中，也可以将hdfs的数据导出到关系型数据库中：

sqoopexport–connectjdbc:mysql://localhost:3306/zxtest–usernameroot–passwordroot–tableresult_test–export-dir/user/mr/lda/out

export操作实现把hdfs目录/user/mr/lda/out下数据导出到mysql的

result_test表。

【编辑推荐】

大数据挖掘技术之DM经典模型（上）

给传统企业和现有互联网企业：如何成为“大数据企业”

我用爬虫一天时间“偷了”知乎一百万用户，只为证明PHP是世界上最好的语言

数据挖掘算法与现实生活中的应用案例

大数据挖掘，能击败猖獗的ISIS吗？

您可能关注的文档

文档评论（0）

hao187 + 关注: 官方认证

内容提供者

该用户很懒，什么也没介绍

咨询Ta 进入空间

认证主体武汉豪锦宏商务信息咨询服务有限公司

IP属地上海

统一社会信用代码/组织机构代码: 91420100MA4F3KHG8Q

1亿VIP精品文档

更多 >

一分钟了解互联网数据挖掘流程.docx