- 1、本文档共6页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
贝叶斯公式在处理垃圾邮件中应用
PAGE
PAGE 6
基于贝叶斯技术的垃圾邮件处理研究
易 均 ,李晖 ,王歆
(江西省科学院 ,江西 南昌 330029)
摘要:本论文首先对垃圾邮件进行了简要的描述,并叙述了反垃圾邮件技术的研究现状,介绍贝叶斯过滤技术的工作原理及技术原理,最后给出贝叶斯技术研究的发展方向。
关键词: 贝叶斯技术;反垃圾邮件
1、前言
随着因特网应用的快速发展,电子邮件也逐步成为因特网的最大一个应用之一,给我们生活带来很大的方便,而且电子邮件的发展也代表了我国进入信息业高速发展的阶段。但是也同时产生了一个新的问题,即大量的垃圾邮件出现。如何把电子邮件中的垃圾邮件过滤掉,已经成为电子邮件用户此刻最关心的一大问题,这也就是所谓的“反垃圾邮件”问题。
反垃圾邮件是具有相当难度的事情,垃圾邮件每天都在增加和变化。据Radicati估计2007年,垃圾邮件的比例将达到70%。现在的垃圾邮件发送者变得更加狡猾,采用静态反垃圾邮件技术很难防范。垃圾邮件发送者只要简单的研究一下现在采用了哪些静态反垃圾邮件,然后相应的改变一下邮件的内容或发送方式,就可以逃避检查了,因此,必须采用一种新的技术来克服静态反垃圾邮件的弱点,这种技术应该对垃圾邮件发送者的各种伎俩了如指掌,还要能适应不同用户对于反垃圾邮件的个性化需求。这种技术就是贝叶斯过滤技术。
2、垃圾邮件概述以及反垃圾邮件技术的研究现状
2.1、垃圾邮件的概述
我国至今对垃圾邮件的定义有很多种,包括如下几种: = 1 \* GB3 ①收件人没有提出要求或者同意接收的广告、及其各种形式的宣传品等宣传性的电子邮件; = 2 \* GB3 ②在邮件中,隐藏了发件人身份、地址、标题等信息的电子邮件: = 3 \* GB3 ③含有虚假的发件人的身份、地址等信息源的电子邮件; = 4 \* GB3 ④收件人无法拒收或者无法删除的电子邮件。目前,垃圾邮件的定义被扩大了,除了上述对垃圾邮件定义外,病毒、反动、色情等等无用的邮件,也被包括在垃圾邮件的定义中。
2.2、反垃圾邮件技术的研究现状
目前影响较大的主流反垃圾邮件技术有以下二种:
= 1 \* GB2 ⑴协议改进类的方法,重新构建SMTP协议,加入安全认证机制。针对垃圾邮件问题对SMTP协议进行改进和完善是许多研究人员关注的重点问题所在。因为就SMTP协议改进而言面临着很多棘手之处,因此目前新协议没有得到广泛的使用,相信未来随着网络结构的进一步发展,在这方面的研究成果会成为解决垃圾邮件问题的有力措施。
= 2 \* GB2 ⑵在当今的邮件系统中载入其它处理程序来阻断垃圾邮件,其中包含了垃圾邮件过滤技术、邮件服务器的安全管理技术两部分内容。对过滤技术的应用主要集中在利用IP或者域名“黑名单”进行邮件过滤或中断;基于数据挖掘技术进行的过滤垃圾邮件,利用文本分类与统计算法进行垃圾邮件检测。比较有代表性的包括结合DNS的实时黑名单过滤、贝叶斯过滤器等,其中贝叶斯过滤器以较高的准确率在垃圾邮件过滤技术中占据了很重要的地位。
3、贝叶斯过滤技术
3.1、贝叶斯过滤技术的工作原理
根据贝叶斯理论,根据已经发生的时间可以预测未来事件发生的可能性。将该理论运用到反垃圾邮件上:若已知某些字词经常出现在垃圾邮件中,却很少出现在合法邮件中,当一封邮件含有这些字词时,那么他是垃圾邮件的可能性就很大。
= 1 \* GB2 ⑴创建基于字词符号的贝叶斯数据库
用户首先需要对贝叶斯进行培训,即将邮件分类为垃圾邮件(用户不想要的)和正常邮件(用户想要的),贝叶斯将提取这些邮件样本中主题和信体中的独立字串,包括字词(word)和符号(token)(如$,IP地址,域名等),并建立相应的数据库。
= 2 \* GB2 ⑵创建贝叶斯概率库
统计出每个字串在垃圾邮件中出现的概率以及在正常邮件中出现的概率,然后根据公式计算出邮件中含某字串则为垃圾邮件的概率。例如:在3000封垃圾邮件样本中mortgage(抵押)出现了400次,而在300封正常邮件中这个词出现了5次,那么其对应的垃圾概率为0.8889([400/3000] /[5/300+400/3000])。
= 3 \* GB2 ⑶创建个性化的贝叶斯库
由于每个单位对所收到的邮件偏好是不同的,例如,某个金融类单位在正常邮件中可能经常用到mortgage这个词,如果使用静态的关键词过滤,就可能产生很多误判。如果采用贝叶斯过滤,在对贝叶斯进行培训的时候,将该单位的合法邮件(自然,很多都包含了mortgage这个词)分类为正常邮件。这样,垃圾邮件的识别率将更高,同时也使得误判率变得很低。
贝叶斯过滤算法的主要思想是在已知的大量垃圾邮件中,邮件中包含一些特
您可能关注的文档
最近下载
- 生态恢复治理工程施工方案.docx VIP
- 2025年上半年意识形态工作总结+2025年意识形态问题整改情况报告+上半年市委办公室意识形态问题整改情况报告.docx VIP
- 2025年共享经济案例研究:共享单车市场发展与竞争格局分析.docx VIP
- 运输应急预案.doc VIP
- DB50_T 1419-2023 汽车数字钥匙系统技术要求与测试方法.docx VIP
- 承包竹山合同协议.docx VIP
- 2025年教科版(2024)小学科学三年级上册(全册)教学设计(附目录P171).docx
- 2024数字钥匙技术规范.docx VIP
- 人文关怀示范病房建设的实施策略及成效ppt课件.pptx
- 《急性心力衰竭中国急诊管理指南(2022)》解读.p.pptx
文档评论(0)