如何通过用数据挖掘技术来析Web网站日志？如何通过用数据挖掘技术来分析Web网站日志？.docVIP

下载本文档

7
0
约3.82千字
约 9页
2017-04-19 发布于贵州
举报
版权申诉

如何通过用数据挖掘技术来析Web网站日志？如何通过用数据挖掘技术来分析Web网站日志？.doc

1、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
4、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
5、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
6、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
7、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

如何通过用数据挖掘技术来析Web网站日志？如何通过用数据挖掘技术来分析Web网站日志？

国内最具权威的市场调研门户网站之一学数据分析、找行业报告、招调查人才可移步一起调研网一个属于调研行业的B2B网站如何通过用数据挖掘技术来分析Web网站日志？收集web日志的目的Web日志挖掘是指采用数据挖掘技术，对站点用户访问Web服务器过程中产生的日志数据进行分析处理，从而发现Web用户的访问模式和兴趣爱好等，这些信息对站点建设潜在有用的可理解的未知信息和知识，用于分析站点的被访问情况，辅助站点管理和决策支持等。1、以改进web站点设计为目标，通过挖掘用户聚类和用户的频繁访问路径，修改站点的页面之间的链接关系，以适应用户的访问习惯，并且同时为用户提供有针对性的电子商务活动和个性化的信息服务，应用信息推拉技术构建智能化Web站点。2、以分析Web站点性能为目标，主要从统计学的角度，对日志数据项进行粗略的统计分析，得到用户频繁访问页、单位时间的访问数、访问数量随时间分布图等。现有的绝大多数的Web日志分析工具都属于此类。3、以理解用户意图为目标，主要是通过与用户交互的过程收集用户的信息，Web服务器根据这些信息对用户请求的页面进行裁剪，为用户返回定制的页面，其目的就是提高用户的满意度和提供个性化的服务。收集方式网站分析数据主要有三种收集方式：Web日志、Javaｓｃｒｉｐｔ标记和包嗅探器。1. Web日志web日志处理流程：从上图可以看出网站分析数据的收集从网站访问者输入URL向网站服务器发出http请求就开始了。网站服务器接收到请求后会在自己的Log文件中追加一条记录，记录内容包括：远程主机名(或者是IP地址)、登录名、登录全名、发请求的日期、发请求的时间、请求的详细(包括请求的方法、地址、协议)、请求返回的状态、请求文档的大小。随后网站服务器将页面返回到访问者的浏览器内得以展现。2. Javaｓｃｒｉｐｔ标记Javaｓｃｒｉｐｔ标记处理流程：上图所示Javaｓｃｒｉｐｔ标记同Web日志收集数据一样，从网站访问者发出http请求开始。不同的是，Javaｓｃｒｉｐｔ标记返回给访问者的网页代码中会包含一段特殊的Javaｓｃｒｉｐｔ代码，当页面展示的同时这段代码也得以执行。这段代码会从访问者的Cookie中取得详细信息(访问时间、浏览器信息、工具厂商赋予当前访问者的userID等)并发送到工具商的数据收集服务器。数据收集服务器对收集到的数据处理后存入数据库中。网站经营人员通过访问分析报表系统查看这些数据。3. 包嗅探器通过包嗅探器收集分析的流程：上图可以看出网站访问者发出的请求到达网站服务器之前，会先经过包嗅探器，然后包嗅探器才会将请求发送到网站服务器。包嗅探器收集到的数据经过工具厂商的处理服务器后存入数据库。随后网站经营人员就可以通过分析报表系统看到这些数据。web日志挖掘过程整体流程参考下图： 1、数据预处理阶段根据挖掘的目的，对原始Web日志文件中的数据进行提取、分解、合并、最后转换为用户会话文件。该阶段是Web访问信息挖掘最关键的阶段，数据预处理包括:关于用户访问信息的预处理、关于内容和结构的预处理。2、会话识别阶段该阶段本是属于数据预处理阶段中的一部分，这里将其划分成单独的一个阶段，是因为把用户会话文件划分成的一组组用户会话序列将直接用于挖掘算法，它的精准度直接决定了挖掘结果的好坏，是挖掘过程中最重要的阶段。3、模式发现阶段模式发现是运用各种方法和技术从Web日志数据中挖掘和发现用户使用Web的各种潜在的规律和模式。模式发现使用的算法和方法不仅仅来自数据挖掘领域，还包括机器学习、统计学和模式识别等其他专业领域。模式发现的主要技术有：统计分析（statistical analysis）、关联规则（association rules）、聚类（clustering）、归类（classification）、序列模式（sequential patterns）、依赖关系（dependency）。（1）统计分析（statistical analysis）：常用的统计技术有：贝叶斯定理、预测回归、对数回归、对数-线性回归等。可用来分析网页的访问频率，网页的访问时间、访问路径。可用于系统性能分析、发现安全漏洞、为网站修改、市场决策提供支持。（2）关联规则（association rules）：关联规则是最基本的挖掘技术，同时也是WUM最常用的方法。在WUM中常常用在被访问的网页中，这有利于优化网站组织、网站设计者、网站内容管理者和市场分析，通过市场分析可以知道哪些商品被频繁购买，哪些顾客是潜在顾客。（3）聚类（clustering）：聚类技术是在海量数据中寻找彼此相似对象组，这些数据基于距离函数求出对象组之间的相似度。在WUM