基于Hadoop平台的快速日志挖掘方法.docxVIP

  • 2
  • 0
  • 约7.44千字
  • 约 13页
  • 2023-09-26 发布于浙江
  • 举报
? ? 基于Hadoop平台的快速日志挖掘方法? ? ? 昂 鑫 徐 建 张 宏 (南京理工大学计算机科学与工程学院 南京 210094) 1 引言 随着互联网和电子商务的不断发展,越来越多的人选择网上购物,这些用户访问、交易的过程和系统状态都会以日志的形式记录下来。显然这些日志数据是异构的,且数量巨大,并且,其中蕴含着很多有价值的信息。比如,通过挖掘Web 日志,可以统计分析出服务器在不同时段的用户访问量,访问者IP 地址的分布情况,访问网页的时间等,然后给用户定向推送相关产品信息和广告。再比如,可通过日志分析某网站访问量是否异常,进而判断是否有黑客攻击或者非法链接请求等,所以,日志挖掘是非常有意义的工作。然而,一个可接受的日志标准还没有被开发,因此,如何快速解析来自不同系统的日志数据是一个极具挑战性的问题。 目前已知的日志模式发现方法主要分为两大类:基于正则表达式的日志匹配方法,基于聚类算法的日志模式识别。许多公司开发了日志分析工具,如:Splunk,Sumo Logic,loggly,LogEntries 等,还有一些开源软件包也被用于日志分析,如Elastic-Search[1],OSSIM[2]等。这些工具和软件包大多使用正则表达式来匹配日志数据,仅支持监督匹配,不适用于大量异构日志。此外,正则表达式的编写过程复杂、容易产生冲突的特点给日志分析工作带来了很大的困难

文档评论(0)

1亿VIP精品文档

相关文档