- 1、本文档共4页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
网站用户行为数据收集和分析方法
网站用户行为数据收集和分析方法为改善网站的可用性, 一般采用可用性工程方法, 其核心是以用户为中心的设计方法论(UCD)。综合介绍了目前国内外对于用户行为数据收集和分析方法所进行的研究, 各种方法的特点, 并介绍一些利用相应方法所开发出的工具实例, 使得建设的网站更加符合用户的需要, 以保障用户与网站之间沟通的顺畅。随着In ternet 的不断发展, 各种各样的网站如雨后春笋般成倍增长, 各个商业网站之间的竞争越来越激烈, 随之而来的是, 网站的建设不可避免的出现了很多问题。从最近一次国外对15 个大型网站进行统计分析表明, 用户在寻找自己所需要的信息时, 只有42% 的概率可以找到, 而在大部分的时间里用户都无法找到自己所需要的信息, 这使得用户在浏览网站时经常遭遇挫折, 严重影响了用户对网站的兴趣和信任。正如 J acob N ielsen 所指出的如果你想通过网站找到某些信息, 那么在一般情况下很难找到, 就算能够找到, 也要经过一番周折。从以往的经验可以得知, 除非项目管理团队在整个网站设计过程中就特别考虑网站的可用性, 否则结果往往令人失望。针对网站的特点, 目前国内外提出了很多依靠计算机辅助来自动收集和分析用户行为数据的方法, 本文以下部分将重点介绍基于服务器日志收集和分析用户行为数据的方法和从客户端收集和分析用户行为数据的方法, 并对根据不同的方法所开发出的一些工具进行了介绍。1 基于服务器日志收集和分析用户行为数据的方法目前, 对于网站来说, 自动获得用户行为数据最流行的方法之一是基于服务器日志的方法(Server log) ,就是通过从w eb 服务器所产生的日志文件来获取有用的数据。服务器日志文件就是用来记录w eb 服务器的活动, 提供了详细的客户和服务器的交互活动日志, 其中包括客户的请求和服务器的响应。通过日志文件收集到的数据形式依赖于具体的w eb 服务器类型, 不同的w eb 服务器产生的信息是不一样的。1. 1 基于服务器日志方法的优点通过日志文件可以获得很有价值的网站使用情况的数据。 ① 日志文件是由w eb 服务器自动生成, 所以花费比较小。 ② 与人为建造的可用性实验室环境相比, 通过日志文件获得的数据更能够反映真实环境下用户的真实情况。 ③ 与只对几个用户在几小时内进行的测试所获得的数据相比, 通过日志文件获得的是大量的用户在相当长一段时间内的行为数据, 这对分析用户的行为是十分有利的, 可以利用数据挖掘等技术对用户进行分析。 ④ 开发基于日志文件的数据分析工具相对比较容易, 花费也不是太大。1. 2 基于服务器日志方法的缺点基于日志的方法对于网站的可用性研究来说还存在着很多不足之处, 由于日志文件就是被设计用来产生站点级的性能统计数据, 因此不可避免的是, 日志文件所提供的数据与用来分析网站可用性所需的大量数据相比会有所不足, 对于研究潜在的可用性问题只能提供少量的数据甚至还可能提供一些误导性的数据。这是因为一旦w eb 服务器把用户请求的页面发送出去之后, 如果用户不发出请求, 则页面和用户之间发生了什么w eb 服务器并不记录。下面是一些从日志文件中获取的数据不足或有误导性数据的例子。① 谁正在访问网站。如果想知道谁正在访问网站, 要求日志文件必须包含一个个人ID 或者登录到服务器的登录标示, 但是目前的网站一般不需要用户登录, 大多情况下由日志文件提供的客户端信息是客户的IP 地址, 而这些IP 地址很多情况下是由In ternet 提供商提供的动态IP。并且有时用通过代理服务器来访问In ternet (例如, 学校的校园网) , 这样就不能正确得知是哪个用户在访问网站。 ② 用户访问网站的路径。如果日志文件能够记下用户所浏览的每个页面, 那么自然可以清楚的记录用户的访问路径, 然而, 当把用户的浏览器设置为可使用缓存(cache) 时(通常是缺省设置) , 用户所浏览的一些页面就不能被w eb 服务器所记录, 例如, 使用Back 按钮浏览的页面就不能被记录。而且, 如果同一页面中提供了多个选择可链接到同一个页面的话, 用户到底是使用哪一个链接过去, 这一信息从log 文件中也难以获得, 但是这一信息对改善网站的可用性也是很重要的。如果是通过图片链接,w eb 服务器可能会记下用户单击的坐标位置, 从而可以获得用户的确切信息, 如果没有使用这种技术的话, 就很难捕获这一信息。而且, 当用户通过键入U RL 地址, 或通过书签来访问页面时,w eb 服务器也不能记录这一信息。③ 用户在每页的停留时间。日志文件记录的是数据开始传输的时间, 而不是传输完成的时间。而且也不清楚, 在页面下载的过程中, 用户
文档评论(0)