Web教学资源抽取技术及其应用研究.pdf

1.2研究现状 信息抽取【4]技术的核心是能够从Web页所包含的无结构或半结构的信息中识别用户 感兴趣的数据,并将其转化为更加结构化、语义更为清晰的格式。 Web信息抽取的一个直接应用就是帮助人们在纷繁复杂的Web信息海洋中快速准确 地查找所需信息,加快人们获取信息的速度。举例来讲,将分散在不同Web页面的动态 变化的股市信息抽取出来可用于股市行情公告;将不同商家网站(Web页面)提供的商 品价格信息抽取出来提供给用户,用于比价购物;通过抽取用户兴趣相关的信息可为用 户提供个性化信息服务等。 将信息从网页中抽取出来通常是由包装器【5】(Wrapper)完成的,所谓包装器就是一 个能够将数据从HTML网页中抽取出来并且将它们还原为结构化的数据(例如XML数据) 的软件程序。 定义1.1:给定一个包含一系列对象的页面s,找到一个映射关系w,它可以将S中 的对象映射到一个数据集R,并且这个映射W还必须可以从任何与S类似的页面S’中 识别并抽取数据。(其中的“类似”页面指与S来自同一网站或Web服务的页面,具有 相对一致的页面结构)。 本文档(这个数量一般较少)而生成的,一旦生成后,就可以利用这个包装器对与样本 文档具有类似结构的所有文档进行自动的信息抽取。Web数据抽取的核心是构造用于抽 取的Wrapper

文档评论(0)

1亿VIP精品文档

相关文档