网站大量收购独家精品文档,联系QQ:2885784924

分布式流计算平台上任务调度的关键技术研究-软件工程专业论文.docx

分布式流计算平台上任务调度的关键技术研究-软件工程专业论文.docx

  1. 1、本文档共85页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
分布式流计算平台上任务调度的关键技术研究-软件工程专业论文

学校代码 分 类 号  10701 TP31 学 号 1210122644 密 级 公开 TN82西安电子科技大学 TN82 硕士学位论文 分布式流计算平台上任务调度的关键技术研究 作者姓名:张世鹏 领 域: 软件工程 学位类别: 工程硕士 学校导师姓名、职称: 企业导师姓名、职称:  武波教授 张闯副研究员 提交日期: 2014 年 10 月 A Study of Key Technologies about Task Scheduling on Distributed Stream Computing Platform A thesis submitted to XIDIAN UNIVERSITY in partial fulfillment of the requirements for the degree of Master in Software Engineering By Zhang Shi peng Supervisor: Wu bo Zhang chuang October 2014 西安电子科技大学 学位论文独创性(或创新性)声明 秉承学校严谨的学风和优良的科学道德,本人声明所呈交的论文是我个人在 导师指导下进行的研究工作及取得的研究成果。尽我所知,除了文中特别加以标 注和致谢中所罗列的内容以外,论文中不包含其他人已经发表或撰写过的研究成 果;也不包含为获得西安电子科技大学或其它教育机构的学位或证书而使用过的 材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说 明并表示了谢意。 学位论文若有不实之处,本人承担一切法律责任。 本人签名: 日 期: 西安电子科技大学 关于论文使用授权的说明 本人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研 究生在校攻读学位期间论文工作的知识产权单位属于西安电子科技大学。学校有 权保留送交论文的复印件,允许查阅、借阅论文;学校可以公布论文的全部或部 分内容,允许采用影印、缩印或其它复制手段保存论文。同时本人保证,获得 学位后结合学位论文研究成果撰写的文章,署名单位为西安电子科技大学。 保密的学位论文在 年解密后适用本授权书。 本人签名: 导师签名: 日 期: 日 期: 摘要 摘要 西安电子科技大学硕士学位论文 西安电子科技大学硕士学位论文 I I PAGE PAGE IV 摘要 近几年来,数据处理技术飞速地发展,一些基于数据分析的应用技术也随之 大量涌现。并且伴随着各领域中信息采集技术的不断更新,出现了大量实时的非 结构化数据,这些实时产生的数据像流水一样进入数据处理系统。如何实时地抓 取数据流中有价值的信息,并实时地进行精确计算、得出相应结论至关重要。传 统的分布式处理模式不可能实现上述需求,所以,一种全新的分布式流计算处理 模式应运而生,这种处理模式以其良好的扩展性、灵活性、易用性受到业界的欢 迎。本文设计了一套完整的流计算处理平台,在这个平台上用户可以完全避免集 群搭建、平台运维、通信实现的繁琐工作,大大缩短了开发周期。 在分布式流计算系统(如云计算等)上,多任务需要同时运行复杂的计算,通 常把这些任务分配到多个处理机上去处理,这个过程被称为任务调度。采用不同的 任务调度算法对相同的输入数据流进行处理,最终的性能差异非常大。通常在传统 的处理模式中,其输入大多都是静态数据,所以任务的执行时间是可预知的。在均 衡处理机数目受限的条件下,只要给定一组 DAG,经典的 HEFT 算法就能得到一 组高效的调度方案;但是实时流计算平台中的输入是源源不断的数据流,并且数据 量的大小是不确定的,最终导致任务的执行时间是不确定的。这也就直接导致了 HEFT 算法在实际应用环境中,实验结果与预期结果差距较大。 在分布式流计算系统里进行工作流任务调度时,如何解决单个任务执行时间 的不确定性问题至关重要。由于这种不确定性的存在,静态的工作流任务调度方法 将不再可用。因此本文提出一种基于蒙特卡洛的工作流任务调度方法,该方法建立 在一种经典的启发式静态工作流任务调度方法(HEFT)基础之上,通过运用一种 随机数生成算法,在一定约束条件下大量生成任务执行时间,并结合正态分布、均 匀分布模型对任务执行时间进行建模,从而确保了 HEFT 算法的可用性;利用 HEFT 算法,结合随机的任务执行时间,就可以生成大量的调度方案,再从这些调度方案 中选出最优的调度方案,并作为最终的输出方案。整个过程通过对随机数生成机制、 完工时间阈值的确定、各阶段重复次数的限定、性能评估标准等关键技术的研究, 确保了此算法的高效性。通过把这一套全新的任务调度方法应用到“流水行云” 平台中,并经过大量的实验以及性能测试,结果表明:本文提

文档评论(0)

peili2018 + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档