北邮高级计算机系统结构实验二三四五..docVIP

下载本文档

25
0
约 27页
2017-01-29 发布于重庆
举报
版权申诉

北邮高级计算机系统结构实验二三四五..doc

1、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
4、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
5、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
6、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
7、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

北邮高级计算机系统结构实验二三四五.

实验二指令流水线相关性分析 ·实验目的通过使用WINDLX模拟器，对程序中的三种相关现象进行观察，并对使用专用通路，增加运算部件等技术对性能的影响进行考察，加深对流水线和RISC处理器的特点的理解。 ·实验原理：指令流水线中主要有结构相关、数据相关、控制相关。相关影响流水线性能。 ·实验步骤一．使用WinDLX模拟器，对Fact.s做如下分析：（1）观察程序中出现的数据/控制/结构相关。指出程序中出现上述现象的指令组合。（2）考察增加浮点运算部件对性能的影响。（3）考察增加forward部件对性能的影响。（4）观察转移指令在转移成功和转移不成功时候的流水线开销。 ·实验过程使用WinDLX模拟器，对Fact.s做如下分析：浮点加、乘、除部件都设置为1，浮点数运算部件的延时都设置为4，如图1：图1 初始设置将fact.s和input.s加载至WinDLX中，如图2示。图2 加载程序 1.观察程序中出现的数据/控制/结构相关；指出程序中出现上述现象的指令组合。数据相关点击F7，使程序单步执行，当出现R-Stall时停止，运行过程中出现下图3所示，输入整数6。图3 输入整数6 打开Clock Diagram，可以清楚的看到指令执行的流水线如图4所示。图4 指令流水线双击第一次出现R-Stall的指令行，如图5所示。图5 指令详细信息对以上出现的情况分析如下：程序发生了数据相关，R-Stall（R-暂停）表示引起暂停的原因是RAW。 lbu r3,0×0(r2) 要在WB周期写回r3中的数据；而下一条指令 seqi r5,r3,0×a 要在intEX周期中读取r3中的数据。上述过程发生了WR冲突，即写读相关。为了避免此类冲突， seq r5,r4,0×a的intEX指令延迟了一个周期进行。由此，相关指令为：控制相关由图6可以看出，在第4时钟周期：第一条指令处于MEM段，第二条命令处于intEX段，第三条指令出于aborted状态，第四条命令处于IF段。图 6 指令流水线以上情况原因分析：在窗口中，模拟处于第四时钟周期，第3条命令指示为：“aborted”。原因是：第二条命令jal InputUnsigned是无条件分支指令，在第4个时钟周期，jal指令执行intEX周期之后才知道转移的位置，下一条指令应该执行sw SaveR2(r0),r2指令。但之前jal InputUnsigned的下一条命令movi2fp f10.r1已经取出，所以需要将该指令流水清空，即movi2fp的执行应被取消，在流水线中留下气泡。结构相关首先，我们先来看一下执行过控制相关的时空图和Pipeline，如下图7所示。图7 控制相关图8 控制相关的Pipeline 当我们点击Pipeline中IF所对应的框框可以看到详细的该指令执行情况，如下图9所示。图9 指令详情图9表明了addi r2,r2,0×1的详细信息。该指令与它前一条指令add r1,r1,r3发生了结构相关。并且由于此处的冲突，需要暂停2个周期。在ID段暂停后，则开始进图intEX段。所以这条指令（addi r2,r2,0×1）你不能进入ID流水段，译码部分占用，发生了结构相关。该部分的指令为：考察增加浮点运算部件对性能的影响。该实验取N=6 首先通过Configuration，点击Floating Point Stage Configuration来设置浮点运算部件的配置。实验要求所有浮点运算部件的延时都请设定为4个周期，所以我们将Delay这一栏改成4，而Count可以任意，为了对比，我们第一次浮点运算部件取全部为1，第二次浮点运算部件取全部为2。如下图所示：运行50个cycles之后，可以看到他们数据的对比：由此可见，浮点运算部件的增减对效率无影响。比较各个数据，发现没有变化。无论怎么增加浮点运算部件，统计结果都一样。原因在于此程序中浮点计算指令没有重叠，所以并行度没有增加，性能没有提高。 3.考察增加forward部件对性能的影响。为了对比有无forward部件的性能。需要在Configuration中勾选enable forwarding，以及不勾选enable configuration来看性能数据的对比，不使用forward部件和使用forward部件：从上面的数据我们可以看出增加forward部件后RAW由原来占总时钟周期的26%减少至18%，RAW个数由原来的13减少至9。增加forward部件使得控制相关比例增加了。即，使用forward部件后，总的时钟周期减少，数据相关减少，流水线的性能得到一定的改善。 4.观察转移