2026年高级系统容错机制设计考试试题及答案.docxVIP

  • 1
  • 0
  • 约1.01万字
  • 约 26页
  • 2026-09-05 发布于广西
  • 举报

2026年高级系统容错机制设计考试试题及答案.docx

2026年高级系统容错机制设计考试试题及答案

一、单项选择题(每题2分,共20分)

1.某公有云厂商为其上部署的千亿参数大模型推理服务设计端到端容错机制,针对推理请求过程中GPU节点硬件瞬时故障导致的请求中断,以下哪种容错方案的性价比最优?

A.全局请求重试+全链路状态快照持久化

B.推理请求幂等设计+节点本地请求重定向到空闲GPU

C.多可用区主动冗余部署+跨可用区请求故障切换

D.GPUECC错误预检测+宕机前节点迁移

答案:B

解析:大模型推理请求本身具备无状态特征,幂等设计即可保证重复请求不会产生异常结果,单个GPU节点发生瞬时故障后,仅需将未完成请求重定向到同可用区空闲GPU即可恢复服务,不需要全链路快照持久化,也不需要触发跨可用区切换,资源开销和延迟都远低于其他选项,性价比最高。A选项全链路状态快照会大幅增加存储和IO开销,对推理性能影响明显;C选项多可用区冗余部署需要额外占用一倍以上的资源,成本极高;D选项ECC预检测仅能识别可预判的渐进式硬件故障,无法处理突发瞬时故障,因此B为正确选项。

2.在云原生微服务架构中,针对服务雪崩场景,以下基于滑动窗口实现的自适应熔断机制相较于传统固定阈值熔断,其核心优势是?

A.降低熔断触发的误判率,适配流量的潮汐性特征

B.减少滑动窗口维护的内存开销

C.加快熔断恢复阶段的半开探针成功率

D.提升异常请求的过滤

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档