证券公司大数据面试真题及详细答案(实战无模板版).docxVIP

  • 0
  • 0
  • 约5.55千字
  • 约 7页
  • 2026-09-16 发布于河北
  • 举报

证券公司大数据面试真题及详细答案(实战无模板版).docx

证券公司大数据面试真题及详细答案(实战无模板版)

一、基础技术模块(券商必问)

1、说说Hive和MySQL的核心区别,为什么券商离线数仓基本用Hive不用MySQL?

参考答案:

首先两者的定位完全不同,MySQL是关系型事务数据库,主打联机实时读写、事务一致性;Hive是基于Hadoop的离线数仓工具,主打海量数据批量分析。

核心区别有四点:

第一,数据量级。券商每日产生千万级交易数据、亿级用户行为数据,MySQL单表千万级就会性能崩盘,Hive可以支撑PB级海量数据存储和计算,完全适配券商海量历史行情、交易流水数据。

第二,事务支持。MySQL支持ACID事务,适合交易下单、资金划转这类实时业务;Hive早期不支持事务,新版本仅支持有限事务,不适合高频读写,只适合批量写入、批量查询的分析场景。

第三,查询延迟。MySQL毫秒、秒级实时查询;Hive是MapReduce/Spark批量计算,分钟级延迟,只用于离线数据分析、报表统计。

第四,存储架构。MySQL是本地磁盘存储,扩容成本高;Hive基于分布式HDFS存储,横向扩容简单,适配券商长期积累的行情、用户、风控日志数据。

券商不用MySQL做数仓的核心原因:海量历史交易数据存不下、跑不动,批量统计报表效率极低,且无法支撑多维度海量数据复盘分析。

2、Spark和MapReduce对比,券商大数据计算为什么优先用Spark

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档