- 10
- 0
- 约3.14万字
- 约 46页
- 2026-04-20 发布于江西
- 举报
互联网大数据应用与挖掘手册
第1章大数据基础架构与标准规范
第一节分布式存储与计算核心原理
1.1分布式存储与计算核心原理
分布式存储是指将海量数据分散存储在多台或更多台物理节点上,通过分布式文件系统(如HDFS)实现数据的高可用性、高扩展性和低成本存储。其核心在于“数据复制”机制,当数据被写入时,系统会自动将副本复制到多个节点,一旦某个节点发生故障,系统会自动从其他节点恢复数据,确保数据零丢失。在计算层面,分布式计算框架(如Spark或Flink)利用“批处理”和“流处理”两种范式来处理数据。批处理框架适合对数据完整性要求高、需要离线分析的场景,它会将数据先加载到内存中进行计算,计算完成后将结果写入磁盘;流处理框架则适合实时处理数据,它能在数据产生时立即进行处理,并将结果实时写入消息队列,实现毫秒级的响应。
容错机制是分布式系统稳定运行的基石,它通过“检查点(Checkpoint)”技术实现。系统每隔一段时间(如每10秒)或每处理一批数据,会将当前计算状态快照保存,如果进程在检查点前崩溃,系统可以从检查点继续执行,无需重新计算历史数据,从而保证计算任务的连续性。数据倾斜(DataSkew)是分布式系统面临的主要性能瓶颈之一,通常发生在某些数据节点的数据量远大于其他节点时。为了解决这个问题,架构师通常会采用“数据均衡”策略,即在写入数据时随机分散
原创力文档

文档评论(0)