转载

发表于 2019年03月25日
浏览 (991)
评论 (0)

HDFS Architecture

Introduction

HDFS(Hadoop Distributed File System)是一个分布式文件系统，它具有很高的容错性，可以支持运行在廉价的硬件设备上。HDFS具有很高的吞吐量，非常适合拥有海量数据的application。HDFS放宽了一些POSIX要求，以支持流的方式访问文件系统中的数据。HDFS是Apache Hadoop核心项目的一部分。

HDFS设计目标

硬件故障是经常会发生的

一个HDFS实例可以包含成百上千台的服务器，每个服务器存储整个文件系统数据的一部分。每台服务器都有一定的概率出现硬件故障，这意味着一个HDFS实例中的一部分服务器在某个时刻可能是不可用的。因此，发现故障并能够从故障中快速恢复是HDFS的核心目标。

批处理

HDFS适合应用在批处理领域，而不适合与用户交互的领域。它的设计目标是数据访问的高吞吐量，而不是低延迟。

大数据集

运行在HDFS上的application通常都拥有大数据集，例如一个文件可以达到gigabytes或terabytes大小。因此一个HDFS集群可以扩展到数百个节点，可以支持数千万个文件的存储。

简单的一致性模型

HDFS上的文件模型是 write-once-read-many 。一个文件在完成 创建-写入数据-关闭 后只能再对文件执行appends和truncates两种类型修改操作，无法再执行其它形式的修改。即只能在文件尾部添加或删除数据，不支持在文件的任意位置修改数据。

使计算节点靠近它需要的数据

在分布式系统中，如果一个计算节点要处理的数据离自己很近，那么会有助于提高数据计算的效率。如果要处理的数据量非常大，那么效率提升将更加明显。因为这会降低整个系统的网络拥塞，并提高分布式系统整体的吞吐量。HDFS提供了相应的API，可以将application本身移向数据存储的节点。

原文 https://segmentfault.com/a/1190000018634228

正文到此结束

所属分类：软件架构编程技术

本文标签： http Hadoop Apache Hadoop 分布式集群 dist 分布式文件系统服务器 API 文件系统 cat 一致性 apache 大数据 IO 实例模型数据删除 https App 分布式系统 HDFS
版权声明： 本文为互联网转载文章，出处已在文章中说明(部分除外)。如果侵权，请联系本站长删除，谢谢。
本文海报： 生成海报一生成海报二

热门推荐

配置虚拟站点

浏览(9,369) 评论(20)
修改上传文件权限

浏览(10,978) 评论(18)
VPS 自我监控

浏览(9,740) 评论(23)
OpenVZ VPS 额外支持

浏览(9,848) 评论(17)
openfire数据库安装指南

浏览(19,439) 评论(0)
openfire定制指南

浏览(10,925) 评论(17)
Caffe 深度学习框架上手教程

浏览(15,205) 评论(0)
ReactiveCocoa入门教程：第一部分

浏览(16,031) 评论(0)
开源HIDS-OSSEC使用实例:监测CC攻击

浏览(15,918) 评论(0)
Decorators in ES7

浏览(20,591) 评论(4)

相关文章

阿里云首购8折

Loading...

其他链接

关于本站

本站定位：个人技术类博客

本站作用：写博客、记日志、闲聊扯淡鼓捣技术。

问题交流

[HBLOG]公众号

HBLOG

HBLOG