鸿蒙开发者社区

WOT技术大会

公众号矩阵

移动端

视频课免费课排行榜短视频直播课软考学堂

全部课程软考华为认证厂商认证 IT技术 PMP项目管理免费题库

文章资源问答课堂专栏直播

51CTO

鸿蒙开发者社区

51CTO技术栈

51CTO官微

51CTO学堂

51CTO博客

CTO训练营

鸿蒙开发者社区订阅号

51CTO软考

51CTO学堂APP

51CTO学堂企业版APP

鸿蒙开发者社区视频号

51CTO软考题库

账号设置退出

百度Hadoop分布式系统揭秘：4000节点集群

作者：chinacloud 2011-08-12 10:58:51

数据库其他数据库分布式 Hadoop

在 NoSQL 方面，之前了解到百度对 Hadoop 和 hypertable 都有研究，而且 hypertable 方面更是作为其主要赞助商之一，但之前和百度的一些朋友了解到百度内部对 hypertable 倒是使用不多，相反在 Hadoop 方面倒是有比较大的应用实例。下面一篇文章描述了百度内部4000个结点的 Hadoop 集群的一些技术细节。

在 NoSQL 方面，之前了解到百度对 Hadoop 和 hypertable 都有研究，而且 hypertable 方面更是作为其主要赞助商之一，但之前和百度的一些朋友了解到百度内部对 hypertable 倒是使用不多，相反在 Hadoop 方面倒是有比较大的应用实例。下面一篇文章描述了百度内部4000个结点的 Hadoop 集群的一些技术细节。

百度的高性能计算系统(主要是后端数据训练和计算)目前有4000节点，超过10个的集群，最大的集群规模在1000个节点以上。每个节点由8核 CPU以及16G内存以及12TB硬盘组成，每天的数据生成量在3PB以上。规划当中的架构将有超过1万个节点，每天的数据生成量在10PB以上。

底层的计算资源管理层采用了Agent调度不同类型的计算分别给MPI结构的算法和Map-Reduce和DAG算法应用等。而通过调度的分配，可以让HPC高性能计算集群和大规模分布式集群各得其所的计算相应数据。

百度通过HCE对streaming作业的排序，压缩，解压缩，内存控制进行了优化并提供了C++版的MapReduce接口。

百度HCE语言的有关内容，HCE是基于C++的Hadoop环境，是一个全功能C++环境，可以避开Java语言对于释放内存和资源申请的弊端，并在调用数据时绕开Java语言的所有关节，极大的提升算法效率。

百度的调度器是在capacity-scheduler的基础上根据自身业务改进的。

百度计划对shuffle流程进行大幅改造

原文链接：http://www.cnblogs.com/chinacloud/archive/2010/11/08/1871592.html

【编辑推荐】

责任编辑：艾婧来源： chinacloud

51CTO技术栈公众号

业务
速览

媒体

51CTO CIOAge HC3i

社区

51CTO博客鸿蒙开发者社区 AI.x社区

教育

51CTO学堂精培企业培训 CTO训练营