在ElasticSearch中，集群(Cluster),节点(Node),分片(Shard),Indices(索引),replicas(备份)之间是什么关系？

最近在知乎上看到了这个问题，自己也搞了半学期的Elasticsearch，于是就想用自己所知道的浅陋知识来回答一下这个问题。

Cluster包含多个node，Indices不应该理解成动词索引，Indices可理解成关系数据库中的databases，Indices可包含多个Index，Index对应关系数据库中的database，它是用来存储相关文档的。
Elasticsearch与关系数据的类比对应关系如下：

Relational DB ⇒ Databases ⇒ Tables ⇒ Rows ⇒ Columns

Elasticsearch ⇒ Indices ⇒ Types ⇒ Documents ⇒ Fields

这里的document的可以理解为一个JSON序列对象。每个document可包含多个field。

再来说说Shard，每个Index（对应Database）包含多个Shard，默认是5个，分散在不同的Node上，但不会存在两个相同的Shard存在一个Node上，这样就没有备份的意义了。Shard是一个最小的Lucene索引单元。

当来一个document的时候，Elasticsearch通过对docid进行hash来确定其放在哪个shard上面，然后在shard上面进行索引存储。

replicas就是备份，Elasticsearch采用的是Push Replication模式，当你往 master主分片上面索引一个文档，该分片会复制该文档(document)到剩下的所有 replica副本分片中，这些分片也会索引这个文档。我个人觉得这种模式很nice，有些时候对于一个document的进行索引可能生成很大的索引文件，会很占带宽，而只传输原始文件会好很多。

当进行查询是，如果提供了查询的DocID，Elasticsearch通过hash就知道Doc存在哪个shard上面，再通过routing table查询就知道再哪个node上面，让后去node上面去取就好了。如果不提供DocID,那么Elasticsearch会在该Index（indics）shards所在的所有node上执行搜索预警，然后返回搜索结果，由coordinating node gather之后返回给用户。

配置上需要把握什么样的原则，应该去看一个ES优化方面的资料，推荐两本书

ElasticSearch Server (豆瓣)，Mastering ElasticSearch (豆瓣)

时间： 2024-10-12 00:25:53

在ElasticSearch中，集群(Cluster),节点(Node),分片(Shard),Indices(索引),replicas(备份)之间是什么关系？

在ElasticSearch中，集群(Cluster),节点(Node),分片(Shard),Indices(索引),replicas(备份)之间是什么关系？的相关文章

Elasticsearch核心技术(2)--- 基本概念(Index、Type、Document、集群、节点、分片及副本、倒排索引)

Tomcat集群---Cluster节点配置(转)

Dubbo中集群Cluster，负载均衡，容错，路由解析

什么是集群(cluster)

输出redis cluster集群所有节点指定的参数的配置

elasticsearch 搭建-集群-java应用

ELK介绍及搭建 Elasticsearch 分布式集群

Akka（10）：分布式运算：集群-Cluster

谈一谈Elasticsearch的集群部署