Elasticsearch系列---常见搜索方式与聚合分析

概要

本篇主要介绍常见的6种搜索方式、聚合分析语法，基本是上机实战，可以和关系型数据库作对比，如果之前了解关系型数据库，那本篇只需要了解搜索和聚合的语法规则就可以了。

搜索响应报文

以上篇建立的music索引为例，我们先看看搜索结果的属性都有哪些

{
  "took": 1,
  "timed_out": false,
  "_shards": {
    "total": 5,
    "successful": 5,
    "skipped": 0,
    "failed": 0
  },
  "hits": {
    "total": 1,
    "max_score": 1,
    "hits": [
      {
        "_index": "music",
        "_type": "children",
        "_id": "1",
        "_score": 1,
        "_source": {
          "name": "gymbo",
          "content": "I hava a friend who loves smile, gymbo is his name",
          "length": "75"
        }
      }
    ]
  }
}

主要的参数说明如下：

took：耗费时间，单位是毫秒。
timed_out：是否超时，true有超时，false没超时。
_shards：数据拆成了5个分片，所以对于搜索请求，会到所有的primary shard查询，或是它的某个replica shard。
hits.total：符合查询条件的数量，1个document。
hits.max_score：score是符合条件的document评分的最大值。
hits.hits.score: 这个层级的score表示当前document对search条件的相关度的匹配分数，越相关，就越匹配，分数也高。
hits.hits：包含了匹配搜索条件的document的详细数据。

搜索方式

query string search

搜索所有数据

GET /music/children/_search

带条件搜索

GET /music/children/_search?q=name:gymbo&sort=length:asc

此搜索语法的特点是所有的条件、排序全部用http请求的query string来附带的。这种语法一般是演示或curl命令行简单查询时使用，不适用构建复杂的查询条件，生产已经很少用了。

Query DSL

DSL：Domain Specified Language特定领域语言

http request body：请求体格式，body用json构建语法，可以构建各种复杂的语法。

查询所有数据

GET /music/children/_search
{
  "query":{
    "match_all": {}
  }
}

带条件+排序：

GET /music/children/_search
{
  "query":{
    "match": {
      "name": "gymbo"
    }
  },
  "sort":[{"length":"desc"}]
}

分页查询，size从0开始，下面的命令取第10条到第19条数据

GET /music/children/_search
{
  "query": {
    "match_all":{}
  },
  "from": 10,
  "size": 10
}

指定要查询出来的属性

GET /music/children/_search
{
  "query": {
    "match_all" : {}
  },
  "_source": ["name","content"]
}

query filter

带多个条件过滤：歌曲名称是gymbo，并且时长在65到80秒之间的

GET /music/children/_search
{
  "query":{
    "bool":{
      "must": [
        {"match": {
          "name": "gymbo"
        }}
      ],
      "filter": {"range": {
        "length": {
          "gte": 65,
          "lte": 80
        }
      }}
    }
  }
}

全文检索

GET /music/children/_search
{
  "query":{
    "match": {
      "content":"friend smile"
    }
  }
}

搜索的结果是按相关度分数来排序的，搜索条件中的content field，在新增document时已经建立倒排索引，然后按匹配度最高的来排序，全文索引的原理。

短语检索

GET /music/children/_search
{
  "query":{
    "match_phrase": {
      "content":"friend smile"
    }
  }
}

全文检索match会拆词，大小写不敏感，然后去倒排索引里去匹配，phrase search不分词，大小写敏感，要求搜索串完全一样才匹配。

高亮检索

GET /music/children/_search
{
  "query":{
    "match_phrase":{
      "content":"friend smile"
    }
  },
  "highlight": {
    "fields": {
      "content":{}
    }
  }
}

匹配的关键词会高亮显示，高亮的内容用<em>标签达到标记效果。

聚合分析

聚合分析类似于关系型数据的分组统计，并且用的语法名称很多都与mysql类似，在这里，能看到很多熟悉的方法。

单field分组统计

需求：统计每种语言下的歌曲数量。

size为0表示不显示符合条件的document记录，只显示统计信息，不写的话默认值是10

GET /music/children/_search
{
  "size": 0,
  "aggs": {
    "group_by_lang": {
      "terms": {
        "field": "language"
      }
    }
  }
}

响应结果：

{
  "took": 3,
  "timed_out": false,
  "_shards": {
    "total": 5,
    "successful": 5,
    "skipped": 0,
    "failed": 0
  },
  "hits": {
    "total": 1,
    "max_score": 0,
    "hits": []
  },
  "aggregations": {
    "group_by_lang": {
      "doc_count_error_upper_bound": 0,
      "sum_other_doc_count": 0,
      "buckets": [
        {
          "key": "english",
          "doc_count": 1
        }
      ]
    }
  }
}

如果聚合查询时出现如下错误提示：

"root_cause": [
      {
        "type": "illegal_argument_exception",
        "reason": "Fielddata is disabled on text fields by default. Set fielddata=true on [language] in order to load fielddata in memory by uninverting the inverted index. Note that this can however use significant memory. Alternatively use a keyword field instead."
      }
    ]

需要将用于分组的字段的fielddata属性设置为true

PUT /music/_mapping/children
{
  "properties": {
    "language": {
      "type": "text",
      "fielddata": true
    }
  }
}

带查询条件的分组统计

需求：对歌词中出现"friend"的歌曲，计算每个语种下的歌曲数量

GET /music/children/_search
{
  "size": 0,
  "query": {
    "match": {
      "content": "friend"
    }
  },
  "aggs": {
    "all_languages": {
      "terms": {
        "field": "language"
      }
    }
  }
}

求平均值

需求：计算每个语种下的歌曲，平均时长是多少

GET /music/children/_search
{
    "size": 0,
    "aggs": {
        "group_by_languages": {
            "terms": {
                "field": "language"
            },
            "aggs": {
                "avg_length": {
                    "avg": {
                        "field": "length"
                    }
                }
            }
        }
    }
}

分组后排序

需求：计算每个语种下的歌曲，平均时长是多少，并按平均时长降序排序

GET /music/children/_search
{
    "size": 0,
    "aggs": {
        "group_by_languages": {
            "terms": {
                "field": "language",
                "order": {
                  "avg_length": "desc"
                }
            },
            "aggs": {
                "avg_length": {
                    "avg": {
                        "field": "length"
                    }
                }
            }
        }
    }
}

嵌套查询，区间分组+分组统计+平均值

需求：按照指定的时长范围区间进行分组，然后在每组内再按照语种进行分组，最后再计算时长的平均值

GET /music/children/_search
{
  "size": 0,
  "aggs": {
    "group_by_price": {
      "range": {
        "field": "length",
        "ranges": [
          {
            "from": 0,
            "to": 60
          },
          {
            "from": 60,
            "to": 120
          },
          {
            "from": 120,
            "to": 180
          }
        ]
      },
      "aggs": {
        "group_by_languages": {
          "terms": {
            "field": "language"
          },
          "aggs": {
            "average_length": {
              "avg": {
                "field": "length"
              }
            }
          }
        }
      }
    }
  }
}

批量查询

上面的示例请求，都是单个单个发的，Elasticsearch还有一种语法，可以合并多个请求进行批量查询，这样可以减少每个请求单独的网络开销，最基础的语法示例如下:

GET /_mget
{
  "docs": [
    {
      "_index" : "music",
       "_type" : "children",
       "_id" :    1
    },
    {
      "_index" : "music",
       "_type" : "children",
       "_id" :    2
    }
  ]
}

mget下面的docs参数是一个数组，数组里面每个元素都可以定义一个文档的_index、_type和_id元数据，_index可相同也可不相同，也可以定义_source元数据指定想要的field。

响应的示例：

{
  "docs": [
    {
      "_index": "music",
      "_type": "children",
      "_id": "1",
      "_version": 4,
      "found": true,
      "_source": {
        "name": "gymbo",
        "content": "I hava a friend who loves smile, gymbo is his name",
        "language": "english",
        "length": "75",
        "likes": 0
      }
    },
    {
      "_index": "music",
      "_type": "children",
      "_id": "2",
      "_version": 13,
      "found": true,
      "_source": {
        "name": "wake me, shark me",
        "content": "don‘t let me sleep too late, gonna get up brightly early in the morning",
        "language": "english",
        "length": "55",
        "likes": 9
      }
    }
  ]
}

响应同样是一个docs数组，数组长度与请求时保持一致，如果有文档不存在、未搜索到或者别的原因导致报错，不影响整体的结果，mget的http响应码仍然是200，每个文档的搜索都是独立的。

如果批量查询的文档是在同一个index下面，可以将_index元数据(_type元数据我也顺便移走)移到请求行中：

GET /music/children/_mget
{
  "docs": [
    {
       "_id" :    1
    },
    {
       "_id" :    2
    }
  ]
}

或者是直接使用更简单的ids数组：

GET /music/children/_mget
{
  "ids":[1,2]
}

查询结果是一样的。

mget的重要性

mget是非常重要的，在进行查询的时候，如果一次性要查询多条数据，那么一定要用batch批量操作的api，尽可能减少网络开销次数，可能可以将性能提升数倍，甚至数十倍。

小结

本篇介绍了最常用的搜索、批量查询和聚合场景的写法，包含分组统计，平均值，排序，区间分组。这是最基本的套路，基本包含了我们常见的需求，熟悉mysql的话，掌握起来非常快，熟悉一下Restful的语法，基本就OK了。

专注Java高并发、分布式架构，更多技术干货分享与心得，请关注公众号：Java架构社区
可以扫左边二维码添加好友，邀请你加入Java架构社区微信群共同探讨技术

原文地址：https://blog.51cto.com/2123175/2482809

时间： 2024-07-30 14:46:44

Elasticsearch系列---常见搜索方式与聚合分析的相关文章

Elasticsearch系列---前缀搜索和模糊搜索

概要本篇我们介绍一下部分搜索的几种玩法,我们经常使用的浏览器搜索框,输入时会弹出下拉提示,也是基于局部搜索原理实现的. 前缀搜索我们在前面了解的搜索,词条是最小的匹配单位,也是倒排索引中存在的词,现在我们来聊聊部分匹配的话题,只匹配一个词条中的一部分内容,相当于mysql的"where content like '%love%'",在数据库里一眼就能发现这种查询是不走索引的,效率非常低. Elasticsearch对这种搜索有特殊的拆分处理,支持多种部分搜索格式,这次重点在于not

Elasticsearch学习笔记（三）聚合分析Agg

一.设置fielddata PUT /index/_mapping/type { "properties":{ "fieldName":{ "type":"text", "fielddata":true } } } 例如: PUT /ecommerce/_mapping/product { "pr

elasticsearch系列六：聚合分析（聚合分析简介、指标聚合、桶聚合）

一.聚合分析简介 1. ES聚合分析是什么? 聚合分析是数据库中重要的功能特性,完成对一个查询的数据集中数据的聚合计算,如:找出某字段(或计算表达式的结果)的最大值.最小值,计算和.平均值等.ES作为搜索引擎兼数据库,同样提供了强大的聚合分析能力. 对一个数据集求最大.最小.和.平均值等指标的聚合,在ES中称为指标聚合 metric 而关系型数据库中除了有聚合函数外,还可以对查询出的数据进行分组group by,再在组上进行指标聚合.在 ES 中group by 称为分桶,桶聚合 bucke

Elasticsearch 之聚合分析入门

本文主要介绍 Elasticsearch 的聚合功能,介绍什么是 Bucket 和 Metric 聚合,以及如何实现嵌套的聚合. 首先来看下聚合(Aggregation): 什么是 Aggregation? 首先举一个生活中的例子,这个是京东的搜索界面,在搜索框中输入"华为"进行搜索,就会得到如上界面,搜索框就是我们常用的搜索功能,而下面这些,比如分类.热点.操作系统.CPU 类型等是根据 ES 的聚合分析获得的相关结果. 看完上面这个例子,下面来看下聚合的定义: ES 除了搜索以外,

ElasticStack学习（八）：ElasticSearch索引模板与聚合分析初探

一.Index Template与Dynamic Template的概念 1.Index Template:它是用来根据提前设定的Mappings和Settings,并按照一定的规则,自动匹配到新创建的索引上. 1)模板仅是一个索引被创建时才会起作用,修改模板并不会影响已创建的索引: 2)可以设定多个索引模板,这些设置会被merge在一起: 3)通过指定order的数值,控制merge的过程: 2.Index Template的工作方式如下: 当一个索引被创建时,会执行如下操作: 1)应用Ela

Elasticsearch学习之深入聚合分析二---案例实战

以一个家电卖场中的电视销售数据为背景,来对各种品牌,各种颜色的电视的销量和销售额,进行各种各样角度的分析,首先建立电视销售的索引,然后添加几条销售记录 PUT /tvs { "mappings": { "sales": { "properties": { "price": { "type": "long" }, "color": { "type"

Elasticsearch学习之深入聚合分析三---案例实战

1. 统计指定品牌下每个颜色的销量任何的聚合,都必须在搜索出来的结果数据中进行,搜索结果,就是聚合分析操作的scope GET /tvs/sales/_search { "size": 0, "query": { "term": { "brand": { "value": "小米" } } }, "aggs": { "group_by_color"

ElasticSearch聚合分析

聚合用于分析查询结果集的统计指标,我们以观看日志分析为例,介绍各种常用的ElasticSearch聚合操作. 目录: 查询用户观看视频数和观看时长聚合分页器查询视频uv 单个视频uv 批量查询视频uv Having查询根据 count 进行过滤根据其它指标进行过滤首先展示一下我们要分析的文档结构: { "video_id": 1289643545120062253, // 视频id "video_uid": 3931482202390368051, //

Elasticsearch学习之深入聚合分析1--基本概念

首先明白两个核心概念:bucket和metric 1. bucket:一个数据分组 1 city name 2 3 北京小李 4 北京小王 5 上海小张 6 上海小丽 7 上海小陈基于city划分buckets,划分出来两个bucket,一个是北京bucket,一个是上海bucket 北京bucket:包含了2个人,小李,小王上海bucket:包含了3个人,小张,小丽,小陈按照某个字段进行bucket划分,那个字段的值相同的那些数据,就会被划分到一个bucket中,有一些mysql