当前位置:

首页 > 编程开发 > ElasticSearch使用CompositeAggregation实现桶的分页查询功能

ElasticSearch使用CompositeAggregation实现桶的分页查询功能

本文目录

    ElasticSearch的CompositeAggregation利用游标机制和after参数实现桶的批量分页查询,通过指定每页桶数并传递上一页的after_key逐步获取后续数据,避免了传统偏移量分页的性能问题,适用于海量数据分组后的高效分页。

    官方文档

    https://www.elastic.co/guide/en/elasticsearch/reference/current/search-aggregations-bucket-composite-aggregation.html#_pagination

    ElasticSearch使用CompositeAggregation实现桶的分页查询功能

    概述

    先聊点实在的:当我们需要分页查询大量桶(bucket)的时候,composite 聚合是当前最优雅的解法。它允许我们通过分页的方式,逐步把桶结果“挤”出来,而不是一口气把所有数据全部砸给你——这在数据量大的场景下简直是救命稻草。

    注意,它和传统分页的思路完全不同。传统玩法依赖偏移量(offset)来控制页码,而 composite aggregation 使用的是游标机制。简单说,它不跟你纠结“从第几条开始”,而是直接告诉你“从上一个桶之后接着拿”。这就从根本上绕过了经典分页的性能瓶颈,越往后翻数据效率越稳。

    Composite Aggregation 概览

    说白了,composite aggregation 是 ES 专门为分页展示聚合结果设计的一种玩法。你去翻翻看,传统的聚合方式大多是一次性返回所有数据,但 composite 不一样——它通过 after 参数来标注“分页锚点”,而不是依赖 from 和 size 来硬算偏移量。这种基于游标的分页模型,在处理大量数据时优势非常明显。

    实战:基本的分页查询

    假设你有一个索引叫 your_index_name,里面每篇文档都有一个字段 your_field_name。现在你要按这个字段分组,并且每次只取 10 个聚合结果来看。看看下面这个基础查询:

    GET /your_index_name/_search{  "size": 0,  "aggs": {    "my_composite_agg": {      "composite": {        "size": 10,         "sources": [          {            "my_terms_agg": {              "terms": {                "field": "your_field_name"              }            }          }        ]      }    }  }}

    几个要点值得细说一下:

    • size: 0:我们只关心聚合结果,不想要原始文档内容。这能省下不少传输开销。
    • composite 聚合:这是分页的关键构造,它会按你指定的聚合规则返回一个分页桶结果集。
    • size: 10:控制每页返回多少桶,相当于传统分页里的“每页条数”。
    • sources:定义分组逻辑的地方。上面这个例子就是用 terms 按字段值分组。

    翻页:获取下一页

    分页的核心在于,你得告诉 ES:“我已经看到这个位置了,接下来从这儿往后翻。” 这个“位置”就是上一页返回的最后一个桶的 key 值,用法是通过 after 参数传进去。

    来看第二页怎么查:

    GET /your_index_name/_search{  "size": 0,  "aggs": {    "my_composite_agg": {      "composite": {        "size": 10,        "after": ["bucket_key_from_first_page"],          "sources": [          {            "my_terms_agg": {              "terms": {                "field": "your_field_name"              }            }          }        ]      }    }  }}

    这个小细节很关键:

    • after 参数的值就是上一页返回结果中的 after_key。你可以在查询响应的聚合信息里直接找到它。

    举个例子,假设第一次查询的返回结果长这样:

    {  "aggregations": {    "my_composite_agg": {      "buckets": [        {          "key": { "your_field_name": "value1" },          "doc_count": 10        },        {          "key": { "your_field_name": "value2" },          "doc_count": 15        }      ],      "after_key": { "your_field_name": "value2" }    }  }}

    那么第二页查询时,你就把 after 设为 { "your_field_name": "value2" },ES 就知道从这儿接着往下查了。

    官方案例

    GET /_search{  "size": 0,  "aggs": {    "my_buckets": {      "composite": {        "size": 2,        "sources": [          { "date": { "date_histogram": { "field": "timestamp", "calendar_interval": "1d" } } },          { "product": { "terms": { "field": "product" } } }        ]      }    }  }}

    返回结果:

    {  "aggregations": {    "my_buckets": {      "after_key": {        "date": 1494288000000,        "product": "mad max"      },      "buckets": [        {          "key": {            "date": 1494201600000,            "product": "rocky"          },          "doc_count": 1        },        {          "key": {            "date": 1494288000000,            "product": "mad max"          },          "doc_count": 2        }      ]    }  }}

    下次查询直接带着 after 走起:

    GET /_search{  "size": 0,  "aggs": {    "my_buckets": {      "composite": {        "size": 2,        "sources": [          { "date": { "date_histogram": { "field": "timestamp", "calendar_interval": "1d", "order": "desc" } } },          { "product": { "terms": { "field": "product", "order": "asc" } } }        ],        "after": { "date": 1494288000000, "product": "mad max" }       }    }  }}

    什么场景最适用?

    说白了,composite aggregation 的强项就是解决下面这几类痛点:

    • 海量数据分页:桶的数量越多,传统偏移量方案越吃力。用 composite 可以彻底绕开这类性能陷阱。
    • 按字段分组后的分页展示:如果你的场景是先分组、再翻页,那它就是最趁手的工具。
    • 防止数据丢或重:传统分页如果遇上数据变动,容易导致翻页时出现数据丢失或重复。而 composite aggregation 的游标机制天然免疫这类问题。

    几点需要特别注意

    • after 参数的类型必须和 sources 中定义的字段类型保持一致。字符串字段就传字符串,数值字段就传数值,类型对不上可是会报错的。
    • 分页顺序依赖于聚合字段的排序规则。如果数据分布不够均匀,每一页返回的桶数可能会略有波动,这点在初始化设计时需要心里有数。
    • 虽然 size 可以控制每页桶数,但 composite aggregation 单次最多只能返回 10,000 个桶。如果你覆盖的数据范围超出了这个上限,就需要考虑数据分片或其他优化策略了。

    篇幅有限,我们就说到这儿。记住一点:掌握好 composite aggregation,你就能轻松应对大规模桶数据的高效分页查询。

    本文内容来源于网友投稿,如有侵权请联系删除。
    作者最新文章
    编程开发
    相关文章 更多
    解决PHP递归报错:max_nesting_level限制与内存溢出处理
    解决PHP递归报错:max_nesting_level限制与内存溢出处理

    遇到PHP递归报错时,不要盲目调大max_nesting_level。本文教你区分Xdebug限制、内存耗尽和正则递归错误,提供代码级的终止条件优化与迭代替代方案,彻底解决栈溢出问题。

    PHP递归中static变量与引用传递的常见陷阱及调试
    PHP递归中static变量与引用传递的常见陷阱及调试

    本文分析PHP递归中static变量导致的状态污染及引用传递引发的共享数据修改问题。提供具体的代码复现、缓存键设计建议及调试打印技巧,帮助开发者避免隐蔽的逻辑错误。

    PHP递归性能优化技巧与迭代替代方案
    PHP递归性能优化技巧与迭代替代方案

    解析PHP递归函数在树形数据处理中的性能瓶颈,提供预加载数据消除I/O、使用显式栈替代深层递归的实战方案,帮助开发者在代码可读性与执行效率间做出合理取舍。

    Java测试中怎么使用Mockito模拟依赖对象
    Java测试中怎么使用Mockito模拟依赖对象

    详细讲解在Java单元测试中如何使用Mockito模拟依赖对象,包括引入依赖、创建Mock、打桩返回值、行为验证以及Mock与Spy的核心差异和常见陷阱排查。

    链表删除节点的时间复杂度是多少及其详细分析
    链表删除节点的时间复杂度是多少及其详细分析

    详细分析链表删除节点的时间复杂度,深入探讨单链表与双向链表在不同已知前提下的查找与删除开销,并结合完整代码与清晰图解进行对比总结。

    codex如何配置模型参数及文件设置教程
    codex如何配置模型参数及文件设置教程

    想知道如何让AI写出的代码更贴合你的习惯?本文手把手教你在VS Code中调整Codex相关模型参数,通过修改配置文件优化温度值和令牌限制,解决代码建议不准确或响应慢的问题。

    Claude Code AI编程工具实力揭秘与编程助手实测
    Claude Code AI编程工具实力揭秘与编程助手实测

    通过实测展示Claude Code在终端中如何理解自然语言指令、自动修改代码文件并处理复杂编程任务,帮助开发者评估其实际辅助能力。

    winforms教程自学入门与基础开发步骤详解
    winforms教程自学入门与基础开发步骤详解

    本教程详细讲解如何使用Visual Studio创建WinForms项目,通过添加按钮和标签控件并编写点击事件代码,实现一个基础的计数器功能,适合C#初学者快速上手Windows窗体应用开发。

    Cursor自动补全设置教程教你快速开启代码补全功能
    Cursor自动补全设置教程教你快速开启代码补全功能

    详解Cursor编辑器中自动补全功能的开启与优化设置,涵盖Tab触发机制、上下文窗口调整及模型切换,帮助开发者解决补全延迟、干扰大等问题,提升编码流畅度。

    pandas的数据格式怎么转换和设置方法教程
    pandas的数据格式怎么转换和设置方法教程

    详解Pandas中数据格式转换的核心方法,包括astype强制转换、to_numeric容错处理及日期解析技巧,解决常见类型错误并提升数据处理效率。

    查看更多
    精品专题 更多
    装机必备
    装机必备

    正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

    Windows
    Windows

    正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

    macOS软件
    macOS软件

    正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

    Mac软件 更多
    photoshop
    photoshop
    Windows、macOS 、 iPad

    Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

    灵活计算器
    灵活计算器
    macOS/iOS/Android

    灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

    WINDOWS 更多
    3dmax(3ds max)
    3dmax(3ds max)
    Windows

    Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

    photoshop
    photoshop
    Windows、macOS 、 iPad

    Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。