展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > ElasticSearch使用CompositeAggregation实现桶的分页查询功能

ElasticSearch使用CompositeAggregation实现桶的分页查询功能

ElasticSearch的CompositeAggregation利用游标机制和after参数实现桶的批量分页查询,通过指定每页桶数并传递上一页的after_key逐步获取后续数据,避免了传统偏移量分页的性能问题,适用于海量数据分组后的高效分页。

官方文档

https://www.elastic.co/guide/en/elasticsearch/reference/current/search-aggregations-bucket-composite-aggregation.html#_pagination

ElasticSearch使用CompositeAggregation实现桶的分页查询功能

概述

先聊点实在的:当我们需要分页查询大量桶(bucket)的时候,composite 聚合是当前最优雅的解法。它允许我们通过分页的方式,逐步把桶结果“挤”出来,而不是一口气把所有数据全部砸给你——这在数据量大的场景下简直是救命稻草。

注意,它和传统分页的思路完全不同。传统玩法依赖偏移量(offset)来控制页码,而 composite aggregation 使用的是游标机制。简单说,它不跟你纠结“从第几条开始”,而是直接告诉你“从上一个桶之后接着拿”。这就从根本上绕过了经典分页的性能瓶颈,越往后翻数据效率越稳。

Composite Aggregation 概览

说白了,composite aggregation 是 ES 专门为分页展示聚合结果设计的一种玩法。你去翻翻看,传统的聚合方式大多是一次性返回所有数据,但 composite 不一样——它通过 after 参数来标注“分页锚点”,而不是依赖 from 和 size 来硬算偏移量。这种基于游标的分页模型,在处理大量数据时优势非常明显。

实战:基本的分页查询

假设你有一个索引叫 your_index_name,里面每篇文档都有一个字段 your_field_name。现在你要按这个字段分组,并且每次只取 10 个聚合结果来看。看看下面这个基础查询:

GET /your_index_name/_search{  "size": 0,  "aggs": {    "my_composite_agg": {      "composite": {        "size": 10,         "sources": [          {            "my_terms_agg": {              "terms": {                "field": "your_field_name"              }            }          }        ]      }    }  }}

几个要点值得细说一下:

  • size: 0:我们只关心聚合结果,不想要原始文档内容。这能省下不少传输开销。
  • composite 聚合:这是分页的关键构造,它会按你指定的聚合规则返回一个分页桶结果集。
  • size: 10:控制每页返回多少桶,相当于传统分页里的“每页条数”。
  • sources:定义分组逻辑的地方。上面这个例子就是用 terms 按字段值分组。

翻页:获取下一页

分页的核心在于,你得告诉 ES:“我已经看到这个位置了,接下来从这儿往后翻。” 这个“位置”就是上一页返回的最后一个桶的 key 值,用法是通过 after 参数传进去。

来看第二页怎么查:

GET /your_index_name/_search{  "size": 0,  "aggs": {    "my_composite_agg": {      "composite": {        "size": 10,        "after": ["bucket_key_from_first_page"],          "sources": [          {            "my_terms_agg": {              "terms": {                "field": "your_field_name"              }            }          }        ]      }    }  }}

这个小细节很关键:

  • after 参数的值就是上一页返回结果中的 after_key。你可以在查询响应的聚合信息里直接找到它。

举个例子,假设第一次查询的返回结果长这样:

{  "aggregations": {    "my_composite_agg": {      "buckets": [        {          "key": { "your_field_name": "value1" },          "doc_count": 10        },        {          "key": { "your_field_name": "value2" },          "doc_count": 15        }      ],      "after_key": { "your_field_name": "value2" }    }  }}

那么第二页查询时,你就把 after 设为 { "your_field_name": "value2" },ES 就知道从这儿接着往下查了。

官方案例

GET /_search{  "size": 0,  "aggs": {    "my_buckets": {      "composite": {        "size": 2,        "sources": [          { "date": { "date_histogram": { "field": "timestamp", "calendar_interval": "1d" } } },          { "product": { "terms": { "field": "product" } } }        ]      }    }  }}

返回结果:

{  "aggregations": {    "my_buckets": {      "after_key": {        "date": 1494288000000,        "product": "mad max"      },      "buckets": [        {          "key": {            "date": 1494201600000,            "product": "rocky"          },          "doc_count": 1        },        {          "key": {            "date": 1494288000000,            "product": "mad max"          },          "doc_count": 2        }      ]    }  }}

下次查询直接带着 after 走起:

GET /_search{  "size": 0,  "aggs": {    "my_buckets": {      "composite": {        "size": 2,        "sources": [          { "date": { "date_histogram": { "field": "timestamp", "calendar_interval": "1d", "order": "desc" } } },          { "product": { "terms": { "field": "product", "order": "asc" } } }        ],        "after": { "date": 1494288000000, "product": "mad max" }       }    }  }}

什么场景最适用?

说白了,composite aggregation 的强项就是解决下面这几类痛点:

  • 海量数据分页:桶的数量越多,传统偏移量方案越吃力。用 composite 可以彻底绕开这类性能陷阱。
  • 按字段分组后的分页展示:如果你的场景是先分组、再翻页,那它就是最趁手的工具。
  • 防止数据丢或重:传统分页如果遇上数据变动,容易导致翻页时出现数据丢失或重复。而 composite aggregation 的游标机制天然免疫这类问题。

几点需要特别注意

  • after 参数的类型必须和 sources 中定义的字段类型保持一致。字符串字段就传字符串,数值字段就传数值,类型对不上可是会报错的。
  • 分页顺序依赖于聚合字段的排序规则。如果数据分布不够均匀,每一页返回的桶数可能会略有波动,这点在初始化设计时需要心里有数。
  • 虽然 size 可以控制每页桶数,但 composite aggregation 单次最多只能返回 10,000 个桶。如果你覆盖的数据范围超出了这个上限,就需要考虑数据分片或其他优化策略了。

篇幅有限,我们就说到这儿。记住一点:掌握好 composite aggregation,你就能轻松应对大规模桶数据的高效分页查询。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。