第三阶段 21 · terms 分组聚合 21 · terms 分组聚合阶段第三阶段 / 聚合能力EStermsagg | PostgreSQLGROUP BY col1. 概念terms聚合按某字段的值分桶bucket每个不同的值一个桶相当于 SQL 的GROUP BY。每个桶默认带doc_count该组文档数。2. PostgreSQL 对照-- 按 geo 分组统计数量和金额SELECTgeo_cd,COUNT(*)AScnt,SUM(net_amount)AStotalFROMsalesdataGROUPBYgeo_cdORDERBYtotalDESCLIMIT10;3. ES DSL基本分组GET salesdata_idx/_search { size: 0, aggs: { by_geo: { terms: { field: geo_cd, size: 10 } } } }返回每个geo_cd及其doc_count。分组 组内指标GROUP BY SUMterms里嵌一个子聚合就是GROUP BY后再算指标GET salesdata_idx/_search { size: 0, aggs: { by_geo: { terms: { field: geo_cd, size: 10, order: { total: desc } }, aggs: { total: { sum: { field: net_amount } } } } } }order: { total: desc }相当于ORDER BY SUM(net_amount) DESC。4. Spring Boot 实现ComponentpublicclassDoc21TermsAgg{AutowiredprivateElasticsearchClientelasticsearchClient;/** GROUP BY geo_cd, SUM(net_amount) */publicMapString,DoublesumByGeo(StringindexName,inttopN)throwsIOException{SearchResponseVoidrespelasticsearchClient.search(s-s.index(indexName).size(0).aggregations(by_geo,a-a.terms(t-t.field(geo_cd).size(topN).order(List.of(NamedValue.of(total,SortOrder.Desc)))).aggregations(total,sub-sub.sum(su-su.field(net_amount)))),Void.class);MapString,DoubleresultnewLinkedHashMap();for(StringTermsBucketbucket:resp.aggregations().get(by_geo).sterms().buckets().array()){Stringgeobucket.key().stringValue();doubletotalbucket.aggregations().get(total).sum().value();result.put(geo,total);}returnresult;}}读取要点字符串 terms 用.sterms()数值 terms 用.lterms()桶列表.buckets().array()桶 key 用bucket.key().stringValue()。importco.elastic.clients.elasticsearch._types.aggregations.StringTermsBucket、co.elastic.clients.util.NamedValue桶排序用order接收ListNamedValueSortOrder不是Map。5. 坑与最佳实践size默认只返回前 10 个桶要更多分组记得调大size但别无脑设很大。terms的计数是近似的分片场景分片多时doc_count可能有误差需要精确可加大shard_size或用 composite 聚合。高基数字段慎用对唯一值极多的字段如订单号分组会很吃内存考虑 composite 分页聚合。对keyword分组text字段分组要用field.keyword。组内排序 vs 组间排序order控制桶组之间的顺序别和文档排序混淆。下一篇22-date_histogram-时间分桶.md。