如何通过Collectors.groupingBy与counting结合实现变量重复度分析
利用Collectors.groupingBy与counting可一行实现集合元素重复度统计,支持按字段分组计数。注意返回类型为Long,空集合无默认值,且需特殊处理null值。结合filtering可实现条件计数,代码简洁高效,适用于常见业务场景,该方法在Java8中非常常用。
用一行代码搞定重复度分析:groupingBy + counting 的实战技巧
在实际开发中,统计集合里某个元素出现的次数——比如计算用户列表中每个城市的人数,或者分析日志里某个关键词出现了多少次——几乎是绕不开的需求。Ja va 8 的 Stream 给了一个极其优雅的解法:Collectors.groupingBy 配合 Collectors.counting(),一行代码搞定,既简洁又清晰。下面就把这个组合的用法和常见坑点一次性说透。

基础用法:统计字符串列表中每个单词的出现频次
来看一个最常见的场景——有一组单词,想快速知道每个词重复了多少次:
Listwords = Arrays.asList("apple", "banana", "apple", "cherry", "banana", "apple"); Map frequency = words.stream() .collect(Collectors.groupingBy(Function.identity(), Collectors.counting())); // 结果:{apple=3, banana=2, cherry=1}
这里有几个关键点值得注意:
Function.identity()表示按元素自身分组,换句话说,就是以字符串本身作为 Map 的 key。Collectors.counting()是个下游收集器,专门负责对每个分组内的元素计数,返回的是Long类型。- 最终得到的
Map,key 是原始元素,value 就是它出现的次数,一目了然。
按对象字段分组计数:统计用户所属城市的人数
处理自定义对象时,只需要把分组依据从 Function.identity() 换成字段的方法引用即可:
record User(String name, String city) {}
List users = List.of(
new User("Alice", "Beijing"),
new User("Bob", "Shanghai"),
new User("Charlie", "Beijing"),
new User("Diana", "Guangzhou")
);
Map cityCount = users.stream()
.collect(Collectors.groupingBy(User::city, Collectors.counting()));
// 结果:{Beijing=2, Shanghai=1, Guangzhou=1}
逻辑和基础用法完全一样,只是把 Function.identity() 换成了 User::city。但有一个容易被忽略的细节:如果某个用户的 city 字段为 null,直接这样写会抛出 NullPointerException。稳妥的做法是提前过滤掉 null,或者用 Objects.toString(user.city, "unknown") 做一层兜底。
进阶技巧:结合 filtering 或 mapping 做条件计数
有时候我们只想统计满足特定条件的元素频次,比如只统计长度大于 4 的单词。简单粗暴的做法是在 groupingBy 之前先 filter 一把:
MaplongWordFreq = words.stream() .filter(word -> word.length() > 4) .collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));
但如果需要保留所有 key(包括那些不满足条件的元素,只是计数为 0),那就得用 Ja va 9+ 提供的 Collectors.filtering 配合下游收集器来实现了:
// Ja va 9+ 示例:只对满足条件的元素计数,但保留所有 key(未匹配的为 0) MapwithZero = words.stream() .collect(Collectors.groupingBy( Function.identity(), Collectors.collectingAndThen( Collectors.filtering(word -> word.length() > 4, Collectors.counting()), count -> count ) ));
不过话说回来,标准 counting() 本身是不知道什么条件的,必须配合 filtering 或者前置 filter 操作才能实现条件计数,这一点要记牢。
常见问题与避坑提醒
实际用到这个组合时,有几个坑值得提前预警:
- 返回类型是
Long,不是Integer:counting()内部用long累加,主要是防止溢出。如果业务上非要用Integer,可以换成Collectors.summingInt(e -> 1)。 - 空集合返回空 Map:不会为不存在的 key 补 0。如果需要默认值,后续记得用
map.getOrDefault(key, 0L)。 - 并发流要小心:虽然
groupingByConcurrent是线程安全的,但如果 key 本身是非线程安全的可变对象(比如你拿一个可变 List 做 key),那并发环境下仍然可能出问题。 - 性能取舍:对于海量数据,Stream 分组比传统 for 循环略慢一些,但代码的可读性和维护性优势明显,一般业务场景完全够用,没必要过早优化。
总结一下,groupingBy + counting 这个组合的核心思想就是“分组”和“下游聚合”的协作。理解透了,大部分重复度分析场景都能信手拈来。


































