发布于2026-07-03 阅读(0)
扫一扫,手机访问
groupingBy + counting 的实战技巧在实际开发中,统计集合里某个元素出现的次数——比如计算用户列表中每个城市的人数,或者分析日志里某个关键词出现了多少次——几乎是绕不开的需求。Ja va 8 的 Stream 给了一个极其优雅的解法:Collectors.groupingBy 配合 Collectors.counting(),一行代码搞定,既简洁又清晰。下面就把这个组合的用法和常见坑点一次性说透。

来看一个最常见的场景——有一组单词,想快速知道每个词重复了多少次:
Listwords = Arrays.asList("apple", "banana", "apple", "cherry", "banana", "apple"); Map frequency = words.stream() .collect(Collectors.groupingBy(Function.identity(), Collectors.counting())); // 结果:{apple=3, banana=2, cherry=1}
这里有几个关键点值得注意:
Function.identity() 表示按元素自身分组,换句话说,就是以字符串本身作为 Map 的 key。Collectors.counting() 是个下游收集器,专门负责对每个分组内的元素计数,返回的是 Long 类型。Map,key 是原始元素,value 就是它出现的次数,一目了然。处理自定义对象时,只需要把分组依据从 Function.identity() 换成字段的方法引用即可:
record User(String name, String city) {}
List users = List.of(
new User("Alice", "Beijing"),
new User("Bob", "Shanghai"),
new User("Charlie", "Beijing"),
new User("Diana", "Guangzhou")
);
Map cityCount = users.stream()
.collect(Collectors.groupingBy(User::city, Collectors.counting()));
// 结果:{Beijing=2, Shanghai=1, Guangzhou=1}
逻辑和基础用法完全一样,只是把 Function.identity() 换成了 User::city。但有一个容易被忽略的细节:如果某个用户的 city 字段为 null,直接这样写会抛出 NullPointerException。稳妥的做法是提前过滤掉 null,或者用 Objects.toString(user.city, "unknown") 做一层兜底。
有时候我们只想统计满足特定条件的元素频次,比如只统计长度大于 4 的单词。简单粗暴的做法是在 groupingBy 之前先 filter 一把:
MaplongWordFreq = words.stream() .filter(word -> word.length() > 4) .collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));
但如果需要保留所有 key(包括那些不满足条件的元素,只是计数为 0),那就得用 Ja va 9+ 提供的 Collectors.filtering 配合下游收集器来实现了:
// Ja va 9+ 示例:只对满足条件的元素计数,但保留所有 key(未匹配的为 0) MapwithZero = words.stream() .collect(Collectors.groupingBy( Function.identity(), Collectors.collectingAndThen( Collectors.filtering(word -> word.length() > 4, Collectors.counting()), count -> count ) ));
不过话说回来,标准 counting() 本身是不知道什么条件的,必须配合 filtering 或者前置 filter 操作才能实现条件计数,这一点要记牢。
实际用到这个组合时,有几个坑值得提前预警:
Long,不是 Integer:counting() 内部用 long 累加,主要是防止溢出。如果业务上非要用 Integer,可以换成 Collectors.summingInt(e -> 1)。map.getOrDefault(key, 0L)。groupingByConcurrent 是线程安全的,但如果 key 本身是非线程安全的可变对象(比如你拿一个可变 List 做 key),那并发环境下仍然可能出问题。总结一下,groupingBy + counting 这个组合的核心思想就是“分组”和“下游聚合”的协作。理解透了,大部分重复度分析场景都能信手拈来。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8