商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何通过Collectors.groupingBy与counting结合实现变量重复度分析

如何通过Collectors.groupingBy与counting结合实现变量重复度分析

  发布于2026-07-03 阅读(0)

扫一扫,手机访问

用一行代码搞定重复度分析:groupingBy + counting 的实战技巧

在实际开发中,统计集合里某个元素出现的次数——比如计算用户列表中每个城市的人数,或者分析日志里某个关键词出现了多少次——几乎是绕不开的需求。Ja va 8 的 Stream 给了一个极其优雅的解法:Collectors.groupingBy 配合 Collectors.counting(),一行代码搞定,既简洁又清晰。下面就把这个组合的用法和常见坑点一次性说透。

如何通过Collectors.groupingBy与counting结合实现变量重复度分析

基础用法:统计字符串列表中每个单词的出现频次

来看一个最常见的场景——有一组单词,想快速知道每个词重复了多少次:

List words = Arrays.asList("apple", "banana", "apple", "cherry", "banana", "apple");
Map frequency = words.stream()
    .collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));
// 结果:{apple=3, banana=2, cherry=1}

这里有几个关键点值得注意:

  • Function.identity() 表示按元素自身分组,换句话说,就是以字符串本身作为 Map 的 key。
  • Collectors.counting() 是个下游收集器,专门负责对每个分组内的元素计数,返回的是 Long 类型。
  • 最终得到的 Map,key 是原始元素,value 就是它出现的次数,一目了然。

按对象字段分组计数:统计用户所属城市的人数

处理自定义对象时,只需要把分组依据从 Function.identity() 换成字段的方法引用即可:

record User(String name, String city) {}
List users = List.of(
    new User("Alice", "Beijing"),
    new User("Bob", "Shanghai"),
    new User("Charlie", "Beijing"),
    new User("Diana", "Guangzhou")
);
Map cityCount = users.stream()
    .collect(Collectors.groupingBy(User::city, Collectors.counting()));
// 结果:{Beijing=2, Shanghai=1, Guangzhou=1}

逻辑和基础用法完全一样,只是把 Function.identity() 换成了 User::city。但有一个容易被忽略的细节:如果某个用户的 city 字段为 null,直接这样写会抛出 NullPointerException。稳妥的做法是提前过滤掉 null,或者用 Objects.toString(user.city, "unknown") 做一层兜底。

进阶技巧:结合 filtering 或 mapping 做条件计数

有时候我们只想统计满足特定条件的元素频次,比如只统计长度大于 4 的单词。简单粗暴的做法是在 groupingBy 之前先 filter 一把:

Map longWordFreq = words.stream()
    .filter(word -> word.length() > 4)
    .collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));

但如果需要保留所有 key(包括那些不满足条件的元素,只是计数为 0),那就得用 Ja va 9+ 提供的 Collectors.filtering 配合下游收集器来实现了:

// Ja va 9+ 示例:只对满足条件的元素计数,但保留所有 key(未匹配的为 0)
Map withZero = words.stream()
    .collect(Collectors.groupingBy(
        Function.identity(),
        Collectors.collectingAndThen(
            Collectors.filtering(word -> word.length() > 4, Collectors.counting()),
            count -> count
        )
    ));

不过话说回来,标准 counting() 本身是不知道什么条件的,必须配合 filtering 或者前置 filter 操作才能实现条件计数,这一点要记牢。

常见问题与避坑提醒

实际用到这个组合时,有几个坑值得提前预警:

  • 返回类型是 Long,不是 Integercounting() 内部用 long 累加,主要是防止溢出。如果业务上非要用 Integer,可以换成 Collectors.summingInt(e -> 1)
  • 空集合返回空 Map:不会为不存在的 key 补 0。如果需要默认值,后续记得用 map.getOrDefault(key, 0L)
  • 并发流要小心:虽然 groupingByConcurrent 是线程安全的,但如果 key 本身是非线程安全的可变对象(比如你拿一个可变 List 做 key),那并发环境下仍然可能出问题。
  • 性能取舍:对于海量数据,Stream 分组比传统 for 循环略慢一些,但代码的可读性和维护性优势明显,一般业务场景完全够用,没必要过早优化。

总结一下,groupingBy + counting 这个组合的核心思想就是“分组”和“下游聚合”的协作。理解透了,大部分重复度分析场景都能信手拈来。

本文转载于:https://www.php.cn/faq/2458506.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注