当前位置:

首页 > 编程开发 > 自定义Flink KafkaSource读取键值对数据

自定义Flink KafkaSource读取键值对数据

本文详细阐述了如何在ApacheFlink中使用KafkaSource读取包含键(Key)的Kafka记录。通过实现自定义的KafkaRecordDeserializationSchema,用户可以完全访问ConsumerRecord对象,从而灵活地提取并处理记录的键、值、时间戳、分区、偏移量及其他元数据,克服了默认valueOnly反序列化器仅能获取记录值的局限性。

在Apache Flink中定制KafkaSource以读取键值对记录

本文详细阐述了如何在 Apache Flink 中使用 `KafkaSource` 读取包含键(Key)的 Kafka 记录。通过实现自定义的 `KafkaRecordDeserializationSchema`,用户可以完全访问 `ConsumerRecord` 对象,从而灵活地提取并处理记录的键、值、时间戳、分区、偏移量及其他元数据,克服了默认 `valueOnly` 反序列化器仅能获取记录值的局限性。

理解默认 valueOnly 反序列化器的局限性

在使用 Apache Flink 的 KafkaSource 从 Kafka 读取数据时,常见的做法是利用内置的 KafkaRecordDeserializationSchema.valueOnly(StringDeserializer.class) 来反序列化记录。这种方法简单便捷,但它仅将 Kafka 记录的值部分反序列化为指定类型(例如 String),而忽略了记录的键、时间戳、分区、偏移量以及任何附加的头部信息。

对于生产者以键值对形式发送的 Kafka 记录,例如通过 kafka-console-producer.sh --property "parse.key=true" --property "key.separator=:" 生产的数据,如果仅使用 valueOnly 反序列化器,我们将无法在 Flink 应用程序中获取到这些关键的键信息,也无法访问记录的时间戳等其他元数据。

解决方案:实现自定义 KafkaRecordDeserializationSchema

要解决上述局限性,核心在于实现一个自定义的 KafkaRecordDeserializationSchema。这个接口允许我们完全控制 Kafka ConsumerRecord 的反序列化过程。在 deserialize 方法中,我们可以直接访问到原始的 ConsumerRecord 对象,进而提取其键、值、时间戳等所有可用信息,并将其封装成 Flink 应用程序所需的任何自定义类型。

1. 定义一个用于承载记录信息的POJO

首先,我们定义一个简单的 Java POJO(Plain Old Java Object)来封装从 Kafka ConsumerRecord 中提取出的所有相关信息。这个POJO将作为自定义反序列化器的输出类型。

import java.io.Serializable;

public class KafkaRecordInfo implements Serializable {
    public String key;
    public String value;
    public Long timestamp;
    public String topic;
    public int partition;
    public long offset;

    // Flink 需要一个无参构造函数来进行序列化和反序列化
    public KafkaRecordInfo() {}

    public KafkaRecordInfo(String key, String value, Long timestamp, String topic, int partition, long offset) {
        this.key = key;
        this.value = value;
        this.timestamp = timestamp;
        this.topic = topic;
        this.partition = partition;
        this.offset = offset;
    }

    @Override
    public String toString() {
        return "KafkaRecordInfo{" +
               "key='" + key + '\'' +
               ", value='" + value + '\'' +
               ", timestamp=" + timestamp +
               ", topic='" + topic + '\'' +
               ", partition=" + partition +
               ", offset=" + offset +
               '}';
    }
}

2. 实现自定义 KafkaRecordDeserializationSchema

接下来,创建 KafkaRecordDeserializationSchema 的实现。在这个实现中,我们将重写 deserialize 方法来解析 ConsumerRecord,并重写 getProducedType 方法来声明输出类型。

import org.apache.flink.api.common.typeinfo.TypeInformation;
import org.apache.flink.connector.kafka.source.reader.deserializer.KafkaRecordDeserializationSchema;
import org.apache.flink.util.Collector;
import org.apache.kafka.clients.consumer.ConsumerRecord;

import java.nio.charset.StandardCharsets;

public class CustomKafkaRecordDeserializationSchema implements KafkaRecordDeserializationSchema {

    private static final long serialVersionUID = 1L; // 确保可序列化

    @Override
    public void deserialize(ConsumerRecord record, Collector out) throws Exception {
        // 提取键,如果键存在则转换为字符串,否则为null
        String key = (record.key() != null) ? new String(record.key(), StandardCharsets.UTF_8) : null;
        // 提取值,如果值存在则转换为字符串,否则为null
        String value = (record.value() != null) ? new String(record.value(), StandardCharsets.UTF_8) : null;
        // 提取时间戳
        Long timestamp = record.timestamp();
        // 提取主题
        String topic = record.topic();
        // 提取分区
        int partition = record.partition();
        // 提取偏移量
        long offset = record.offset();

        // 将提取的信息封装到 KafkaRecordInfo 对象中并发出
        out.collect(new KafkaRecordInfo(key, value, timestamp, topic, partition, offset));
    }

    @Override
    public TypeInformation getProducedType() {
        // 声明此反序列化器将生成 KafkaRecordInfo 类型的对象
        return TypeInformation.of(KafkaRecordInfo.class);
    }
}

3. 将自定义反序列化器集成到 KafkaSource

最后,将这个自定义的 CustomKafkaRecordDeserializationSchema 实例传递给 KafkaSource.builder().setDeserializer() 方法。

import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.streaming.api.datastream.DataStream;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.connector.kafka.source.KafkaSource;
import org.apache.flink.connector.kafka.source.enumerator.initializer.OffsetsInitializer;

public class FlinkKafkaKeyedRecordReader {

    public static void main(String[] args) throws Exception {
        // 设置 Flink 执行环境
        StreamExecutionEnvironment env = StreamExecutionEnvironment.getExecutionEnvironment();
        env.setParallelism(1); // 示例设置为单并行度

        String bootstrapServers = "localhost:9092"; // Kafka 集群地址
        String topic = "test3"; // 你的 Kafka 主题
        String groupId = "flink-consumer-group"; // 消费者组ID

        // 构建 KafkaSource,使用自定义的反序列化器
        KafkaSource source = KafkaSource.builder()
                .setBootstrapServers(bootstrapServers)
                .setTopics(topic)
                .setGroupId(groupId)
                .setStartingOffsets(OffsetsInitializer.earliest()) // 从最早的偏移量开始消费
                .setDeserializer(new CustomKafkaRecordDeserializationSchema()) // 使用自定义反序列化器
                .build();

        // 从 KafkaSource 创建数据流
        DataStream stream = env.fromSource(source, WatermarkStrategy.noWatermarks(), "Kafka Keyed Source");

        // 对接收到的数据进行处理和打印
        stream.map(recordInfo -> "Received from Kafka: Key=" + recordInfo.key +
                                 ", Value=" + recordInfo.value +
                                 ", Timestamp=" + recordInfo.timestamp +
                                 ", Topic=" + recordInfo.topic +
                                 ", Partition=" + recordInfo.partition +
                                 ", Offset=" + recordInfo.offset)
              .print();

        // 执行 Flink 作业
        env.execute("Flink Kafka Keyed Record Reader");
    }
}

运行示例

  1. 启动 Kafka 和 Flink: 确保 Kafka 集群正在运行,并且 Flink 环境已准备就绪。
  2. 生产带键的 Kafka 消息: 使用 Kafka 控制台生产者发送带键的消息到 test3 主题:
    bin/kafka-console-producer.sh --topic test3 --property "parse.key=true" --property "key.separator=:" --bootstrap-server localhost:9092

    输入消息,例如:

    key1:valueA
    key2:valueB
    anotherKey:anotherValue
  3. 运行 Flink 应用程序: 编译并运行上述 FlinkKafkaKeyedRecordReader Flink 应用程序。你将在 Flink 任务管理器的日志中看到类似以下的输出:
    Received from Kafka: Key=key1, Value=valueA, Timestamp=1678886400000, Topic=test3, Partition=0, Offset=0
    Received from Kafka: Key=key2, Value=valueB, Timestamp=1678886401000, Topic=test3, Partition=0, Offset=1
    Received from Kafka: Key=anotherKey, Value=anotherValue, Timestamp=1678886402000, Topic=test3, Partition=0, Offset=2

    这表明 Flink 成功地读取并解析了 Kafka 记录的键、值和时间戳等信息。

注意事项与扩展

  • 错误处理: 在 deserialize 方法中,如果 byte[] 无法正确转换为 String(例如,编码不一致),可能会抛出异常。在实际生产环境中,应加入健壮的错误处理逻辑,例如使用 try-catch 块,将解析失败的记录发送到死信队列,或者记录错误日志。
  • 数据类型转换: 示例中将键和值都转换为 String。如果 Kafka 记录的键或值是其他数据类型(例如 Avro、Protobuf、JSON),你需要在 deserialize 方法中引入相应的反序列化库和逻辑来解析 byte[]。
  • 访问头部信息: ConsumerRecord 还提供了 headers() 方法来访问 Kafka 记录的头部信息。如果你的生产者在记录中添加了自定义头部,你也可以在 deserialize 方法中提取并处理它们。
  • 性能考量: 自定义反序列化器会增加一些处理开销,但对于需要访问键或其他元数据的场景来说是必要的。对于高性能要求极高的场景,应确保反序列化逻辑尽可能高效。
  • Flink 版本兼容性: 本教程基于 Flink 1.15+ 版本,使用了 KafkaSource API。如果你使用的是较旧的 Flink 版本(如 Flink 1.11 或更早),可能需要使用 FlinkKafkaConsumer,其配置方式略有不同,但核心思想(实现 DeserializationSchema)是相同的。

总结

通过实现自定义的 KafkaRecordDeserializationSchema,Apache Flink 能够灵活且全面地处理来自 Kafka 的复杂记录结构,包括带键的记录、时间戳以及其他重要的元数据。这种方法为构建功能强大、数据解析精细的 Flink 流处理应用程序提供了坚实的基础。理解并掌握自定义反序列化机制是开发高级 Flink-Kafka 集成应用的关键一步。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
C++动态数组初始化怎么写?常用语句与代码示例
C++动态数组初始化怎么写?常用语句与代码示例

深入解析C++中动态数组的初始化机制,涵盖new操作符的不同用法、基本类型与类对象的初始化差异,以及为何在现代C++开发中应优先使用std::vector。

using namespace 使用中遇到的问题怎么解决
using namespace 使用中遇到的问题怎么解决

命名空间的基本概念与常见引入问题在C++等编程语言中,命名空间(namespace)是一种将代码标识符(如变量、函数、类名)封装在特定名称下的机制,其主要目的是避免命名冲突,尤其是在大型项目或使用多个第三方库时。使用“using namespace”指令可以将指定命名空间中的所有名称引入当前作用域,

c语言函数递归 实操经验总结:这些技巧很实用
c语言函数递归 实操经验总结:这些技巧很实用

理解递归的基本原理在C语言中,递归是一种函数调用自身的编程技术。要掌握它,首先需要理解其核心思想:将一个复杂的大问题,分解为一个或几个与原问题相似但规模更小的子问题,直到子问题足够简单,可以直接求解。这个过程通常包含两个关键部分:递归出口和递归体。递归出口定义了问题何时不再继续分解,即最简单、可直接

c语言函数递归 怎么选?常见方案对比分析
c语言函数递归 怎么选?常见方案对比分析

递归函数的基本概念与适用场景在C语言编程中,递归是一种函数调用自身的编程技巧。它并非适用于所有问题,但在处理某些具有自相似结构的问题时,能提供极其清晰和优雅的解决方案。递归的核心思想是将一个大规模问题分解为一个或多个同类型但规模更小的子问题,直到子问题简单到可以直接求解。典型的适用场景包括树形结构的

Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解
Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解

理解内存管理的基石在Objective-C的编程世界中,内存管理是开发者必须掌握的核心技能之一。它直接关系到应用的性能、稳定性与资源利用效率。与一些采用自动垃圾回收机制的语言不同,Objective-C在很长一段时间里,依赖一套基于引用计数的、需要开发者部分介入的管理规则。这套规则的核心思想是明确的

如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏
如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏

理解 dealloc 的角色与时机在 iOS 应用开发中,内存管理是保障应用性能与稳定性的基石。dealloc 方法是 Objective-C 中对象生命周期结束时的关键回调,它标志着对象即将被系统回收内存。正确理解其触发时机至关重要:当一个对象的引用计数降为零时,运行时系统会自动调用该对象的 de

深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制
深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制

内存管理的基石在Objective-C的世界里,内存管理是开发者必须掌握的核心技能之一。作为一门在手动引用计数(MRC)时代诞生的语言,Objective-C要求程序员对对象的生命周期有清晰的认识。dealloc方法正是这一生命周期中至关重要的终点站。它是一个实例方法,当对象的引用计数降为零时,系统

理解 native2ascii:Java 国际化开发中的字符编码工具
理解 native2ascii:Java 国际化开发中的字符编码工具

native2ascii 工具的基本定位在Ja va应用程序的国际化与本地化开发过程中,处理非拉丁字符集是一个常见且关键的环节。Ja va内部使用Unicode字符集来统一表示全球各种语言的文字,但其属性文件(.properties)在历史上要求使用ASCII编码,或者更准确地说,要求非ASCII字

如何使用 native2ascii 转换中文字符为 Unicode 转义序列
如何使用 native2ascii 转换中文字符为 Unicode 转义序列

理解 native2ascii 工具的基本用途在软件开发,特别是涉及国际化处理的场景中,开发者常常需要处理不同编码的文本资源。native2ascii 是 Ja va 开发工具包(JDK)中提供的一个命令行实用程序,其主要功能是将包含本地字符编码(非ASCII字符)的文件,转换为包含 Unicode

Java native2ascii 命令详解:解决属性文件乱码问题
Java native2ascii 命令详解:解决属性文件乱码问题

native2ascii 命令的由来与作用在Ja va开发中,处理国际化资源文件是一个常见需求。资源文件通常以.properties格式存储,用于支持多语言界面。然而,Ja va属性文件默认采用ISO-8859-1字符集编码,这导致了一个直接的问题:当文件中包含非拉丁字符(如中文、日文、韩文等)时,

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。