基于 Apache Flink 与 Kafka 构建的实时数据处理流水线,支持高吞吐量的流式数据计算与可视化监控,是大数据课程的核心实战项目。
DataFlow Pipeline 是一个基于 Apache Flink + Kafka 的实时数据处理流水线平台。 用户可以通过 Vue 前端界面配置数据处理任务,系统将任务编排为 DAG 图形, 由 Flink 引擎执行流式计算,Kafka 作为消息中间件实现数据的高效流转。
平台支持多种数据源接入(MySQL、Redis、Kafka Topic),内置常用的数据清洗、 聚合、窗口计算等算子。后端采用 Java 开发,提供 RESTful API 供前端调用, 配合 Redis 缓存实现任务状态的实时查询。项目作为大数据课程的核心实践, 成功处理了日均百万级的模拟数据流。
流式计算 + 可视化监控的全栈大数据方案
核心 Flink 作业定义,实现 Kafka 数据流的实时处理