Apache Fluss 孵化毕业成顶级项目,推动实时数据基础设施发展新跨越!
Apache Fluss 成功孵化毕业,开启实时数据新篇
今年 7 月,Apache Fluss 的毕业提案在 Apache 孵化器项目管理委员会(IPMC)投票中全票通过,随后获 Apache 软件基金会董事会批准。如今,Apache 软件基金会正式宣布 Apache Fluss 孵化毕业,成为 Apache 顶级项目(TLP)。这一里程碑标志着 Fluss 迈入新发展阶段,也将推动流式存储、实时湖仓与 AI 数据基础加速融合,为实时数据基础设施发展开启新的篇章。
Apache Fluss 成长历程回顾
Fluss 最早由阿里云 Flink 团队开发,旨在解决流存储在分析场景中长期存在的流批一体存储、Flink 计算成本以及链路复杂等问题,为实时分析构建面向湖仓时代的统一流式存储。其名字取自 Flink Unified Streaming Storage,在德语中意为 "河流",寓意数据像河流一样持续流动,并最终汇入开放的 Lakehouse。
经过一年多的阿里巴巴内部打磨和大规模生产实践,Fluss 于 2024 年 11 月在 Flink Forward Asia 2024 上海站正式宣布开源。2025 年 6 月,Fluss 进入 Apache 软件基金会孵化器,从阿里巴巴的技术探索成长为全球开发者共同建设的开源项目。
孵化期间,Fluss 社区的贡献者规模和项目关注度持续增长。目前,社区已汇聚 157 位贡献者,GitHub 收获 2,000 + Stars,合并的 Pull Request 数达 1700 多个,形成了活跃的开源社区。与此同时,Fluss 已在阿里巴巴、小红书、京东、蚂蚁集团、Fresha、爱奇艺等公司的生产环境中部署落地,广泛应用于日志采集与分析、实时数仓、搜索推荐、索引链路和实时特征服务等场景,帮助企业减少跨系统的数据复制,降低实时数据处理与存储成本,提升湖仓数据新鲜度和分析效率。
从 Lakehouse 到 Lakestream:湖流一体支撑 Agentic 时代
在 Agentic 时代,AI 从 Chatbot 走向 Agent,数据成为 Agent 判断与行动依赖的实时上下文。传统 Lakehouse 擅长沉淀和治理海量历史数据,但难以满足秒级乃至毫秒级的数据新鲜度要求。
作为 Lakestream 湖流一体架构的开源先驱,Apache Fluss 在数据湖之上构建湖仓原生的实时流存储层,将最新数据与长周期历史统一起来,为 AI Agent 提供新鲜而完整的上下文,支撑生产级的实时决策与行动。
Apache Fluss 通过以下核心能力,为传统 Lakehouse 增加实时流存储层,构建 Lakestream 湖流一体底座:
- Lakestream 湖流一体:长期历史数据保存在 Paimon、Iceberg、Hudi、Lance 等开放数据湖中,最新数据由 Fluss 实时承载;通过 Union Read,Agent 可以从统一表视图中访问从历史到最新的数据,避免上下文割裂。
- 高效列式流存储:流存储底层基于 Apache Arrow 列存实现,支持服务端列裁剪、条件下推、分区下推能力,以更少的数据读取和传输支撑高效流式分析与实时分析。
- 实时更新与低延迟查询:主键表原生支持流式更新、部分更新、Changelog、KV 查询和 Delta Join,让同一份实时数据同时服务流式计算与点查。
- 面向 Agent 的实时上下文:统一承载持续更新的实时状态与长周期历史数据,为 AI Agent 提供新鲜、完整、低延迟且可信的上下文,支撑实时决策与行动。
- 开放生态与多语言访问:可与 Apache Flink、Apache Spark、StarRocks 等计算引擎协同,并提供 Java、Rust、Python 和 C++ 客户端,方便实时分析与 AI 应用接入。
毕业寄语:多方期待与展望
在进入 Apache 软件基金会一年时间里,Fluss 建立了活跃的全球贡献者社区,获得众多领先企业和开源生态伙伴的广泛关注与支持。众多业内人士纷纷送上祝贺:
阿里云开源大数据负责人王峰表示,祝贺 Apache Fluss 正式毕业。其湖流一体架构打通数据流与数据湖,为 Lakehouse 注入实时数据能力,已在阿里巴巴核心电商场景大规模生产落地。期待 Fluss 携手全球社区,成为实时 Lakehouse 的开放数据底座。
ASF Member、Apache Fluss 孵化 Champion 及导师李钰称,衷心祝贺 Apache Fluss 社区毕业。孵化期间,Fluss 发布多个高质量版本,完善流式存储能力,营造开放社区氛围。祝愿其成长为世界级开源项目,推动相关技术发展。
Apache Fluss PMC Chair、项目发起人伍翀提到,Fluss 项目发展速度和影响力超出预期。毕业是新开始,相信它会成为 Lakehouse 架构的实时数据底座。
Ververica CTO Igor Kersic 表示,很高兴看到 Fluss 毕业成为顶级项目,它将开启流式领域的新进化,解锁更多商业价值,有望成为实时 AI 时代的标准。
LinkedIn Principal Staff Software Engineer Jiangjie Qin 祝贺 Fluss 毕业,认为其在数据基础设施生态中价值独特,成为顶级项目是水到渠成,祝愿其成为标杆项目。
Apache Paimon PMC Chair 李劲松称,Apache Fluss 为湖上带来秒级流动能力,做到了实时又统一,恭喜毕业。
小红书 Fluss & Kafka 负责人刘焓表示,小红书作为早期使用者和贡献者,见证了社区成长。Fluss 的能力在小红书核心场景发挥重要价值,期待社区持续繁荣。
Fresha VP of Architecture and Data Engineering Emiliano Mancuso 提到,Apache Fluss 在 Fresha 生产环境部署,其能力帮助简化数据移动,期待参与其后续发展。
淘宝闪购资深大数据专家王沛斌称,Fluss 重新定义实时数据基础设施范式,淘宝闪购通过它解决痛点,期待其在 AI ✖️ Data 时代释放更大价值。
京东零售实时数据平台负责人韩飞表示,京东积极参与 Fluss 技术实践与社区共建,期待其坚持开放创新,帮助企业释放数据价值。
Apache Member、蚂蚁集团实时智能负责人王鑫(多佛)提到,Fluss 成长为重要开源力量,蚂蚁积极推进其落地,期待它成为更坚实可信的基础设施。
毕业开启新旅程,持续深耕湖仓原生流式存储
成为 Apache 顶级项目后,Fluss 将继续深耕湖仓原生流式存储,为流处理提供高效、可复用的存储基础,让 Lakehouse 具备实时能力,为 AI 应用提供开放的数据底座。
感谢每一位贡献者、用户与伙伴,也感谢 Apache Fluss 孵化器导师的指导与支持。无论想将 Fluss 应用于实时分析与 AI 场景,还是了解更多信息、参与项目贡献,现在都是加入社区的好时机。项目官网为 https://fluss.apache.org/ ,GitHub 代码仓库为 https://github.com/apache/fluss ,贡献指南为 https://fluss.apache.org/community/how-to-contribute/overview/ 。
阿里云湖流一体解决方案助力
基于 OpenLake 理念,阿里云提供全托管的流存储 Fluss + DLF(Paimon)+ EMR StarRocks 的全模态、多引擎的湖流一体解决方案,打通实时数据流动、湖仓存储与高性能分析。DLF(Paimon)提供开放的全模态湖仓数据底座,流存储 Fluss 负责数据的实时流动,将湖仓数据新鲜度提升至秒级,EMR StarRocks 则提供低延迟的实时分析能力。三者协同,帮助企业构建开放、低延迟、高性能的 Agentic Lake。
实训与试用活动推荐
面对海量电商评论,Flink 实训教你实时对评论进行话题分类,自动打标评论中的关注点,实现高性能实时数据分析与处理。使用 Flink AI 参照教程完成实操,根据任务完成进度有机会获得 Flink 定制洗漱包、阿里云保温杯等奖品。
复制链接或扫描二维码,即可免费试用阿里云 Serverless Flink,体验新一代实时计算平台的强大能力。
