Apache Beam 2.27.0 发布,大数据流处理与批处理编程范式
2021年1月10日 | by tgcode
Apache Beam 2.27.0 发布了。Beam 是一个用于定义和执行数据处理管道的统一编程模型,包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义,并不涉及具体执行引擎的实现,理想情况是基于 Beam 开发的数据处理程序可以执行在任意的分布式计算引擎上。
此版本主要更新内容如下:
Highlights
-
Java 11 Containers现已随所有 Beam 版本一起发布。
- 有一个新的转换
ReadAllFromBigQuery
,可以在管道运行时接收多个从 BigQuery 读取数据的请求。参见PR 13170和BEAM-9650。
I/Os
-
ReadFromMongoDB 现在可以与 MongoDB Atlas (Python) 一起使用(BEAM-11266)
- ReadFromMongoDB/WriteToMongoDB将屏蔽 display_data (Python) 中的密码(BEAM-11444)
- 有一个新的转换
ReadAllFromBigQuery
,可以在管道运行时接收多个从 BigQuery 读取数据的请求。参见PR 13170和BEAM-9650。
New Features / Improvements
-
依赖于 Hadoop 的 Beam 模块现在已经测试了与 Hadoop 3 的兼容性(BEAM-8569)。(Hive/HCatalog pending)
- 作为 Apache Beam 发行过程的一部分,现在支持发布 Java 11 SDK 容器镜像。(BEAM-8106)
- 向 Beam SQL 添加了 Cloud Bigtable Provider 扩展(BEAM-11173,BEAM-11373)
- 为 thrift data添加了一个 schema provider(BEAM-11338)
- 在 Dataflow runner 中添加了 combiner packing pipeline 优化(BEAM-10641)
Breaking Changes
-
HBaseIO hbase-shaded-client 依赖项现在应该由用户提供(BEAM-9278)
- amazon-web-services2 中的
--region
标志已被-awsRegion
替代(BEAM-11331)
本站新闻禁止未经授权转载,违者依法追究相关法律责任。授权请联系:oscbianji#oschina.cn
本文标题:Apache Beam 2.27.0 发布,大数据流处理与批处理编程范式
本文地址:https://www.oschina.net/news/126045/beam-2-27-0-released
热门文章
相关推荐: 免费下载!统信UOS个人版1030发布:新增四大自研应用
今日,统信软件发布了统信桌面操作系统 V20 个人版(1030),针对用户交互体验、自研应用、系统性能等进行了全面优化与升级,可以免费下载。 新版本首先针对用户反馈的问题与人机交互习惯,调整和优化了使用交互操作方式,对触摸交互使用规则进行了全新定义与触…