Dataflow 文档

Dataflow 是一种用于执行各种数据处理模式的托管式服务。本网站上提供的文档介绍如何使用 Dataflow 部署批量数据处理流水线和流式数据处理流水线,其中包括各项服务功能的使用说明。

Apache Beam SDK 是一个开源编程模型,既可用于开发批处理流水线,又可用于开发流处理流水线。您可以使用 Apache Beam 程序创建流水线,然后在 Dataflow 服务上运行这些流水线。Apache Beam 文档提供了有关 Apache Beam 编程模型、SDK 和其他运行程序的深入概念性信息和参考资料。

如需了解 Apache Apache 基本概念,请参阅 Beam 导览Beam PlaygroundDataflow 实战宝典代码库还提供了即时可用且独立的流水线以及���常见的 Dataflow 应用场景。

Apache、Apache Beam、Beam、Beam 徽标和 Beam 萤火虫吉祥物是 Apache Software Foundation 在美国和/或其他国家/地区的注册商标。
探索自主培训、应用场景、参考架构和代码示例,并了解有关如何使用和连接 Google Cloud 服务的示例。
使用场景
使用场景

使用 Dataflow,您可以在单个流水线中运行高度并行的工作负载,从而提高效率并使工作流更易于管理。

流式

使用场景
使用场景

借助 Dataflow ML,您可以使用 Dataflow 部署和管理完整的机器学习 (ML) 流水线。使用机器学习模型通过批处理和流处理流水线进行本地和远程推断。使用数据处理工具准备数据以用于模型训练并处理模型的结果。

机器学习 流式处理

使用场景
使用场景

构建一个端到端的电子商务示例应用,该应用可将来自网上商店的数据流式传输到 BigQuery 和 Bigtable。示例应用展示了实现流式数据分析和实时人工智能 (AI) 的常见使用场景和最佳实践。

电子商务 流式处理

相关视频