目录 《需求与设计:数据工程两大转变的探索》 作者:Chris Child …… …… …… 3 ITD框架:入门指南 …… …… …… …… …… …… …… ………… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… 5 持续流动:为AI速度架构数据摄取 …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… 7 变换数据而非代码:转向声明式工作流 …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… ………… …… …… …… …… …… …… …… …… …… …… …… 10 超越仪表盘:为人类与AI消费者交付语义层 …… …… …… …… …… ………… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… 13 安全扩展:为高风险AI工作负载实施数据Ops …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… 15 数据工程师的未来:AI时代的运营架构师 …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… …… 需求与设计:驾驭数据工程两大转变 易见:人工智能正在从根本上重新定义数据工程师在各个层面的职能。它对数据的无限需求给数据工程团队带来了过度的要求——这些要求对于成功至关重要,然而却极其难以维持。第二种转变是形式上的转变,即数据工程师必须如何满足这些新增长的需求。我们已经看到数据工程师从主要从事重复性、手动劳动转变为更具战略性的执行,借鉴软件开发的最佳实践来提升他们的工作。他们不再仅仅是数据管道工和管道构建者;他们是任何数据驱动型组织的运营架构师。而且,此时已无法回头。以编码代理为例。短短数月内,这些工具,包括Cursor、Claude Code和Snowflake的Cortex Code,就彻底改变了我们对软件开发乃至数据工程的认识。这是如何实则。通过抽离每个步骤的细枝末节,转而专注于期望的最终状态,数据工程师得以提升其生产力,实现此前看似遥不可及的收益。 现的?多年来,数据工程团队一直默默借鉴软件定义生命周期的最佳实践。他们将基础设施视为代码,并创建结构化、版本控制的环境,其中数据管道与无状态软件代码非常相似。由于这些AI编码代理在软件工程问题上接受了大量训练,因此它们能够轻松适应这种现代数据工程形式。 要更高效地工作以保持同步。 归根结底,数据工程未来的关键并非编写更好的脚本来移动数据,而是构建能够为您连接数据的弹性系统。本书旨在帮助您实现这一目标。书中,首席开发者布兰道特·赫南德斯将带您了解数据管道的ITD(摄取-转换-交付)框架。他将在介绍每个步骤相关的传统方法——包括其优点和缺点——之后,重点介绍现代工具和方法,以帮助数据工程团队适应眼前的变化格局。这种方法的转变——转向更现代、更明确的思维方式——为使AI工具发挥作用创造了合适的条件。但更重要的是,它提供了AI规模化运行所需的“安全网”。过去,修复管道意味着直接在生产环境中运行原始SQL命令;但如果出现故障,调查问题会极其复杂。如今,现代方法意味着变更会被提交到版本控制,只有在确认是良好状态时才会测试和部署。能够轻松测试变更并回滚,是信任AI编写或管理数据工作流之前的一个严格前提。 信任。我们已看到组织同时运行数千个数据管道,达到人力几乎无法监控每个运行环节的阶段。很快,我们将迈向自主型人工智能时代,软件代理将承担更大规模的实际管道构建工作。数据工程师的角色将再次提升,从编写单个脚本转向高级数据建模和系统需求。他们将更贴近业务,为人工智能、分析和应用确保数据的可用性与质量。 ITD框架:入门指南 数据工程领域非常多样化,提供了许多独特的挑战以及大量不同的应用场景——所有这些都可以通过多种方式解决,使用多种工具。 影响数据工程师如何设计和部署数据管道:(1) 人工智能的需求和使用案例正在给数据管道需要解决的问题带来压力;(2) 经过充分测试、成功的软件工程最佳实践正在进入数据工程领域。这意味着数据工程师不仅要改进他们的工作流程,还要改进他们设计和部署、维护数据管道的思维模型。简而言之,对数据工程师的要求越来越高,现代数据管道正在演变为反映这些转变和需求成部分。这些组成部分涵盖了将原始数据摄取到数据平台中,将其从原始状态转换为可用的状态以促进洞察提取,以及交付使用转换后数据的产品——例如仪表板、应用程序,以及现在与人工智能相关的产物,如语义视图。如果你是一位经验丰富的数据工程师,但对ITD框架不熟悉,你会发现它与提取、加载、转换(ELT)工作流程是相当的。 其作用正受到人工智能的深刻影响,这不仅体现在摄取、转换和交付数据产品等各个环节,也反映在人工智能为每个环节带来的新挑战。 无论您倾向于遵循哪种管道框架,其组成部分正受到解决和扩展人工智能用例的需求以及转向使用软件开发最佳实践来设计数据管道的根本影响。 转换过程自动进行,无需维护,并在可能的情况下使用人工智能来执行转换。 数据经过转换后,数据工程师会提供包含这些数据的产品,例如经过策划的数据集、仪表盘和数据应用。人工智能正在增加管道应当提供的新一代可行数据产品,例如为人工智能代理提供上下文语义层,以及任何业务用户都可以从中提取洞察的数据对话界面。 在本电子书中,我们将为您介绍Snowflake中所有现代化的、面向AI的数据工程工具,这些工具旨在简化人工智能数据工程师所处理的数据全生命周期。我们将向您展示如何利用AI进行数据摄取(在某些情况下,也可以连接到数据而无需移动数据)、数据转换和数据产品交付。 受到根本性影响。人工智能要求所有数据,无论其来源如何,都必须被摄取到数据平台,并尽可能快地进行处理。 署能够解决传统数据相关挑战的数据管道。 《雪花如何完美融合》。AI解决方案要求数据 持续流:为AI速度而设计数据摄取架构 前对数据工程领域产生了重大影响的实质性转变。具体而言,对人工智能解决方案的持续需求正迫使数据工程师重新评估他们管理、架构和实现对大量以非结构化为主的实时数据访问的方式。这通常需要将数据从源系统迁移到可访问且可扩展的湖仓(lakehouses)。数据迁移的关键部分之一,是许多管道中的第一步:数据摄取(dataingestion)。 据团队可以直接将数据转换和人工智能应用于源数据。对于 Apache Iceberg™ 等开放表格式中的数据也是如此。许多现代数据平台现在支持 Iceberg 集成,这意味着它们可以即时连接到外部平台中的 Iceberg 数据,并直接处理该数据,而无需复制或移动数 数据平台。摄取过程发生的速率被称为摄取延迟,并且它可以因用例而异。 定制脚本和连接器蔓延 人工智能对传统模式的影响 随着数据解决方案范围的扩大,构建自定义脚本或集成第三方工具以连接数据源是不可避免的。但人工智能极大地增加了可用数据源的数量。谷歌文档、Slack 消息、PDF 文件、社交媒体、通话录音——所有这些都已成为极具可行性和潜在价值的数据源,为人工智能提供了更丰富的上下文层。为每个数据源构建自定义解决方案或购买现成连接器既难以管理,又难以扩展。数据工程师需要更精简的方法来连接这些爆炸式增长的数据源。 批处理优先摄取 按预定时间间隔批量摄入数据,数十年来已成为一种普遍且广受接受的模式。数据工程师通常按日或按小时摄入数据,很长一段时间里,这种方式满足了绝大多数用例需求。人工智能正在从根本上改变这一现状。通过向人工智能和自主系统提供新鲜数据,可以获取竞争优势。以制造业或金融服务行业为例,实时数据能够帮助人工智能解决方案提高生产效率,或帮助团队快速应对最新的市场趋势。人工智能正在降低对过时数据的容忍度,数据工程师现在必须将连续摄入工作流程架构到更多的管道中。 人工智能在处理向量嵌入、标记数据集以及其他为机器学习优化的丰富数据方面效率很高。但从零开始快速实现这些功能可能是 一项挑战。这一需求催生了一个全新的数据类别:AI就绪数据集,它们是数据管道(为人工智能提供数据)的即插即用解决方案。如今,数据工程师需要访问预先构建和筛选的数据集,而不是总是从基础开始构建数据摄取管道。 多年来,在数据工程领域,摄取结构化数据(例如行和列)一直是常态。当半结构化数据(如JSON)大规模出现时,数据工程师 们进行了适应,并为其构建了可靠的摄取模式。然而,情况并非如此(指非结构化数据)。人工智能分析并从PDF、图像、音频文件甚至视频中提取价值的能力,正给数据工程师带来压力,要求他们为这些数据类型找出可比较的、经过充分测试的摄取解决方案。 解决方案雪花(Snowflake)提供了多种功能,旨在应对人工智能(AI Apache Iceberg™ 表格 雪花Openflow )工作负载所要求的容量、种类和速度。 Apache Iceberg TM 是一种为大规模分析工作负载设计的开放表格式。Snowflake 为 Iceberg 表提供原生支持,允许数据工程师以 Iceberg 格式导入数据,并在 Snowflake 内直接查询。这对那些拥有现有 Iceberg 数据的团队(这些数据可能由 ApacheSpark™、Trino 或其他引擎编写)而言意义重大,他们希望将这些数据直接导入 Snowflake 而无需转换。对于需要在多个工具之间实现数据互操作的团队来说,Iceberg 提供了他们所需的开 雪花 Openflow 帮助数据工程师同时解决从众多数据源、以不同数据格式、以期望的摄取速度摄取数据所面临的挑战。它提供了一个可视化的、基于流的用户界面,用于连接源与目的地,并快速设置摄取延迟。它支持超过 20 个针对常用数据源的预构建连接器——例如 PostgreSQL 等流行数据库、Google Drive 等 SaaS 应用程序等——以及针对特殊用例的自定义流程。Openflow 支持结构化、半结构化和非结构化数据的摄取,直接应对了摄取传统行列之外的数据类型的压力。放性。 Snowpipe 可实现从云存储到 Snowflake 的持续、无服务器的数 据摄取。与调度批量加载不同,Snowpipe 会自动检测并加载 Amazon S3、Google Cloud Storage 或 Microsoft Azure Blob Storage 中新到达的文件。数据在到达后几分钟内即可加载完成,无需您配置或管理计算资源——直接实现了从批量优先到持续摄取的转变。 雪花市场为用户提供了对数千种由数据提供者共享的数据产品的 访问权限——其中包括专门为机器学习和人工智能工作负载精心策划的AI就绪数据集。从数据摄取的角度来看,市场代表了一种根本不同的方法:您无需构建管道从源中提取数据,而是访问已存在于雪花中的数据。当您在市场上订阅一个数据集时,该数据会作为共享数据库出现在您的雪花账户中——实时、可查询,并由提供者自动更新。这直接满足了AI就绪数据的新需求,而无需承担从头构建管道的开销。 雪花云的原生连接器——通常被称为“零ETL”连接器——为雪花云与Salesforce、ServiceNow、Google Analytics和