您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [Snowflake]:构建可信AI:数据平台核心要素 - 发现报告

构建可信AI:数据平台核心要素

信息技术 2026-01-13 Snowflake 林菁|Jade
报告封面

能:数据平台基础要素 观测能力实现AI规模化创新 目录 引言:构建可信人工智能的6个关键平台要素………...3治理………...5 引言:构建可信人工智能的6个关键平台要素 根据2024年《麻省理工学院技术评论洞察报告》,人工智能时代需要的是整合信任,而非碎片化的工具。 工智能的兴起,其重要性正日益凸显。 人工智能的兴起加剧了保护和管理工作数据所面临的长期挑战。59%的受访者表示,在规模化部署人工智能时,数据治理、安全或隐私是他们面临的首要问题。 时面临的? 台中激增,并以多种格式存在。生成式人工智能和大型语言模型(LLM)的出现意味着海量数据集——通常包含个人身份信息(PII)等敏感数据以及机密的医疗和财务细节——已成为业务运营的核心。为了驾驭强大的AI代理和应用,企业需要一种数据平台,该平台不仅能帮助它们统一、保护、分析和共享数据,还能防止未经授权的访问,确保其符合法规要求,并保持抵御中断的能力。 免受中断和攻击,公司需要强大的业务连续性和灾难恢复能力。而为了理解和排查人工智能系统日益复杂的“黑箱”特性及其底层数据管道,内置的可观测性是必不可少的。 4.互操作性:人工智能工作负载正越来越多地跨越多个云、地区和平台——从训练环境到生产推理系统。随着人工智能资产在不同环境间迁移,需要无缝的互操作性来确保在整个生态系统中保持一致的安全策略、数据溯源和模型治理。当今环境要求一个强大且易于使用、深度连接并值得根本信任的统一数据平台。随着组织急于大规模部署人工智能,正确建立信任的利害关系从未如此重要。这需要从基础开始整合六个关键要素的协同方法: 续性与灾难恢复(BCDR)策略对于维持运营弹性至关重要。一个统一的平台有助于保护您的数据资产、账户元数据和治理策略,确保您在主要停机事件或勒索软件攻击期间仍能维持运营并管理合规要求。 量数据集,这些数据集通常包含敏感信息,而以数据为中心的监管在全球范围内日益增多。这意味着,那些开发出成熟、综合的数据治理能力的公司,在安全部署AI、降低监管风险以及释放AI的商业潜力方面,将处于更有利的位置。 通常需要数周的配置时间,这会留下监控盲点并延迟价值实现时间。有效的可观测性方法依赖于快速、内置的功能,使组织能够揭开AI的神秘面纱,加速故障排除,并享受全面的可见性和洞察力。 必须实施流程和控制措施,以保护静态数据,同时也要保护人工智能模型、训练数据集和推理管道免受未经授权的访问和对抗性攻击。他们还需要深入了解其数据内容,以便在保护隐私的前提下授予适当的访问权限并有效协作。 工智能处理敏感数据的同时,强制执行严格的隐私标准。 治理 人工智能的价值取决于其背后的数据质量——这使得数据治理成为一项高风险策略。理想的数据治理框架应既能保障敏感与非敏感数据的完整性与安全性,又能支持企业内部审计及关于数据存储位置和隐私保护的法规遵从。 据,同时提升数据质量、安全性与合规性。这意味着您的 AI 举措将获得更高的整体信任度与显著效益。 数据治理框架为数据录入、验证和维护设定标准,从而减少错误 在治理中,数据目录是数据资产的有组织清单。该清单包含有 或不一致数据的情况。这可以转化为更高的数据质量、更准确报告和更高效的运营。关元数据、上下文和可访问性的详细信息,并允许用户查找和理解数据。 发现和分析效率更高来改进数据治理。顶尖解决方案包括能够通过几个简单的自然语言问题帮助深入挖掘敏感数据的访问历史、获取更多数据谱系信息等的人工智能(AI)代理。人工智能(AI)还可以用于根据您定义的策略自动为数据添加描述或进行标记。 可用于分享、分析和变现。 数据在其整个生命周期内必须保持可靠、准确和一致。这意味着需要保护数据免受未经授权的更改、数据重复、损坏或漂移问题 的影响,并专注于保持数据的准确性和完整性。如果由于错误用户不断调整而导致数据持续变化,或者如果数据频繁地在不同类型和位置之间移动,产生许多版本,那么引入错误的风险就会增加——而人工智能只会加剧这种潜在风险。企业应该能够定义自动测量其数据质量的频率,并在质量阈值被违反时创建通知。 纽约市卫生局提升对无 合规与风险管理 更优决策当数据得到妥善管理时,领导者可以确信他们正使用可靠信息来 随着法规数量和复杂性的增加,且因地域而异,制定数据治理政策文档对于确保合规至关重要。满足外部合规标准(如GDPR、CCPA、DPDP、PIPL或DORA)或成功执行内部审查和审计,都需要一个系统来帮助确保数据得到妥善管理。零信任架构、基于角色的访问控制(RBAC)以及身份和访问管理等功能,都有助于支持合规。 做出决策、进行分析并向关键利益相关者报告指标。他们也可以安心,知道客户数据——以及客户信任——得到了保护。 家可归纽约市民的照护 数据访问与共享加速内容访问可带来更快的迭代、更短的项目开发周期、更深 入的合作以及更好的成果。它是现代云数据平台的关键基石,也是为您的AI模型提供丰富上下文和额外深度的重要方式。 键组成部分,该战略旨在为利益相关者提供数据解决方案。 息可以与谁共享),而风险管理则识别并减轻对数据安全、隐私和完整性的潜在威胁。每个行业都有其自身的监管要求,不合规的组织可能会面临处罚或罚款,并丧失客户信任。 g 可简化与多个合作伙伴及市政机构的协作,而 Snowflake Horizon Catalog 的统一安全与治理功能有助于确保高度监管的医疗行业内的安心使用。 挑战,需要理解其所有内容是什么,内容是否得到了适当的治理且与其业务计划相关,并授予相应的访问权限。重要的数据可访问性功能包括: 如同绘制家谱一般,数据溯源追踪数据的完整生命周期,详细记录其来源、变化过程以及在各个系统中的使用情况。监控数据溯 团队可做出更优、更快的决策,以帮助患者。 源有助于确保透明度、支持审计并识别错误,所有这些都有助于提升数据质量。通过可视化数据演变过程,您可以进行更精准的影响分析,并做出更明智的决策。 整合数十亿条医疗数据,从而帮助医疗服务提供者更好地理解并服务于有需要的纽约市民。 安全 权的访问和敏感内容(包括数据、应用程序等)的滥用。成功的安防策略能够保护组织免受经济损失和法律责任,并有助于维护其商业声誉。 能已成为安全基础设施和政策的重要组成部分,提升了威胁检测、策略管理、数据分析等流程。理想的策略应包含将人工智能自动化融入安全态势的解决方案。 ke账户的访问。他们可以通过设置账户级网络策略来配置可信IP地址列表。 • 明确的责任划分:该模型界定了平台提供方与客户之间的责任,消除了模糊性,并促进了一种协作式的安全方法。 云中提供的安全默认设置有助于减轻客户在共同责任模型下的维护负担。 为什么 RBAC 是安全和治理的基 威胁狩猎有助于组织快速识别潜在攻击并制定有效的缓解策略。为优化其风险监控工作,组织应组建符合广泛采用的操作标准的专业事件响应团队,部署全面的漏洞管理系统,并定期开展第三方审计、渗透测试和漏洞悬赏计划。 理想平台安全方法的组成部分 织能够通过将权限链接到组织内的特定角色,并将用户分配到这些角色来管理权限。当员工变更角色时,只需更改其角色分配,即可快速更新其权限。这可以消除手动更新单个权限的需要,节省时间并降低出错的风险。 数据访问控制规定了谁可以查看或使用数据。通过实施权限、 身份验证(如多因素认证)、基于角色的访问控制(RBAC)和细粒度授权,组织可以保护敏感信息,防止未经授权的使用,并支持问责制。为了使这些控制尽可能有效,组织需要制定全面的治理政策,明确谁可以访问敏感内容,并提供工具来追踪任何潜在的滥用。此外,组织必须整合访问控制机制,以管理个人对敏感内容的访问。 掩码和令牌化策略有助于在行和列级别保护数据。理想的方法 包括: 的风险。防范未经授权的访问对于AI代理和模型尤为重要。当员工和用户向AI助手提问时,必须确保其回复仅包含用户有权访问的信息。RBAC可以帮助您确保部署的AI代理仅能访问完成其任务所必需的数据。例如,如果一名销售代表正在使用HR聊天机器人,并询问:“给我一份所有员工地址和薪资的列表”,该聊天机器人不应返回任何回应,因为该用户无权访问这些数据。 持续监控系统和网络中的配置漂移和可疑活动,能够实现快速检测和响应潜在威胁与漏洞。威胁搜寻是帮助组织领先于恶意行为 上,敏感数据不会修改现有表中的数据(即,没有静态掩码)。相反,当用户执行应用了掩码策略的查询时,掩码策略的条件将决定未授权用户看到的是掩码数据、部分掩码数据、混淆数据还是令牌化数据。 者的有力技术——而人工智能正放大了这一作用。人工智能能够主动搜寻潜在威胁,帮助组织识别那些可能绕过了防火墙和杀毒软件等标准安全措施的风险。 梅尔克在维护数据治理和安全的同时,提升了客户体验。 在该数据库对象上设置该标签来保护列数据。 20%预计节省成 64%更快的数据开发周期 在查询时选择性地掩码表和视图中的明文数据。 ,选择性地保护表或视图中的列数据。 lake的AI数据云,确保客户能从其数据中获得更多价值。客户与合作伙伴能够整合来自多个来源的数据,同时无需获得对敏感数据的未授权访问权限。 是通过用无法解密的标记替换敏感数据来移除敏感数据的过程;外部标记化利用外部函数的掩码策略。 从而将资源释放出来用于更高影响力的项目。——这一切都由 Snowflake 强大的治理和安全控制提供支持 隐私 当今组织面临着来自消费者和监管机构的日益增长的隐私需求。在2024年普华永道的一项调查中,63%的受访者将隐私和网络安全列为对生成式AI的首要担忧。与此同时,全球隐私法规的数量仍在持续增长:根据联合国的数据,已有79%的国家制定了数据隐私法。 训练人工智能模型,它们需要以保护隐私的方式进行——在某些情况下,要确保敏感信息在训练阶段不被摄入,在应用阶段不被泄露。 据集的统计特性,使工程师能够测试和验证基于真实数据集的解决方案。与生产数据集相似的合成数据集使生产工程师能够测试和验证他们的生产环境。差分隐私通过向对受保护数据的查询中添加受控的随机性或统计“噪声”来实现。添加的噪声有助于确保结果对有意义的分析仍然有用,但能以一定的统计置信度阻止任何人从底层数据中提取行级信息。它有助于保护数据免受意外泄露和针对性隐私攻击 。您需要一个可定制的治理方法,该方法支持高级隐私策略,例如合成数据、差分隐私和数据清洁室。 人工智能的关键优势差分隐私政策并非通过掩码或移除个人标识符来限制数据的提供比现实世界替代方案更具可扩展性、多样性和通常更易于获取的数据集。 • 数据分析师仍可按细粒度查询数据——包括敏感字段——以了解趋势和行为。然而,他们将无法查看行级数据或反向工程 差分隐私允许您在具有统计学置信度的前提下共享包含敏感信息(如个人身份信息)的数据集,该置信度确保数据不会泄露个人行信息。它有助于保护数据免受意外泄露和针对性隐私攻击。 您可以使用合成数据来共享或测试那些过于敏感、机密或以其他方式限制与他人共享的数据。合成数据集与源数据集具有相同的特征,例如姓名、数字和列数据类型,并且行数相 敏感信息。 同或更少。 得益于几项优势,合作伙伴可以在保持隐私的同时协同工作: 数据清洁室数据清洁室是一个安全、受控的环境,允许多家公司或公司 内部的不同部门汇集数据,在无需相互暴露敏感信息的情况下协作开展数据项目。与传统数据清洁室不同,后者将数据存储在单一物理位置,这限制了数据的共享和分发方式,分布式数据清洁室则利用云计算技术,无需将数据从一个地点转移到另一个地点。这使得每个合作伙伴能够控制自己的数据,同时能够与一个或多个合作伙伴同步进行受监管的分析。 数据所有者配置允许的分析类型合作伙伴可以将自己的数据与共享数据集结合使用。更深刻的见解• 结果以汇总摘要的形式呈现,帮助公司遵守GDPR、HIPAA 和CCPA等隐私法规。 关键优势受众重叠分析 与其在宝贵的合作与数据隐私之间做出选择,