小红书图数据库在分布式并行查询上的探索
- 背景介绍:小红书作为社交平台,存储海量社交网络关系,自研图数据库REDgraph解决社交场景应用痛点和分布式并行查询问题。
- 图数据库介绍:图数据库专注于处理记录间关系,适用于挖掘深链路或多维度关系的业务场景,如社交推荐、社区风控、离线任务调度等。
- 业务上面临的困境:REDgraph在实现三跳查询时遇到性能瓶颈,主要原因是三跳查询兼具OLTP级别的并发度和OLAP级别的数据访问量与计算复杂度。
- 原架构问题分析:REDgraph采用存储和计算分离的架构,存储为shared-nothing模式,存在边切分、算子串行运行、同步等待和结果转发等问题。
- 分布式并行查询实现:通过在StoreServer插入执行层,实现算子并行执行、取消同步点和结果直接转发,提高查询效率。
- 性能测试:LDBC-SF100数据集测试显示,分布式查询在三跳及以上场景下性能提升50%-60%,一跳和二跳场景下与原生查询性能相当。
- 总结与展望:通过结合MPP思想革新REDgraph执行流程,实现分布式并行查询方案,未来将持续提升REDgraph查询能力,并探索该方案在其他在线存储系统中的应用。
快手关于海量模型数据处理的实践
- 模型场景介绍:快手模型场景主要为实时大模型,具有社交属性和海量流量规模,数据处理特点为“大”和“实时”。
- 推荐业务复杂:快手推荐业务架构包含召回、粗排、精排和重排等阶段,业务类型分为大型和中小型,分别采用流式迭代和批式迭代。
- 推荐模型的数据量:快手采用SIM长序列模型,参数量达1.9万亿,远超OpenAI的GPT3模型。
- 大规模模型数据处理:快手采用Flink流式框架处理大数据量,通过将状态下沉至高性能存储,采用无状态hashjoin实现实时join;通过GPU和CPU协同进行复杂特征计算,并采用DSL抽象提高算法迭代灵活性。
- 大规模模型数据存储:快手采用NVMTable存储方案,分为物理层、中间memorypool和上层业务层,通过内存和NVM的零拷贝技术实现高效存储;采用Raft协议加BT模式实现强一致性存储。
- 展望:随着模型和算力的增长,未来推荐的压力主要来自状态存储的大规模提升,需要通过新硬件和工程优化应对挑战。
哔哩哔哩基于Iceberg的智能数据组织优化实践
- 智能优化背景:哔哩哔哩湖仓一体平台使用Iceberg存储数据,面临查询性能和稳定性挑战,通过拓展Iceberg功能实现查询加速,但用户使用门槛较高。
- 智能优化实践方案:通过实时规则引擎、分析推荐模块和数据优化模块实现智能优化,包括数据分布优化、索引构建、文件内排序和预计算等。
- 智能优化成果及规划:智能优化功能已对30多张表进行优化,总体扫描数据量减少28%,未来将改进推荐准确性、支持更多查询场景,并推广应用到更多生产表。
京东零售数据可视化平台产品实践与思考
- 平台产品能力介绍:京东数据可视化平台产品矩阵包括智能BI平台、数据大屏平台、低代码平台和交互分析平台,分别面向报表搭建、低代码可视化编排、自助式可视化大屏搭建等场景。
- 业务赋能案例分享:通过EasyBI实现多域多场景打通,通过低代码平台进行场景化数据分析,通过JDV大屏搭建和呈现可视化大屏。
- 平台建设挑战与展望:平台建设理念为“数据分析工具+分析能力培养+数据基础设施”,通过产品、技术和服务三个层面进行建设,未来将提升数据查询加速引擎能力、前端渲染性能,并推动数据人才培养。
虎牙平台数据驱动业务实践,破局在即!
- 虎牙的数据赋能挑战:虎牙作为内容供给平台,存在增长、内容、推荐等业务诉求,通过ABTest实现因果推断,但存在混淆因子和ABTest局限性等问题。
- 实验文化与平台能力建设:虎牙实验平台建设经历了实验文化建立、实验效率提升和扩展实验平台服务边界三个阶段,通过典型案例帮助用户入门,并通过提升指标制作效率、实验检验效率和复盘效率帮助进阶用户。
- 结合场景服务扩展:虎牙通过RTA技术解决拉活场景中的重复点击问题,并通过Uplift模型评估拉活ROI;通过PSM方法和归因方法进行因果推断的效应评估。
- 总结与回顾:虎牙实验平台的目标是支持自助实验,聚焦更复杂更具价值的业务场景,并不断完善实验方法。
腾讯PCG搜广推机器学习框架GPU性能优化实践
- 为什么GPU推荐模型训练框架是刚需:PCG算力集群存在网络带宽小、硬件选型复杂、CPU型号不稳定、云容器非独占等问题,难以支持大参数量的推荐模型训练。
- GPU推荐模型训练框架怎么做才最高效:采用单机多卡架构,设计四级缓存的数据结构,进行数据下载、预处理和训练等阶段的优化,包括网络优化、DMA、落盘优化、DirectIO、数据结构优化、空间优化和计算优化等。
- 未来展望:未来将探索非英伟达GPU训练、推荐大模型与GPT结合、更灵活的架构和更大规模的训练,并希望使用更低的硬件配置训练更大的模型。
火山引擎DataLeap计算治理自动化解决方案实践和思考
- 痛点&挑战:字节跳动数据平台存在手动调参问题,包括系统复杂度高、动态变化、专业知识缺乏、一致性与可重复性缺失等。
- 解决方案:实施实时规则引擎、实时监控&自适应调整和DataLeap一站式治理解决方案,通过参数实时推荐、启发式规则应用、资源使用评估、稳定性与健康分策略等实现自动化治理。
- 实践&收益:队列优化前后效果对比显示,优化后资源申请量和使用量显著降低,运行时长减少,成本节约。
- 结论&展望:自动化方案优势在于效率提升、准确性增强、人力成本节省和实时监控与自适应调整,但存在算法依赖、可解释性与可控性局限和特定场景应对困难等局限性;未来将重点发展元数据闭环多产品化、用户干预参数推荐和结合规则引擎与算法优化,并预见适应变化的数据环境、提升算法性能和保障系统的可解释性和可控性等挑战。
火花思维数据分析体系建设和实战
- 痛在哪里-自研系统的局限性:BI系统受SQL束缚,交互式分析能力不足,性能瓶颈明显,数据结构不合理,行为日志系统分析效率低下,自研团队成本过高。
- 方案选型-为何选择火山引擎:通过对比火山引擎、Superset和帆软,最终选择火山引擎的原因在于其查询性能、数据预处理能力、智能归因分析功能和动态分流系统等优势。
- 运营策略-如何将工具潜力变成业务能力:数据分析产品应以需求驱动,通过业务痛点决定解决方案形式,提高内容生产效率,并通过培训和工作坊等形式普及相关能力。
- 系统使用情况:新BI系统活跃用户和分析师团队创建图表比例均有所提升,平台价值得到充分利用。
- 成功案例:设计团队通过数据分析平台提升朋友圈有效分享率,后服务团队通过数据分析平台提升生产效率。
- 未来展望-大模型时代的数据分析长什么样:未来BI系统将直接产出业务洞见,分析模式将转向问答形式,企业和工具供应商需分别专注于业务知识和元数据管理,构建有效的业务问答体系。