推理场景的挑战
- AIGC应用的PMF:合规要求(数据、内容、算法)对AIGC行业提出明确要求,需落实生成式人工智能产品的合规管理。
- 模型的选择:开源LLAMA3对自研模型、SFT模型的冲击,以及DiT模型和SDUnet的优化,促使重新选择技术栈路线。
- 合规要求:
- 数据合规:预训练数据和优化训练数据来源的合法性需由提供者负责。
- 内容合规:生成的图片、视频等内容需依法标识,加强平台网络信息内容生态治理。
- 算法合规:算力供给算法推荐服务需落实备案、评估、透明度和用户权益等要求。
- 工程化投入负担:围绕生图、LLM、图像理解、视频生成、音频生成,工程化能力要求越来越高,增加AIGC应用迭代创新负担。
- 业务落地受限:大模型服务成本高,仅适用于高价值用户场景,计算和存储利用率提升可降低成本,拓展更多场景。
Infra降本提效
- 推理加速提升效率:
- 显存优化:通过显存优化技术提升推理性能。
- 计算优化:通过算子优化提升计算效率。
- SD场景算子优化:针对特定场景进行算子优化。
- 向量库:腾讯云向量数据库提供外部知识库,提高大模型回答准确性,单索引行数可达10亿行。
- 数据分区管理:多租户场景下自定义数据分区策略,提升数据索引效率。
- 端到端AI套件:提供“文档预处理”、“embedding模型”、“向量检索算法”等多重套件功能组合,支持RAG应用。
- 数据在异构存储之间流转提效:
- 方便数据接入:开源/第三方数据集方便接入COS。
- 方便数据流动:数据统一存储在COS,对接多个处理环节。
- 高数据处理性能:GooseFS缓存加速,提升数据处理和训练性能,最高100GB/s吞吐。
- 降低业务成本:COS低成本海量存储,CFSTrubo冷热数据分层能力降低成本。
- 搜索增强:
- LLM推理阶段数据增强:集成搜索引擎补齐实时信息,降低幻觉。
- 多模态图搜数据增强:采用图搜接口用于图像内容搜索增强。
- 常用信息的内容缓存:缓存高频调用搜索引擎内容,降低延迟。
- 业务混布:
- GPU推理业务混布:通过“如意RUE”内核实现动态资源调度和抢占,提升资源使用率。
- GPU & CPU业务混布:支持高优/低优任务均衡调度,极致提高GPU利用率。
企业组织上,围绕AIGC应用的改变
- 人才:算法/工程/产品人才是竞争力,GPU使用效率是底线。
- 产品PMF导向:利用云厂商现成产品力快速搭建MVP,快速试错。
- 云、产品、算法、工程的协同:四方互相协调,例如卡便宜显存有瓶颈时,工程团队能否实现量化,产品侧能否接受部分效果有损。
- 围绕GPU的业务运转模式:例如AIGC业务元数据的管理,包括GPU价格、规模、类型等。
案例实践
- 某LLM客户采用TACO-LLM推理加速方案:
- 总吞吐:TACO-LLM比vLLM高42.8%,比TGI高35.2%。
- 测试结果:2并发时处理请求数达到原方案的1.9倍(业务生文bt模型)和1.5倍(业务生文cy模型);5/10并发时,原方案OOM,TACO-LLM可运行,极大提高业务吞吐。
- 某AIGC客户案例分享:
- 业务挑战:安全风险高,需加强合规审核和防攻击防盗刷;模型微调对算力和存储要求高,需控制成本;AI推理生成图片或视频需要高性价比GPU算力及推理加速能力。
- 解决方案:
- DDOS高防包、WAF、验证码服务:保证企业网站安全。
- 数据万象CI:大幅降低中间传输成本,提供每天百万级图片审核服务,准确率>95%。
- 高性价比的GPU、CFS Turbo高性能存储、GooseFS加速能力:高效稳定支撑百万级模型参数微调,降低40%算力成本,推理加速提高30%效率。