登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
基于语境学习的图像扩散模型 In-context Diffusion Model
文化传媒
2023-08-08
DataFunSummit2023:大模型与AIGC峰会
张东旭
文本图像生成模型SuTI研究总结
背景知识
现有文本图像生成模型(如Imagen, Dalle2)已取得显著成果,生成的图像符合文本描述,具有想象力和高清晰度,但可控性较差,难以通过文字描述实现视觉信息的精确控制(如位置、角度、姿势)。
现有个性化生成方法包括DreamBooth(微调整个模型)和Textual Inversion(微调embedding),但均存在模型微调耗时、内存占用大、扩展性弱等问题。
动机
语境学习在自然语言处理中通过预训练实现,而图像生成模型缺乏类似能力,预训练仅基于单个(文本,图像)pair,无法连续适应新环境。
设计目标:通过适配网络架构和训练数据,使图像生成模型具备语境学习能力。
设计
网络架构
:复用UNet的Encoder,通过额外的Attention Layer高效输入demonstration信息,将示例文本图像信息编码到同一空间。
训练数据
:构建连续的(text, image)pair数据集,通过聚类和重新标注优化数据质量,形成图文ICL数据集v2,确保exemplar和target差异显著。
结果和展望
实验参数
:使用500K训练数据,约1天训练时间,SuTI模型具备五种技能:风格化、重情境化、多视角合成、属性修改、配件添加。
输出样例
:展示了模型在不同技能下的生成效果。
人类评估
:通过详尽评估验证模型对Subject和Text的Alignment,以及生成图像的完整性。
局限性与展望
:当前模型输出存在artifacts,尤其是人脸和文字细节;未来计划通过扩大模型规模和增加技能种类(如SuTI2)提升效果,并将所有技能打包为instruction-tuning格式,计划在Google Cloud上线。
你可能感兴趣
【风口研报·公司】获四机构席位买入超2亿元,分析师看好这家视频显控龙头基于深度学习训练模型、已实现了AI图像色彩重建技术,有望受益于技术变革带来的行业集中度进一步提升
未知机构
2024-02-19
【电报解读】Meta发布首个“类人”AI图像创建模型,可像人类一样学习更多内容,这家企业与META有业务往来(2)
未知机构
2023-06-15
扩散模型如何做好可控生成?基于奖励引导的控制生成用于扩散模型中的推理时对齐:教程与综述
文化传媒
未知机构
2025-01-20
“学海拾珠”系列之一百八十五:DiffsFormer:基于扩散模型的因子增强框架
华安证券
2024-04-18
8 - 5 GraphSynergy : 基于网络的抗癌药物组合预测深度学习模型
医药生物
DataFunSummit2022:图机器学习峰会
2022-07-18
基于机器学习的贫困地图中的空间异质性:模型在哪里表现不佳?
文化传媒
亚开行
2025-09-15
基于价量数据的排序学习选股模型
华创证券
2023-09-28
基于神经网络的模型框架:机器学习量化模型
山西证券
2024-07-02
第七届挑战赛A3-基于机器学习提升的轮动多因子量化选股模型
数睿思
2019-08-08
第九届挑战赛A2-基于机器学习模型预测财务造假的上市公司
数睿思
2021-07-28