上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

量子位
304次浏览

即插即用X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

CLIP长文本能力被解锁,图像检索任务表现显著提升!X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIPX7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△棕色文本为区分两张图的关键细节X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

Long-CLIP在保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成——X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

长文本-图像检索提升20%,短文本-图像检索提升6%。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

解锁CLIP长文本能力

CLIP对齐了视觉与文本模态,拥有强大的zero-shot泛化能力。因此,CLIP被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

但CLIP的一大弊病是在于长文本能力的缺失X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在了77个token。不仅如此,实验发现CLIP真正的有效长度甚至不足20个token,远远不足以表征细粒度信息。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

针对这一问题,研究人员提出了Long-CLIP模型。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

保留知识的位置编码扩充

一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ1 对位置编码进行插值,再通过长文本进行微调。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ2 进行插值,计算公式可表示为:X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

加入核心属性对齐的微调

仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△加入核心属性对齐的微调流程X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

即插即用在各种多模态任务中

在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△短文本-图像检索实验结果X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索实验结果X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节

除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

论文链接:X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM
https://arxiv.org/abs/2403.15378X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM
代码链接:X7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM
https://github.com/beichenzbc/Long-CLIPX7D速刷资讯——探索最新科技、每天知道多一点SUSHUAPOS.COM

本文链接:http://m.sushuapos.com/show-2-4431-0.html上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

热门文章

延伸阅读

相关阅读

斯洛伐克发生首起电动车起火事件,窜上热搜引发当地全民讨论
3 月 6 日消息,电动汽车起火早已不是什么新鲜的事情了,不过对于斯洛伐克共和国的车主来说,上周发生的大众 ID.3 电动汽车起火却是该国首起此类事件,迅速窜上斯洛伐克的热搜。当地媒体大肆宣传这是“该国有史以来
本田扩大召回部分进口Acura NSX汽车
  中新经纬3月4日电 据国家市场监督管理总局网站消息,日前,广汽本田汽车有限公司根据《缺陷汽车产品召回管理条例》和《缺陷汽车产品召回管理条例实施办法》的要求,向国家市场监督管理总局备案了召回计划。决定自2024
专访毕马威中国咨询首席战略官蔡伟:5%左右的GDP增速目标具有挑战性,应聚焦“三驾马车”协同发展|解码政府工作报告
21世纪经济报道记者张梓桐 北京报道21世纪经济报道记者注意到,今年《政府工作报告》(以下简称《报告》)提到对2024年经济增长目标设定在5%左右,强调今年我国发展面临的环境仍是战略机遇
吉利星越 L 智擎新增星云版车型,起售价降低至 15.97 万元
3 月 8 日消息,去年 11 月,吉利推出了混动 SUV—— 星越 L 智擎,星河版现售价 16.77 万元,天宫版售价 17.77 万元。现在星云版车型正式上市,官方指导价为 15.97 万元,配置也进行了调整。与星河版相比,新上市的星云版
“专精特新”连续三年写入政府工作报告 工信部今年新增100个中小企业产业集群
21世纪经济报道记者 缴翼飞 实习生 林润 北京报道专精特新中小企业实现专业化、精细化、特色化发展,创新能力强,质量效益好,是优质中小企业的中坚力量。今年的政府工作报告强调,促进中小
三星 SDI:明年初可量产 46 毫米大直径电池
3 月 10 日消息,韩国电池巨头三星 SDI 的总裁 Choi Yoon-ho 在韩国规模最大的电池展 InterBattery 2024 上宣布,公司研发的 46 毫米大直径电池将于 2025 年初具备量产能力,具体量产时间将根据客户需求进行调整。

热点精选

最新推荐

您可能感兴趣