clip长文本能力被解锁,图像检索任务表现显著提升!
一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIP。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
Long-CLIP基于保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成。
长文本-图像检索提升20%,短文本-图像检索提升6%。
CLIP 对齐了视觉与文本模态,拥有强大的 zero-shot 泛化能力。因此,CLIP 被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。
但CLIP的一大弊病是在于长文本能力的缺失。
首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在677个token。不仅如此,实验证明CLIP真正的有效长度甚至不足20个token,远远不够以表征细粒度信息。 然而,为了克服这个限制,研究者们提出了一种解决方案。通过在文本输入中引入特定的标记,使模型能够聚焦于重要的部分。这些标记在输入中的位置和数量都是事先确定的,不会超过20个token。 通过这种方式,CLIP在处理文本输入时能够
文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。
同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。
针对这一问题,研究人员提出了Long-CLIP模型。
具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。
一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ1 对位置编码进行插值,再通过长文本进行微调。
研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。
基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ2 进行插值,计算公式可表示为:
实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。
仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。
具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。
△加入核心属性对齐的微调流程
在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。
比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。
无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。
△短文本-图像检索实验结果
△长文本-
图像检索实验结果
△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节
除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。
Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。
也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。
论文链接:https://arxiv.org/abs/2403.15378
代码链接:https://github.com/beichenzbc/Long-CLIP
# 细粒度
# 解锁
# 模态
# 用在
# 两张
# 即插
# 是在
# 插值
# 提出了
# ai
# 这一
# embedding
# https
# stable diffusion
# 算法
# github
# Token
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
网络优化91478 】
【
技术知识72672 】
【
云计算0 】
【
GEO优化84317 】
【
优选文章0 】
【
营销推广36048 】
【
网络运营41350 】
【
案例网站102563 】
【
AI智能45237 】
相关推荐:
DeepSeek辅助撰写专利申请 DeepSeek技术创新文档写作
生物医学图像分割:U-Net模型训练与应用详解
优化《现代战争2》色彩:提升游戏视觉体验终极指南
OpenAI ChatGPT Agent:AI自主任务的未来
百度AI助手官方入口 文心一言网页版登录入口
机器学习赋能AI生产力工具:提升效率与智能决策
百度搜索ai助手怎么关闭 百度搜索ai对话屏蔽方法
轻松入门:如何创建自己的图像识别模型
AI 驱动的潜在客户生成:终极自动化指南
斑马AI能否关联学校教材_斑马AI教材同步与版本匹配【技巧】
AI网站构建指南:Duda平台免费创建教程
AI数据分析报告生成工具有哪些_一键生成可视化报告的AI工具推荐
文心一言处理大规模中文报表数据的清洗技巧
MemeGIF Studio:AI驱动的GIF生成器全面评测与使用指南
百度ai助手通知栏怎么关 百度ai助手通知消息屏蔽
如何用AI帮你进行竞品功能对比分析?轻松制作对比矩阵
通义千问怎样写文案_通义千问文案写作教程【指南】
唐库AI拆书工具如何批量导出笔记_唐库AI拆书工具批量导出与格式转换【方法】
ChatGPT怎样用提示词设上下文_ChatGPT上下文设置技巧【方法】
韵律分析:为什么理解音乐歌词的韵式至关重要?
怎么用ai写产品说明书 AI功能介绍与使用步骤详解【实操】
AI CRM集成:提升客户关系管理效率的关键
lovemo网页版地址 lovemo官网手机登录
使用文心一言进行高质量的唐诗宋词创意改编
文心一言辅助进行中文播客脚本起草教程
构建卓越AI代理:端到端Agentic RAG解决方案详解
AI Buildr: 构建 AI 应用的终极指南
ChatGPT 4o 辅助学生复习 GRE 词汇的方法
AI视频创作终极指南:文本到视频的免费工具与技巧
利用Gen AI和AI Agent进行软件测试:Ollama本地LLM实践
Vivo V50e 5G AI功能:最佳AI特性深度解析
AI音乐创作:颠覆传统,开启音乐新纪元
如何用AI帮你检查代码中的潜在安全漏洞?
斑马AI能否查看孩子学习报告_斑马AI报告查看与数据解读【方法】
Google Gemini 对复杂物理解题过程的逐步解析
轻松制作圣经视频:无需露脸也能赚钱的教程
Claude怎么用新功能诗歌创作_Claude诗歌创作使用【方法】
AI Vibe Coding: 快速打造落地页,低代码平台实战教程
Gemini怎样写实用型提示词_Gemini实用提示词编写【攻略】
普通人如何用DeepSeek月入过万?2026最新赚钱路径全解析!
AI测试面试准备:提升你的面试技巧与知识储备
美图AI海报设计怎样匹配品牌VI_美图AI海报设计VI匹配与色彩校准【教程】
Gemini手机端怎么开无障碍_Gemini无障碍设置方法【步骤】
批改网AI检测工具怎样批量检测作文_批改网AI检测工具批量上传与处理流程【攻略】
DeepSeek分析Excel怎么用_DeepSeek分析Excel使用方法详细指南【教程】
LeetCode算法:最长公共前缀问题全面解析
网络安全警钟:揭秘“美足”背后隐藏的危机与防范
Gemini怎样用语音输入_Gemini语音输入设置【方法】
Roblox Studio AI 助手:创意构建与无限可能
豆包AI怎么做数据分析 豆包AI数据处理入门教程
2024-04-01
南京市珐之弘网络技术有限公司专注海外推广十年,是谷歌推广.Facebook广告全球合作伙伴,我们精英化的技术团队为企业提供谷歌海外推广+外贸网站建设+网站维护运营+Google SEO优化+社交营销为您提供一站式海外营销服务。