2023.03.07 ArXiv精选
关注领域:
AIGC
3D computer vision learning
Fine-grained learning
GNN
其他
声明
论文较多,时间有限,本专栏无法做文章的讲解,只挑选出符合PaperABC研究兴趣和当前热点问题相关的论文,如果你的research topic和上述内容有关,那本专栏可作为你的论文更新源或Paper reading list.

Paper list:
今日ArXiv共更新82篇.
2D 视觉
Detecting Human-Object Contact in Images
https://arxiv.org/pdf/2303.03373.pdf

发表于CVPR2023的工作,挖了一个新坑:human-object contact detection. 本文最主要的贡献是提供了新的数据集,填补此领域研究的空白.
CapDet: Unifying Dense Captioning and Open-World Detection Pretraining
https://arxiv.org/pdf/2303.02489.pdf

本文提出了一个框架,主要用于统一Dense captioning和Open-World Detection的预训练.
Vision-Language learning
HICLIP: CONTRASTIVE LANGUAGE-IMAGE PRETRAINING WITH HIERARCHY-AWARE ATTENTION
https://arxiv.org/pdf/2303.02995.pdf

ICLR 2023接受的工作.是一篇基于CLIP的改进工作,主要思想就是在CLIP的基础上引入hierarchy-aware attention,使得CLIP能够capture分层的视觉语言信息.
DECAP: DECODING CLIP LATENTS FOR ZERO-SHOT CAPTIONING VIA TEXT-ONLY TRAINING
https://arxiv.org/pdf/2303.03032.pdf

ICLR2023接受的文章.也是做CLIP的改进,核心思想是训练一个Decoder来对CLIP text embedding进行重建.之后图像的embedding便可以转换至Text embedding空间,实现text captioning.这样的做法最大的优点就是免去了pair数据.
Prismer: A Vision-Language Model with An Ensemble of Experts
https://arxiv.org/pdf/2303.02506.pdf

组合多个大模型获得更强的能力.与昨天更新的一篇文章有些类似.
细粒度学习:
Fine-Grained Classification with Noisy Labels
https://arxiv.org/pdf/2303.02404.pdf

噪声标签学习和细粒度学习的结合.发表在CVPR2023,由于细粒度数据inter-class之间的差异非常小,导致造成的噪声会更严重.本文基于对比学习,分别提出了一个noise-tolerated的损失对noisy label进行纠正,其次提出一个高效的特征采样模块,帮助表征性能学习.

