欢迎光临散文网 会员登陆 & 注册

2023.03.07 ArXiv精选

2023-03-07 13:03 作者:PaperABC  | 我要投稿
  • 关注领域

    • AIGC

    • 3D computer vision learning

    • Fine-grained learning

    • GNN

    • 其他

  • 声明

    • 论文较多,时间有限,本专栏无法做文章的讲解,只挑选出符合PaperABC研究兴趣和当前热点问题相关的论文,如果你的research topic和上述内容有关,那本专栏可作为你的论文更新源或Paper reading list.

Paper list:

今日ArXiv共更新82篇.


2D 视觉

Detecting Human-Object Contact in Images

https://arxiv.org/pdf/2303.03373.pdf

发表于CVPR2023的工作,挖了一个新坑:human-object contact detection. 本文最主要的贡献是提供了新的数据集,填补此领域研究的空白.


CapDet: Unifying Dense Captioning and Open-World Detection Pretraining

https://arxiv.org/pdf/2303.02489.pdf

本文提出了一个框架,主要用于统一Dense captioning和Open-World Detection的预训练.


Vision-Language learning

HICLIP: CONTRASTIVE LANGUAGE-IMAGE PRETRAINING WITH HIERARCHY-AWARE ATTENTION

https://arxiv.org/pdf/2303.02995.pdf

ICLR 2023接受的工作.是一篇基于CLIP的改进工作,主要思想就是在CLIP的基础上引入hierarchy-aware attention,使得CLIP能够capture分层的视觉语言信息.


DECAP: DECODING CLIP LATENTS FOR ZERO-SHOT CAPTIONING VIA TEXT-ONLY TRAINING

https://arxiv.org/pdf/2303.03032.pdf

ICLR2023接受的文章.也是做CLIP的改进,核心思想是训练一个Decoder来对CLIP text embedding进行重建.之后图像的embedding便可以转换至Text embedding空间,实现text captioning.这样的做法最大的优点就是免去了pair数据.


Prismer: A Vision-Language Model with An Ensemble of Experts

https://arxiv.org/pdf/2303.02506.pdf

组合多个大模型获得更强的能力.与昨天更新的一篇文章有些类似.


细粒度学习:

Fine-Grained Classification with Noisy Labels

https://arxiv.org/pdf/2303.02404.pdf

噪声标签学习和细粒度学习的结合.发表在CVPR2023,由于细粒度数据inter-class之间的差异非常小,导致造成的噪声会更严重.本文基于对比学习,分别提出了一个noise-tolerated的损失对noisy label进行纠正,其次提出一个高效的特征采样模块,帮助表征性能学习.










2023.03.07 ArXiv精选的评论 (共 条)

分享到微博请遵守国家法律