首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >每日学术速递6.29

每日学术速递6.29

作者头像
AiCharm
发布2023-07-26 19:59:02
发布2023-07-26 19:59:02
5710
举报
文章被收录于专栏:AiCharmAiCharm
CV - 计算机视觉 | ML - 机器学习 | RL - 强化学习 | NLP 自然语言处理

点击下方卡片,关注「AiCharm」公众号

Subjects: cs.CV

1.Aligning Large Multi-Modal Model with Robust Instruction Tuning

标题:用稳健的指令调谐大型多模态模型

作者:Fuxiao Liu, Kevin Lin, Linjie Li, Jianfeng Wang, Yaser Yacoob, Lijuan Wang

文章链接:https://arxiv.org/abs/2306.14565

项目代码:https://fuxiaoliu.github.io/LRV/

摘要:

尽管多模态任务取得了有希望的进展,但当前的大型多模态模型(LMM)很容易产生与相关图像和人类指令不一致的描述的幻觉。本文通过引入第一个大型且多样化的视觉指令调整数据集来解决这个问题,该数据集名为大规模鲁棒视觉(LRV)指令。我们的数据集由 GPT4 生成的 120k 视觉指令组成,涵盖 16 个具有开放式指令和答案的视觉和语言任务。与主要关注正面指令样本的现有研究不同,我们设计的 LRV-Instruction 包含正面和负面指令,以实现更稳健的视觉指令调整。我们的否定指令是在两个语义级别设计的:(i)不存在的元素操作和(ii)存在的元素操作。为了有效测量 LMM 产生的幻觉,我们提出了 GPT4 辅助视觉指令评估(GAVIE),这是一种评估视觉指令调整的新方法,无需人工注释的真实答案,并且可以适应不同的指令格式。我们进行了全面的实验来研究 LMM 的幻觉。我们的结果表明,现有的 LMM 在收到我们的负面指令(尤其是现有元素操作指令)时表现出明显的幻觉。此外,通过对 LRV-Instruction 上的 MiniGPT4 进行微调,与最先进的方法相比,我们使用更少的训练数据成功地减轻了幻觉,同时提高了公共数据集的性能。此外,我们观察到训练数据中正例和负例的平衡比例可以产生更稳健的模型。我们的项目链接可通过此 https URL 获取。

2.DragDiffusion: Harnessing Diffusion Models for Interactive Point-based Image Editing

标题:DragDiffusion:利用扩散模型进行交互式基于点的图像编辑

作者:Yujun Shi, Chuhui Xue, Jiachun Pan, Wenqing Zhang, Vincent Y. F. Tan, Song Bai

文章链接:https://arxiv.org/abs//2306.1443

项目代码:https://yujun-shi.github.io/projects/dragdiffusion.html

摘要:

精确可控的图像编辑是一项具有挑战性的任务,引起了人们的广泛关注。最近,DragGAN 实现了交互式基于点的图像编辑框架,并以像素级精度实现了令人印象深刻的编辑结果。然而,由于该方法基于生成对抗网络 (GAN),因此其通用性受到预训练 GAN 模型容量的上限。在这项工作中,我们将这样的编辑框架扩展到扩散模型并提出 DragDiffusion。通过利用大规模预训练扩散模型,我们极大地提高了交互式基于点的编辑在现实场景中的适用性。虽然大多数现有的基于扩散的图像编辑方法都适用于文本嵌入,但 DragDiffusion 优化了扩散潜伏以实现精确的空间控制。尽管扩散模型以迭代方式生成图像,但我们的经验表明,一步优化扩散潜伏足以生成连贯的结果,使 DragDiffusion 能够高效地完成高质量编辑。在各种具有挑战性的情况下(例如,多对象、不同的对象类别、各种样式等)进行的广泛实验证明了 DragDiffusion 的多功能性和通用性。

3.Supervised Pretraining Can Learn In-Context Reinforcement Learning

标题:有监督的预训练可以学习情境强化学习

作者:Jonathan N. Lee, Annie Xie, Aldo Pacchiano, Yash Chandak, Chelsea Finn, Ofir Nachum, Emma Brunskill

文章链接:https://arxiv.org/abs/2306.14892

摘要:

在不同数据集上训练的大型 Transformer 模型表现出了卓越的上下文学习能力,在未经过明确训练来解决的任务上实现了较高的小样本性能。在本文中,我们研究了变压器在决策问题中的上下文学习能力,即强盗和马尔可夫决策过程的强化学习(RL)。为此,我们引入并研究了决策预训练 Transformer (DPT),这是一种有监督的预训练方法,其中 Transformer 在给定查询状态和上下文交互数据集的情况下,在一组不同的任务中预测最佳操作。这个过程虽然简单,但却产生了具有多种令人惊讶的功能的模型。我们发现,预训练的 Transformer 可用于解决一系列上下文中的 RL 问题,表现出在线探索和离线保守性,尽管没有经过明确的训练。该模型还将预训练分布推广到新任务,并自动调整其决策策略以适应未知结构。从理论上讲,我们证明 DPT 可以被视为贝叶斯后验采样的有效实现,这是一种可证明样本高效的强化学习算法。我们进一步利用这种联系来保证 DPT 产生的上下文内算法的后悔,并证明它可以比用于生成预训练数据的算法更快地学习。这些结果表明了一条有前途但简单的途径,可以向 Transformer 灌输强大的上下文决策能力。

推荐阅读

CVPR 2023 | 神经网络超体?新国立LV lab提出全新网络克隆技术

2023-06-28

每日学术速递6.28

2023-06-28

CVPR 2023|All in UniSim:统一的自动驾驶仿真平台

2023-06-26

每日学术速递6.27

2023-06-27

点击卡片,关注「AiCharm」公众号

喜欢的话,请给我个在看吧!

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2023-06-29,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 推荐阅读
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档