arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-04 至 2025-12-04 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2508.03142 2025-12-04 cs.CV 83%

UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying

UniEdit-I: 基于迭代理解、编辑和验证的无训练图像编辑

Chengyu Bai, Jintao Chen, Xiang Bai, Yilong Chen, Qi She, Ming Lu, Shanghang Zhang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 UniEdit-I通过在语义潜在空间中引入迭代理解、编辑和验证循环,实现了无训练的闭环图像编辑,无需微调或架构修改即可达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00882 2025-12-04 cs.CV cs.AI 81%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03276 2025-12-04 cs.LG 77%

Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval

太迟回忆:多模态知识检索中双跳问题的解释

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta MATS

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.LG

AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01513 2025-12-04 cs.CR cs.CV 70%

SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism

SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) Southwestern University of Finance and Economics(西南财经大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Tongji University(同济大学)

专题命中 VLM训练与架构 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00887 2025-12-04 cs.CV 57%

Multilingual Training-Free Remote Sensing Image Captioning

多语言免训练 遥感图像描述生成

Carlos Rebelo, Gil Rocha, João Daniel Silva, Bruno Martins

机构 * INESC-ID(葡萄牙里斯本INESC-ID研究所) Instituto Superior Técnico(葡萄牙里斯本技术大学) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的多语言遥感图像描述生成方法,通过检索增强提示和图基重新排序策略,实现跨语言的高效描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03976 2025-12-04 cs.CL 50%

Adapting Large Language Models to Low-Resource Tibetan: A Two-Stage Continual and Supervised Fine-Tuning Study

将大型语言模型适应于低资源藏语:一种两阶段持续和监督微调研究

Lifeng Chen, Ryan Lai, Tianming Liu

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本研究通过两阶段方法将Qwen2.5-3B适应到藏语,通过持续预训练和监督微调提升翻译质量,实现低资源语言的模型适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10792 2025-12-04 cs.CL 50%

Finetune-RAG: Fine-Tuning Language Models to Resist Hallucination in Retrieval-Augmented Generation

Finetune-RAG: 通过微调语言模型抵抗检索增强生成中的幻觉

Zhan Peng Lee, Andre Lin, Calvin Tan

机构 * Pints AI Labs(Pints AI 实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 Finetune-RAG通过微调方法提升LLM事实准确性,提出首个RAG训练数据集和压力测试评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏