arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-29 至 2025-12-29 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2512.19443 2025-12-29 cs.CV 85%

D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning

D2Pruner: 用于MLLM标记剪枝的去偏重要与结构多样性

Evelyn Zhang, Fufu Yu, Aoqi Wu, Zichen Wen, Ke Yan, Shouhong Ding, Biqing Qi, Linfeng Zhang

机构 * Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 VLM训练与架构 :MLLM(title);LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract)

AI总结 D2Pruner通过结合去偏重要与结构剪枝机制,有效提升MLLM标记剪枝的效率和保真度,尤其在细粒度定位任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21529 2025-12-29 cs.CV cs.AI 84%

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 83%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21860 2025-12-29 cs.CV 79%

Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models

无需训练的条件图像嵌入框架利用大型视觉语言模型

Masayuki Kawarada, Kosuke Yamada, Antonio Tejero-de-Pablos, Naoto Inoue

机构 * CyberAgent, Japan(日本CyberAgent公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出DIOR,一种无需训练的条件图像嵌入方法,利用大型视觉语言模型生成条件图像嵌入,有效提升图像条件相似性任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21985 2025-12-29 cs.CV cs.AI 62%

LVLM-Aided Alignment of Task-Specific Vision Models

通过大视觉语言模型辅助对齐任务特定视觉模型

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 通过大视觉语言模型辅助对齐任务特定视觉模型,提升模型与人类规范的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 57%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21508 2025-12-29 cs.CV 57%

Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification

固定预算参数高效训练结合冻结编码器提升多模态胸片分类

Md Ashik Khan, Md Nahid Siddique

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur, India(计算机科学与工程系,印度理工学院Kharagpur分校) Knight Foundation School of Computing and Information Sciences, Florida International University, Florida, USA(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究通过冻结编码器的参数高效训练策略,在降低计算成本的同时提升了多模态胸片分类的性能。

Comments Accepted at the 2025 28th International Conference on Computer and Information Technology (ICCIT). 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG 57%

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏