arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-16 至 2025-12-16 共收录 50 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 1 篇

2512.12500 2025-12-16 cs.HC cs.AI 57%

Explainable AI as a Double-Edged Sword in Dermatology: The Impact on Clinicians versus The Public

可解释AI在皮肤科中的双刃剑作用:对医生与公众的影响

Xuhai Xu, Haoyu Hu, Haoran Zhang, Will Ke Wang, Reina Wang, Luis R. Soenksen, Omar Badri, Sheharbano Jafry, Elise Burger, Lotanna Nwandu, Apoorva Mehta, Erik P. Duhaime, Asif Qasim, Hause Lin, Janis Pereira, Jonathan Hershon, Paulius Mui, Alejandro A. Gru, Noémie Elhadad, Lena Mamykina, Matthew Groh, Philipp Tschandl, Roxana Daneshjou, Marzyeh Ghassemi

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究探讨了可解释AI在皮肤科诊断中的影响,发现不同专业背景的人对XAI的反应不同,LLM在医疗AI中具有双刃剑效应。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 16 篇

2512.12690 2025-12-16 cs.LG cs.CL cs.CV 84%

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 84%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 79%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12089 2025-12-16 cs.CV cs.CL 79%

VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering

VEGAS: 通过视觉编码器注意力引导的自适应转向来缓解大视觉-语言模型中的幻觉

Zihu Wang, Boxun Xu, Yuxuan Xia, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 VEGAS通过整合视觉编码器注意力图并自适应引导标记,有效缓解大视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 79%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12885 2025-12-16 cs.CV cs.AI cs.CL cs.IR cs.RO 73%

SignRAG: A Retrieval-Augmented System for Scalable Zero-Shot Road Sign Recognition

SignRAG:一种用于可扩展零样本道路标志识别的检索增强系统

Minghao Zhu, Zhihao Zhang, Anmol Sidhu, Keith Redmill

机构 * Computer Engineering The Ohio State University(计算机工程 俄亥俄州立大学) Applied Research Transportation Research Center Inc.(应用研究 交通运输研究中心公司) Computer Engineering The Ohio State University Columbus, Ohio, USA(计算机工程 俄亥俄州立大学 哥伦布俄亥俄州) Applied Research Transportation Research Center Inc. East Liberty, Ohio, USA(应用研究 交通运输研究中心公司 埃斯特利比 俄亥俄州)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SignRAG通过检索增强生成范式实现可扩展的零样本道路标志识别,结合视觉语言模型和大型语言模型,实现高准确率的标志识别。

Comments Submitted to IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04564 2025-12-16 cs.CV 70%

Conditional Representation Learning for Customized Tasks

基于条件的表示学习用于定制任务

Honglin Liu, Chao Sun, Peng Hu, Yunfan Li, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) National Key Laboratory of Fundamental Algorithms and Models for Engineering Numerical Simulation, Sichuan University(四川大学工程数值模拟基础算法与模型国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出条件表示学习(CRL),通过生成描述性文本构建语义基底,将图像表示投影到定制特征空间,以提升定制任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13380 2025-12-16 cs.RO 67%

Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning

通过演示编辑强化学习实现通用灵巧功能抓取

Chuan Mao, Haoqi Yuan, Ziye Huang, Chaoyi Xu, Kai Ma, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本研究提出DemoFunGrasp,通过演示编辑强化学习实现通用灵巧功能抓取,提升抓取性能和现实泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 67%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 62%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12560 2025-12-16 cs.CV cs.AI 62%

StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding

StreamingAssistant: 为加速在线视频理解的高效视觉标记修剪

Xinqi Jin, Hanxun Yu, Bohan Yu, Kebin Liu, Jian Liu, Keda Tao, Yixuan Pei, Huan Wang, Fan Dang, Jiangchuan Liu, Weiqiang Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Westlake University(西湖大学) Beijing Jiaotong University(北京交通大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 StreamingAssistant通过高效视觉标记修剪技术,提升在线视频理解的准确性和效率,减少GPU内存使用和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13072 2025-12-16 cs.CV 57%

Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

锻造动态记忆:基于检索的持续学习用于通用医学基础模型

Zizhi Chen, Yizhen Gao, Minghao Han, Yizhou Liu, Zhaoyu Chen, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(Fysics智能技术有限公司(Fysics AI)) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于检索的持续学习方法,通过动态知识蒸馏和RAG技术,解决多模态医学模型在领域迁移和细粒度特征保留中的核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12503 2025-12-16 cs.AI 57%

KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs

KidsArtBench: 多维度儿童艺术评估与属性感知的大语言模型

Mingrui Ye, Chanjin Zheng, Zengyi Yu, Chenyu Xiang, Zhixue Zhao, Zheng Yuan, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) East China Normal University(东华大学) University of Sheffield(谢菲尔德大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 KidsArtBench通过属性感知的多LoRA方法提升儿童艺术评估的准确性与教育意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07128 2025-12-16 cs.CV 57%

MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP

MulCLIP: 一种多级对齐框架,用于增强细粒度长上下文CLIP

Chau Truong, Hieu Ta Quang, Dung D. Le

机构 * FPT Software AI Center(FPT软件人工智能中心) VinUniversity(文大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 MulCLIP通过多级对齐框架提升细粒度长上下文CLIP的性能,采用标记重建和子描述聚合策略增强语义连接与上下文提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11187 2025-12-16 cs.CV 57%

FastVID: Dynamic Density Pruning for Fast Video Large Language Models

FastVID: 动态密度修剪用于快速视频大语言模型

Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 FastVID通过动态密度修剪技术,显著降低视频大语言模型的计算开销,同时保持高准确性,实现高效的视频处理性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00522 2025-12-16 cs.CL 50%

Efficiently Seeking Flat Minima for Better Generalization in Fine-Tuning Large Language Models and Beyond

高效寻找平坦极小值以提升大型语言模型及其他模型的泛化能力

Jiaxin Deng, Qingcheng Zhu, Junbiao Pang, Linlin Yang, Zhongqian Fu, Baochang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出EFMLoRA,通过寻找LoRA的平坦极小值提升模型泛化能力,实验表明其在效率和性能上均优于传统LoRA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 3 篇

2512.12268 2025-12-16 cs.CV 79%

MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models

MetaTPT: 用于视觉-语言模型的元测试时间提示微调

Yuqing Lei, Yingjun Du, Yawen Huang, Xiantong Zhen, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academic of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) AIM Lab, University of Amsterdam(阿姆斯特丹大学AIM实验室) Jarvis Research Center, Tencent Youtu Lab(腾讯优图实验室 Jarvis 研究中心) Central Research Institue, United Imaging Healthcare Co., Ltd(联合影像医疗科技有限公司中央研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 MetaTPT通过元学习框架结合自监督任务和提示微调,提升视觉-语言模型在领域偏移下的测试时间适应性,实现领域泛化和跨数据集的高性能表现。

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15871 2025-12-16 cs.CV 79%

Visual symbolic mechanisms: Emergent symbol processing in vision language models

视觉符号机制:视觉语言模型中的涌现符号处理

Rim Assouel, Declan Campbell, Yoshua Bengio, Taylor Webb

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

AI总结 研究揭示了视觉语言模型中通过内容无关空间索引实现的新兴符号机制,用于解决视觉绑定问题并减少模型错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23065 2025-12-16 cs.CL 71%

SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services

SNS-Bench-VL:在社交网络服务中评估多模态大语言模型的基准测试

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Anjie Le, Lei Li, Zhoujun Li

专题命中 其他VLM :multimodal large language model(title)

AI总结 SNS-Bench-VL是一个用于评估多模态大语言模型在社交网络服务中性能的基准测试,涵盖8个多模态任务,包含4001个问题-答案对,评估25种先进模型,揭示多模态社交理解的挑战。

Comments We found problems in the code while rechecking our implementation. These issues led to noticeable numerical discrepancies, making some of the reported results and conclusions potentially unreliable. Therefore, we request to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏