arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2602.09528 2026-02-11 cs.CV 79%

SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem

SchröMind: 通过求解薛定谔桥问题减轻多模态大语言模型中的幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research \& Development Center Co.,LTD., Beijing, China Fujitsu Limited, Tokyo, Japan

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 SchröMind通过求解薛定谔桥问题,有效减轻多模态大语言模型中的幻觉问题,提升模型在医疗等高风险领域的应用能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 79%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI 79%

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.AI

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16419 2026-02-05 cs.CL cs.CV 79%

Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning

通过强化微调学习多模态大语言模型中的领域知识

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai, China(人工智能大规模并行计算实验室,人工智能研究院,上海交通大学,上海)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出通过强化微调框架在优化层面整合领域知识,提升多模态大语言模型在专门领域任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01901 2026-02-03 cs.CV 79%

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型

Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 79%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00135 2026-02-03 cs.CV 79%

LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models

LLaVA-FA: 通过傅里叶近似压缩大型多模态模型

Pengcheng Zheng, Chaoning Zhang, Jiarong Mo, GuoHui Li, Jiaquan Zhang, Jiahao Zhang, Sihan Cao, Sheng Zheng, Caiyan Qin, Guoqing Wang, Yang Yang

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

AI总结 LLaVA-FA通过频域联合低秩和量化近似,实现高效压缩大型多模态模型,采用极坐标量化和对角校准方案,提升压缩效果与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00123 2026-02-03 cs.HC cs.CV 79%

Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models

视觉情感分析:利用视觉-语言模型预测图像观看者的感受

Filip Nowicki, Hubert Marciniak, Jakub Łączkowski, Krzysztof Jassem, Tomasz Górecki, Vimala Balakrishnan, Desmond C. Ong, Maciej Behnke

机构 * Faculty of Mathematics and Computer Science, Adam Mickiewicz University(数学与计算机科学学院,亚当·密茨凯维奇大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学) Department of Psychology, University of Texas at Austin(心理学系,德克萨斯大学奥斯汀分校) Cognitive Neuroscience Center, Adam Mickiewicz University(认知神经科学中心,亚当·密茨凯维奇大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在预测图像观众情感方面的性能,发现其在离散情绪分类上表现良好,但在连续评分预测中存在偏差,揭示了其在情感计算中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19139 2026-01-30 cs.LG cs.DC cs.ET 79%

Native LLM and MLLM Inference at Scale on Apple Silicon

在Apple Silicon上大规模原生LLM和MLLM推理

Wayner Barrios

机构 * Wiqonn Technologies(Wiqonn技术公司)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.LG

AI总结 vllm-mlx在Apple Silicon上实现高效LLM和MLLM推理,通过原生优化提升文本模型吞吐量并减少多模态延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20675 2026-01-29 cs.CV 79%

bi-modal textual prompt learning for vision-language models in remote sensing

双模文本提示学习用于遥感图像的视觉-语言模型

Pankhi Kashyap, Mainak Singha, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of Trento(特伦托大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 BiMoRS通过双模提示学习框架提升遥感图像视觉-语言模型的适应性与泛化能力。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR 79%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17818 2026-01-27 cs.CV 79%

ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning

ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型

Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17348 2026-01-27 cs.AI 79%

Auditing Disability Representation in Vision-Language Models

对视觉-语言模型中残障人表示的审计

Srikant Panda, Sourabh Singh Yadav, Palkesh Malviya

机构 * Lam Research

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在残障人表示上的表现,通过引入残障情境化提示和评估框架,发现残障情境会降低模型解释忠实度,并提出针对性提示和微调方法来改善模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14827 2026-01-22 cs.AI 79%

Measuring and Aligning Abstraction in Vision-Language Models with Medical Taxonomies

利用医学分类法测量和对齐视觉-语言模型中的抽象能力

Ben Schaper, Maxime Di Folco, Bernhard Kainz, Julia A. Schnabel, Cosmin I. Bercea

机构 * 1 School of Computation, Information Technology, Technical University of Munich, Germany 2 Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich, Germany 3 LTCI, Télécom Paris, Institut Polytechnique de Paris, France 4 Munich Center for Machine Learning (MCML) 5 School of Biomedical Engineering Imaging Sciences, King's College London, UK 6 Department of Artificial Intelligence in Biomedical Imaging, FAU Erlangen-Nuremberg, Germany 7 Department of Computing, Imperial College London, UK

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出通过医学分类法量化和缓解视觉-语言模型中的抽象错误,引入灾难性抽象错误概念,并通过风险约束阈值和分类法感知微调减少严重错误至2%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12042 2026-01-21 cs.CR cs.AI 79%

Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models

少即是多——直到它破裂:大视觉-语言模型中视觉标记压缩的安全隐患

Xiaomei Zhang, Zhaoxi Zhang, Leo Yu Zhang, Yanjun Zhang, Guanhong Tao, Shirui Pan

机构 * Griffith University(格里菲斯大学) University of Technology Sydney(悉尼技术大学) University of Utah(犹他大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

AI总结 本研究揭示了视觉标记压缩在大视觉-语言模型中显著降低鲁棒性的问题,并提出压缩感知攻击以系统研究该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05179 2026-01-14 cs.CV 79%

Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models

全局压缩指挥者:面向高分辨率大视觉-语言模型的即插即用推理加速

Xuyang Liu, Ziming Wang, Junjie Chen, Yuhang Han, Yingyao Wang, Jiale Yuan, Jun Song, Siteng Huang, Honggang Chen

机构 * Alibaba(阿里巴巴)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出GlobalCom²框架,通过全局缩略图引导局部裁剪压缩,实现高分辨率LVLMs的高效推理加速。

Comments Accepted by AAAI 2026. Code is available at \url{https://github.com/xuyang-liu16/GlobalCom2}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09779 2026-01-09 cs.CV 79%

MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models

MoIIE:多模态专家的混合模型用于大视觉语言模型

Dianyi Wang, Siyuan Wang, Zejun Li, Yikun Wang, Yitong Li, Duyu Tang, Xiaoyu Shen, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institut(上海创新研究院) University of Southern California(南加州大学) Huawei Technologies Co., Ltd(华为技术有限公司) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI 79%

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.AI

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16753 2026-01-07 cs.AI 79%

ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Completion

ELMM: 为多模态知识图谱补全设计的高效轻量多模态大语言模型

Wei Huang, Peining Li, Meiyu Liang, Xu Hou, Junping Du, Yingxia Shao, Guanhua Ye, Wu Liu, Kangkang Lu, Yang Yu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(计算机学院,北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ELMM通过多视图视觉标记压缩和注意力修剪策略,高效解决多模态知识图谱补全中的模态冲突和计算成本问题,实现最先进的性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17002 2026-01-05 cs.CV 79%

Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models

语义锚点传输:面向视觉-语言模型的鲁棒性测试时间适应

Shambhavi Mishra, Julio Silva-Rodriguez, Ismail Ben Ayed, Marco Pedersoli, Jose Dolz

机构 * LIVIA, ÉTS Montréal, Canada(LIVIA,蒙特利尔ÉTS,加拿大) International Laboratory on Learning Systems (ILLS), McGILL - ETS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Canada(学习系统国际实验室(ILLS),麦吉尔大学-ÉTS-MILA-CNRS-巴黎-萨克雷大学-中央超导大学,加拿大)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 语义锚点传输通过生成伪标签和多模板蒸馏方法,提升视觉-语言模型在分布偏移下的鲁棒性与计算效率。

Comments Added additional figures to communicate the algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 79%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23105 2026-01-01 cs.CV 79%

Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM

迈向遥感中全面交互变化理解:一个大规模数据集和双粒度增强VLM

Junxiao Xue, Quan Deng, Xuecheng Wu, Kelu Yao, Xinyi Yin, Fei Yu, Wei Zhou, Yanfei Zhong, Yang Liu, Dingkang Yang

机构 * Research Center for Space Computing System, Zhejiang Lab(浙江省实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) Liaoning University of Technology(辽宁科技学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉测绘遥感与信息工程国家重点实验室(LIESMARS)) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出ChangeIMTI数据集和ChangeVG模型,通过双粒度增强方法提升遥感图像变化理解的准确性和交互性。

Comments Junxiao Xue, Quan Deng, and Xuecheng Wu deserve equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23572 2025-12-30 cs.CL cs.CV 79%

Instruction-Following Evaluation of Large Vision-Language Models

大视觉-语言模型的指令遵循评估

Daiki Shiono, Shumpei Miyawaki, Ryota Tanaka, Jun Suzuki

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究评估了大视觉-语言模型在微调后的指令遵循能力,发现其能力下降并分析了原因,提出通过包含输出格式指示的训练数据集可缓解此问题。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21860 2025-12-29 cs.CV 79%

Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models

无需训练的条件图像嵌入框架利用大型视觉语言模型

Masayuki Kawarada, Kosuke Yamada, Antonio Tejero-de-Pablos, Naoto Inoue

机构 * CyberAgent, Japan(日本CyberAgent公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出DIOR,一种无需训练的条件图像嵌入方法,利用大型视觉语言模型生成条件图像嵌入,有效提升图像条件相似性任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 79%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18496 2025-12-23 cs.CV 79%

Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models

Adaptive-VoCo: 用于视觉-语言模型的复杂度感知视觉标记压缩

Xiaoyang Guo, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 Adaptive-VoCo通过动态压缩视觉标记提升视觉-语言模型的效率与鲁棒性

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 79%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12998 2025-12-19 cs.CV 79%

PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching

PerTouch:基于VLM的个性化和语义图像润色代理

Zewei Chang, Zheng-Peng Duan, Jianxing Zhang, Chun-Le Guo, Siyu Liu, Hyungju Chun, Hyunhee Park, Zikun Liu, Chongyi Li

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 PerTouch通过VLM驱动代理实现个性化和语义图像润色,结合语义替换与参数扰动机制,提升用户意图匹配与长期偏好捕捉能力。

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 79%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12089 2025-12-16 cs.CV cs.CL 79%

VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering

VEGAS: 通过视觉编码器注意力引导的自适应转向来缓解大视觉-语言模型中的幻觉

Zihu Wang, Boxun Xu, Yuxuan Xia, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 VEGAS通过整合视觉编码器注意力图并自适应引导标记,有效缓解大视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏