arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 183 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 12 篇

2608.21832 2026-08-25 cs.CL 新提交 78%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 GUI与屏幕智能体 :grounding(title);vision-language model(abstract)

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23503 2026-08-25 cs.CV 新提交 77%

Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search

用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序

Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。

Comments Accepted to the AI City workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23478 2026-08-25 cs.RO cs.AI cs.CV 新提交 73%

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

依意图行动:为视觉-语言-动作模型提炼行为意图

Sangoh Lee, Sangwoo Mo, Wook-Shin Han

机构 * POSTECH(浦项科技大学) GSAI, POSTECH(浦项科技大学人工智能学院) IME, POSTECH(浦项科技大学工程学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文针对视觉-语言-动作(VLA)模型动作解码器未明确行为语义目标的问题,提出INDI方法提炼行为级意图,在多个基准及真实任务中显著提升了GR00T-N1.7的性能。

Comments Project page: https://leesangoh.github.io/indi-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-08-25 cs.CV cs.LG 版本更新 73%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Kangwei Liu, Sanyi Zhang, Zhangcheng Wang, Shiming Liu, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21460 2026-08-25 cs.CV cs.AI 新提交 62%

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

FigmaTrace:捕捉人类Figma设计工作流程中的创意细节

Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

机构 * Patronus AI

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究构建了FigmaTrace数据集,训练模型后其在四个分布外智能体GUI环境中性能可与前沿闭源模型媲美,且通过定性分析关联了性能提升与数据集的趋势,同时开源了数据集和最佳模型。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/figmatrace Model: https://huggingface.co/PatronusAI/Qwen3.8-27B-Figmatrace-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17885 2026-08-25 cs.CV cs.AI cs.RO 版本更新 62%

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

PEAfowl:感知增强的多视角视觉-语言-动作用于双臂操作

Qingyu Fan, Zhaoxiang Li, Jinrui Hu, Yi Lu, Wang Chen, Qiu Shen, Xiao-xiao Long, Yinghao Cai, Tao Lu, Shuo Wang, Xun Cao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 PEAfowl通过增强感知的多视角视觉-语言-动作策略,提升双臂操作在复杂环境中的稳定性和成功率。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2026. This version includes an extended appendix with additional implementation details, deployment analysis, robustness evaluation, and real-world evaluation protocol. DOI: 10.1109/LRA.2026.3726379

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22972 2026-08-25 cs.CV 新提交 57%

Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution

优化手术三元组识别:一种知识驱动的混合专家解决方案

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对手术三元组识别的三大冲突问题,提出MoeCo框架,通过组件定制适配器、协同梯度学习及知识驱动混合专家机制,在CholecT45和CholecT50数据集上验证了方法的有效性与优越性。

Comments Accepted in TMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22869 2026-08-25 cs.RO cs.CV 新提交 57%

UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models

UniMem:统一视觉-语言-动作模型的多模态记忆与控制

Lars Osterberg, Maggie Wang, Mac Schwager

机构 * Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV

AI总结 UniMem 是统一多模态记忆与控制的视觉-语言-动作模型框架,通过事件分类器、关键帧编码器等技术,在模拟和硬件任务中性能优于基线,推理更快、训练流程更简单。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21830 2026-08-25 cs.AI 新提交 57%

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

超越成功与失败:面向GUI智能体的长度感知对比学习

Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Baidu Inc.(百度公司) University of Alberta(阿尔伯塔大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对GUI智能体现有对比RLVR方法无法捕获轨迹细粒度质量差异的问题,提出LACL-GUI框架,引入轨迹级质量信号,在基准测试中实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22896 2026-08-25 cs.RO 新提交 50%

SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation

SuperMap:用于视觉-语言导航的时空SLAM系统

Shibo Zhao, Guofei Chen, Honghao Zhu, Zhiheng Li, Changwei Yao, Nader Zantout, Seungchan Kim, Wenshan Wang, Ji Zhang, Sebastian Scherer

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出SuperMap,一种结合几何SLAM与开放词汇感知的4D时空建图框架,用于视觉-语言导航,可稳定维护目标身份,经基准与真实机器人验证后开源。

Journal ref Proceedings of Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 16 篇

2608.22263 2026-08-25 cs.CV cs.AI 新提交 90%

Training-Free VLM Personalization via Calibrated Residual Decoding

基于校准残差解码的无训练VLM个性化方法

Jiaao Yu, Yujian Ma, Xianming Hu, Pengran Wang, Ang Li

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练校准残差解码框架,通过构建三类证据条件估计个性化边际贡献,经实验在多数据集上提升了VLM的个性化多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交 90%

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 87%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23928 2026-08-25 cs.LG cs.AI 版本更新 86%

HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models

HiViS: 为视觉语言模型中的推测解码隐藏视觉标记

Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * C 2 DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AIRIA City University of Hong Kong(香港城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HiViS通过隐藏视觉标记,提升视觉语言模型在推测解码中的生成效率和速度。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09846 2026-08-25 cs.RO 版本更新 83%

Whole-Body Bilateral Teleoperation with Multi-Stage Object Parameter Estimation for Wheeled Humanoid Locomanipulation

用于轮式人形机器人运动操作的多阶段物体参数估计的全身双边遥操作

Donghoon Baek, Amartya Purushottam, Jason J. Choi, Joao Ramos

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究提出结合多阶段物体惯性参数估计的轮式人形机器人全身双边遥操作框架,通过视觉、VLM与分层采样实现参数估计,提升遥操作的动态性与操作跟踪精度,可实时完成约1/3体重载荷的相关任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22312 2026-08-25 cs.CL 新提交 82%

Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models

面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动

Wenyun Li, Guiping Cao, Xiangyuan Lan, Zheng Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。

Comments Accept by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21415 2026-08-25 cs.CL cs.AI 新提交 79%

Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding

基于反事实集成解码缓解大视觉语言模型中的偏差

Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu

机构 * State Key Lab of Software Development Environment, Beihang University(北京航空航天大学软件开发环境国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 该研究针对大视觉语言模型的社会偏差问题,提出反事实集成解码框架,通过构建多群体反事实视角并集成解码,在三类基准上实现最高47.97%的偏差降低,同时保留模型核心能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21577 2026-08-25 cs.LG cs.AI 新提交 79%

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

锚定偏差:一种针对持续学习下多模态大语言模型(MLLMs)的持久公平性后门攻击

Yuyang Luo, Kai Shu

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对持续学习下的多模态大语言模型,研究人员提出持久公平性后门攻击,通过两种机制注入持久群体歧视,该攻击能规避标准防御且在多轮持续学习中留存。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23563 2026-08-25 cs.CV cs.AI 新提交 73%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-08-25 cs.CV cs.AI 版本更新 62%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A. M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22652 2026-08-25 cs.SE cs.AI 新提交 57%

Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code

评估针对大语言模型生成代码中包幻觉的推理时防御措施

Alberick Euraste Djire, Iyiola E. Olatunji, Melissa Tessa, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22370 2026-08-25 cs.CV 新提交 57%

LiST: Local-Simplex Test-Time LoRA Fusion

LiST:局部单纯形测试时LoRA融合

Yihua Shao, Jia Li, Siyu Chen, Xinyu Luo, Yang Liu, Kecheng Chen, Xinwei Long, Lingyu Zhu, Fanhu Zeng, Maolin Wang, Ziyang Yan, Jingcai Guo, Hao Tang, Nicu Sebe, Zhenyi Wang

机构 * SUSTech(南方科技大学) PolyU(香港理工大学) CASIA(中国科学院自动化研究所) GDUT(广东工业大学) CityU(香港城市大学) BigAI(北京智源人工智能研究院) THU(清华大学) TAU(特拉维夫大学) PKU(北京大学) UniTrento(特伦托大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。

Comments Accepted by EMNLP 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交 57%

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21529 2026-08-25 cs.CV cs.CL cs.IR 新提交 57%

DamageScope: Vision-Language Retrieval at Scale for Disaster Damage Assessment from Satellite Imagery

DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法

Ravi K. Rajendran, Biplob Debnath, Murugan Sankaradas, Srimat T. Chakradhar

机构 * NEC Laboratories America(美国 NEC 实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新 57%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交 50%

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 28 篇

2608.21762 2026-08-25 cs.CV cs.CL 新提交 91%

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

重新学习观察:面向视觉语言模型的自由格式裁剪重路由的损失间隙监督

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出GapSight框架,利用损失间隙监督让VLMs选择性重读图像局部区域,在多个基准测试中显著提升了LLaVA、InternVL2.5等VLMs的细节类任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23253 2026-08-25 cs.CV cs.AI 新提交 89%

E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models

E2S-Pruner:用于视觉-语言模型中视觉令牌剪枝的渐进式两阶段证据融合方法

Taoyu Qian, Qi Wang, Daqian Shi, Yuanhao Jiang, Shang Gao, Hualong Yu

机构 * Digital Environment Research Institute (DERI), Queen Mary University of London(伦敦大学玛丽女王学院数字环境研究所(DERI)) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) National Institute of Education, Nanyang Technological University(南洋理工大学国家教育学院) School of Computer Science and Engineering, Jiangsu University of Science and Technology(江苏科技大学计算机科学与工程学院)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需额外参数或微调的E2S-Pruner,通过两阶段证据融合实现视觉-语言模型的视觉令牌剪枝,在LLaVA-1.5-7B上显著提升吞吐量并保留性能,且具跨模型泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22833 2026-08-25 cs.MA cs.AI 新提交 89%

Minimal Local Simulation Foundations for LLM- and VLM-Driven Agents in 2D and 3D Environments

用于二维和三维环境中大型语言模型(LLM)与视觉语言模型(VLM)驱动智能体的极简局部仿真基础

Ryuki Hyodo

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 该研究提出SD-AgentFoundry-2D和3D两款极简仿真基础,可在多系统本地运行,用于教育与快速原型设计,为学习生成式社会仿真及构建特定领域扩展提供便捷起点。

Comments GitHub Repositories: https://github.com/ryukih/SD-AgentFoundry-2D and https://github.com/ryukih/SD-AgentFoundry-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04001 2026-08-25 cs.CV 版本更新 89%

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos

Sa2VA:将SAM2与多模态大语言模型结合用于图像与视频的密集接地理解

Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Bytedance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(title,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Sa2VA,结合SAM2与MLLM实现图像视频密集接地理解,引入Ref-SAV数据集,在多任务中表现优异且可扩展至多款开源MLLM,代码模型已公开。

Comments Accepted by IEEE TPAMI. Code: https://github.com/Bytedance/Sa2VA

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏