arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-17 至 2026-08-17 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 83%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 57%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 57%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2604.08990 2026-08-17 cs.CV 版本更新 83%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21114 2026-08-17 cs.CV 版本更新 57%

CVT-Bench: Probing Spatial-State Integrity through Counterfactual Viewpoint Transformations

CVT-Bench:反事实视角变换揭示多模态大语言模型中不稳定的空间表征

Shanmukha Vellamcheti, Uday Kiran Kothapalli, Disharee Bhowmick, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯杜大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 CVT-Bench通过控制诊断基准评估多模态大语言模型在反事实视角变换下的关系一致性,发现尽管单视角准确率高,但系统在反事实视角变换下存在系统性退化,揭示了表征结构对反事实空间推理的重要性。

Comments Reframed CVT-Bench around spatial-state integrity, added real-world benchmark derived from 3dSGG, context controls and other minor changes. 21 pages, 10 figures, 15 tables. Project page: https://shanmukha-here.github.io/CVT-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08151 2026-08-17 cs.CV cs.MM 版本更新 57%

Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合

Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。

Comments CVPR Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 89%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at https://idan-tankel.github.io/InformCT_ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15732 2026-08-17 cs.CV 版本更新 88%

IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models

IoUPD:用于多模态大语言模型视觉定位的IoU感知特权蒸馏

Xiuyuan Zhu, Ke Lu, Hao Wu, Siwen Jiao, Zijin Du, Dongming Zhang, Jian Xue

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Communication Content Cognition(通信内容认知技术国家重点实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 研究多模态大语言模型视觉定位中训练与评估不匹配问题,提出IoUPD方法,利用真实框作特权指导,训练时学生模型接收原始信息,教师模型接收增强提示,经监督微调与特权蒸馏损失训练,推理时无需额外模块,实验显示该方法有改进。

Comments 16 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01785 2026-08-17 cs.CL cs.SE 版本更新 71%

Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding

CodeOCR: 关于视觉语言模型在代码理解中的有效性

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, Xiaodong Gu

机构 * Shanghai Jiao Tong University China Hohai University China Singapore Management University Singapore Imperial College London United Kingdom East China Normal University \& Shanghai Innovation Institute China Chongqing University China Shanghai Jiao Tong University Hohai University Singapore Management University Imperial College London East China Normal University \& Shanghai Innovation Institute Chongqing University

专题命中 视觉定位与Grounding :vision language model(title)

AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。

Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01189 2026-08-17 cs.AI 版本更新 70%

NEURON: A Neuro-symbolic System for Grounded Clinical Explainability

NEURON:一种面向临床可解释性的神经符号系统

Anuradha Chandrasekaran, Dimitrios Zikos, Mutlu Mete, Alan Pang, Brady D. Lund, Kewei Sha

机构 * University of North Texas(北卡罗来纳大学达顿分校) Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-17 cs.LG 版本更新 57%

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 50%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2602.21956 2026-08-17 cs.CV 版本更新 70%

Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs

Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2608.08904 2026-08-17 cs.CV cs.AI cs.LG 版本更新 89%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 GUI与屏幕智能体 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新 73%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 1 篇

2606.23132 2026-08-17 cs.CV 版本更新 83%

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导

Jaehyuk Jang, Minseok Seo, Seungju Cho, Kangwook Ko, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2608.03471 2026-08-17 cs.CV 版本更新 87%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 VLM训练与架构 :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12498 2026-08-17 cs.CV 版本更新 79%

NAST: Improving Negation Handling in Medical Vision-Language Models through Negation-Aware Selective Training

针对医学视觉-语言模型中否定处理改进的分层微调

Ali Abbasi, Mehdi Taghipour, Rahmatollah Beheshti

机构 * University of Delaware(德克萨斯大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出NAST方法,通过因果追溯效应调节逐层梯度更新,提升医学视觉-语言模型对否定处理的识别能力,同时保持一般视觉-语言对齐。

Comments 16 pages, 6 figures. Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28642 2026-08-17 cs.AI 版本更新 77%

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

带宽高效且隐私保护的边缘-云多对多语音翻译

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出边缘-云协同框架ESRT,通过分割推理架构压缩中间特征实现带宽降低10倍和语音隐私保护,并采用多任务加权课程学习策略实现45种语言的多对多语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 77%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: https://junwoonlee.github.io/projects/LatentAM/ Code: https://github.com/UMich-SSI-Lab/latentam

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02078 2026-08-17 cs.RO 版本更新 75%

Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot

Genie Sim 3.0:人形机器人综合仿真平台

Chenghao Yin, Da Huang, Di Yang, Jichao Wang, Nanshu Zhao, Chen Xu, Wenjun Sun, Linjie Hou, Zhijun Li, Junhui Wu, Zhaobo Liu, Zhen Xiao, Sheng Zhang, Lei Bao, Rui Feng, Zhenquan Pang, Jiayu Li, Qian Wang, Maoqing Yao

机构 * AgibotTech(Agibot科技)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 Genie Sim 3.0通过高保真场景生成和开放数据集,提升机器人学习模型的泛化能力与仿真到现实的迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏