arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 78 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2608.20607 2026-08-31 cs.CL cs.AI cs.LG 版本更新 62%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 08/2026. 21 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-08-31 cs.CV cs.AI 版本更新 62%

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交 57%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28363 2026-08-31 cs.AI 新提交 57%

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

EvoUndo:面向大语言模型智能体执行框架的可恢复性约束自进化

Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体自进化的可恢复性问题,提出EvoUndo框架,通过协同设计验证、状态落地等,在600个任务中实现高比例的失败变更恢复,且效应存在模型依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 57%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27840 2026-08-31 cs.AI cs.IR 新提交 57%

An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark

大规模基准下跨城市兴趣点(POI)推荐的实证评估

Peibo Li, Yang Song, Hao Xue, Maarten de Rijke, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文以大规模基准Trip World开展跨城市POI推荐实证评估,发现现有SOTA方法存在三个瓶颈,且适配的智能体方法效果不佳,凸显需设计任务特定的跨城市推荐方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27675 2026-08-31 cs.AI 新提交 57%

Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community

面向所有人的智能体:分布式整理社区中构建智能体AI能力的研讨会框架

Seth Carbon, Sierra Moxon, Kimberly Van Auken, Pascale Gaudet, Christopher J. Mungall

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对智能体AI应用于生物数据库整理的障碍,构建了基于JupyterHub与Claude Code的云环境及含四个模块的研讨会,证明其可提升分布式社区的智能体AI整理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27668 2026-08-31 cs.CV 新提交 57%

Report Supervision

报告监督

Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal, Jieneng Chen, Xinze Zhou, Zheren Zhu, Chuntung Zhuanga, Sergio Decherchi, Andrea Cavalli, Kang Wang, Yang Yang, Alan Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) University Hospital Basel(巴塞尔大学医院) Stanford University(斯坦福大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Italian Institute of Technology(意大利技术研究院) University of Bologna(博洛尼亚大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。

Comments Published in Medical Image Analysis, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-31 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17685 2026-08-31 physics.geo-ph eess.SY 版本更新 50%

A Reproducible Method for Mapping Electricity Transmission Infrastructure for Space Weather Risk Assessment

一种可重复的方法用于空间天气风险评估中的电力输电基础设施映射

Dennies K. Bor, Edward J. Oughton, Evan A. Peters, Noah Rivera, C. Trevor Gaunt, Robert Weigel, Michael Wiltberger

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种可重复的方法,通过开放源码子站数据收集,利用创新的网页浏览器平台将OpenStreetMap子站位置转换为高分辨率的电力输电资产映射,用于空间天气风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 4 篇

2608.27531 2026-08-31 cs.CR cs.CV 新提交 79%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27753 2026-08-31 cs.CV 新提交 77%

What Can Low Resource Languages Learn From Each Other?

低资源语言能从彼此间学到什么?

Achyuth P, Kahaan Shah, Chetan Arora

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对低资源语言OCR数据稀缺问题,提出PSMC框架,通过融合语言特定专家实现知识迁移,在10种印度文字上使词识别率平均提升约2%。

Comments 16 pages, 4 Tables, 6 Figures. To appear at ICDAR 2026. This version predates reviewer revisions. A revised version will be posted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28248 2026-08-31 cs.CV cs.CL 新提交 70%

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

Synth-JDoc:用于OCR的、包含多样布局与嵌入图像的日文文档图像数据集合成

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(信息学研究所) NII LLMC(信息学研究所语言媒体研究中心)

专题命中 文档图表理解 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究构建了含多样布局与嵌入图像的日文文档合成OCR数据集,可有效提升大型视觉语言模型读取竖排日文文本的性能,相关资源已公开。

Comments Accepted to ICDAR 2026, 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-31 cs.IR 版本更新 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Qiyi Jiang, Junwei Zhou, Xiaoyu Cao, Weiyao Wang, Yiwei Xu, Ziyan Zhao, Zhen Sun, Qicheng Zhu, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yunhai Hu, Nan Du

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2608.27793 2026-08-31 cs.RO 新提交 90%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 77%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-31 cs.RO cs.CV 版本更新 77%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures. v2: updated Funding section

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 75%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27550 2026-08-31 cs.RO cs.CV 新提交 70%

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

超越数据缩放:面向视觉-语言-动作模型的以表示为中心的持续预训练

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对VLA模型数据扩展的瓶颈,提出以表示为中心的持续预训练方法VLAct,在多具身机器人数据上训练后,在多项基准任务中超越现有工业级系统,在未见具身迁移任务中仅用20%数据即优于全数据基线,为VLA进展提供新方向。

Comments All models and training pipelines are publicly available at this https URL (https://starvla.github.io/VLAct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 67%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-08-31 cs.AI 版本更新 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 6 篇

2606.20419 2026-08-31 cs.CV 版本更新 90%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Published at the Workshop on Actionable Interpretability at COLM 2026, EMNLP Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新 87%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28058 2026-08-31 cs.CV cs.AI 新提交 81%

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

用于减轻大型视觉语言模型幻觉的动态对齐补偿

Kairong Yu, Zixin Zhu, Le Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对大型视觉语言模型的幻觉问题,提出无需训练的推理时方法动态对齐补偿,结合分层语义补偿与序列语义校正,在9个多模态基准上可减少幻觉并保持整体性能。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28145 2026-08-31 cs.CV 新提交 79%

Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models

用于视觉语言模型无源域适应的带原型锚定校准的双流语义引导

Weiwei Xiang, Shun Peng, Guangyi Xiao, Hao Chen, Lei Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机与电子工程学院) Huaihua University(怀化学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对无源全自由域适应的双语义漂移问题,提出DSSG框架及带原型锚定校准的DSSG-PAC,在多基准上性能优于SOTA且适配时间降低18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27502 2026-08-31 cs.SE cs.CV 新提交 70%

Image Augmentation as Test Generation for Deep Learning-Based Image Retrieval Systems

图像增强作为深度学习图像检索系统的测试生成方法

Yehan De Silva, Anirudh Sridhar, Armin Lotfy, Nafiseh Kahani, Yvan Labiche, Ziyu Wang, Frank Ouyang, Clare Carty, Azalia Shamsaei

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 该研究将图像增强技术作为深度学习图像检索系统的测试生成方法,通过实证研究筛选出天气模拟和SaSPA等适配的增强技术,为构建有效测试套件提供了实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 50%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 18 篇

2603.28387 2026-08-31 cs.AI cs.LG 版本更新 91%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28218 2026-08-31 cs.CV 新提交 91%

Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance

聚焦关键之处:面向低视力辅助的显著性驱动视觉-语言模型

Jiazhao Liang, Hao Huang, Shuaihang Yuan, Congcong Wen, Geeta Chandra Raju Bethala, Giles Hamilton-Fletcher, Yu Hao, John-Ross Rizzo, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Abu Dhabi(纽约大学阿布扎比分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) NYU Langone Health(纽约大学兰贡医疗中心) Harvard University(哈佛大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视觉-语言模型未建模人类感知优先级的问题,提出显著性驱动的Salience-LLaVA模型,构建三个显著性数据集并引入SCMI评估,部署于辅助眼镜实现低视力辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28138 2026-08-31 cs.CV 新提交 89%

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型

Xiaoyang Guo, Guoping Luo, Jusheng Zhang, Keze Wang, Wenhao Wang

机构 * Sun Yat-sen University(中山大学) The University of British Columbia(不列颠哥伦比亚大学) Vast Intelligence Lab(威斯特智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出令牌预算蒸馏(TBD)框架,通过双路径师生设计结合LoRA适配器与FlashVID压缩,在固定令牌预算下适配视频VLMs,大幅压缩令牌时仍能保留高语义性能,在多基准测试中优于仅压缩基线。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏