arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 73 篇

2608.29974 2026-09-01 cs.CV cs.CL 新提交 92%

SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models

SpanCalib-VLM:视觉语言模型中经过校准的幻觉跨度检测

Amanuel Gizachew Abebe, Yasmin Moslem

机构 * Shaggar Institute of Technology(沙加尔理工学院) Trinity College Dublin(都柏林圣三一学院)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出SpanCalib-VLM混合双系统,结合多模态序列标注器与微调生成式VLM,经联合校准融合策略优化,在SHROOM-Visions任务上实现幻觉跨度的高效校准检测,公开了模型权重与代码。

Comments Shroom-Visions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30935 2026-09-01 cs.RO cs.AI 新提交 91%

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0:激发视觉语言模型的空间智能以实现通用具身导航

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

专题命中 视觉定位与Grounding :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 LightNav-0 是激发 VLM 空间智能的通用具身导航模型,单模型支持多导航任务,在仿真基准和真实场景中均实现最优性能,具备强泛化能力。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29783 2026-09-01 cs.CV 新提交 91%

InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection

InspectorGPT:用于全面工业异常检测的对比推理增强型视觉语言模型(VLM)

Weifei Chen, Honghao Zhang, Zhiyuan You, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出InspectorGPT,一种结合对比推理的VLM框架,通过CoT微调与GRPO优化,配合任务向量融合的InspectorGPT-Seg实现工业异常检测,在多维度性能及未见基准泛化上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-09-01 cs.LG cs.AI cs.MA 版本更新 90%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments Long paper accepted to EMNLP 2026 main conference, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新 90%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30704 2026-09-01 cs.CV 新提交 90%

TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

TUE-Detector:一种基于使用工具的专家多模态大语言模型(MLLM)的AI生成视频检测器

Yichen Wu, Haoxuan Qu, Yongxing Dai, Yan Bai, Yihang Lou, Yuqi Lin, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究针对AI生成视频检测中识别细微非自然伪影的挑战,提出TUE-Detector框架,将通用MLLM训练为使用工具的专家检测器,通过调用工具收集证据推理检测,经大量实验验证其有效性。

Comments 32 pages, 7 figures, 28 tables; includes supplementary material. Code: https://github.com/Louis-YW/TUE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30233 2026-09-01 cs.CV 新提交 90%

Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

面向通用视觉 grounding 的语义-空间判别性增强

Kaiyan Lei, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文针对通用视觉 grounding 任务中易混淆相似目标的问题,提出 SSDE 框架,含 SeDE 与 SpDE 模块,在十个数据集上取得优异性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30342 2026-09-01 cs.CV 新提交 89%

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

CapFrame:基于几何伪标签的3D高斯场景中文本引导视角定位

Jirong Li, Satoshi Ikehata, Shuhei Kurita, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学大学) Denso IT Laboratory, Inc.(电装IT实验室) National Institute of Informatics(信息学研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对3D高斯场景中虚拟相机位姿需人工设置的问题,提出CapFrame框架,通过检索-转换-优化流程实现文本引导的视角定位,实验表明其对齐度优于基线方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09439 2026-09-01 cs.MM 版本更新 88%

Identity-Aware Vision-Language Model for Explainable Face Forgery Detection

用于可解释人脸伪造检测的身份感知视觉语言模型

Junhao Xu, Jingjing Chen, Yang Jiao, Jiacheng Zhang, Zhiyu Tan, Hao Li, Yu-Gang Jiang

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 针对人脸伪造检测的实际局限,提出轻量身份感知VLM,动态编码身份信息并结合检测适配器,在仅10个额外令牌下实现优于传统方法和通用VLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29268 2026-09-01 cs.CV cs.MM 新提交 87%

Learning to Ground Before Reading: Unified PCB Engineering Drawing Parsing with Compact Vision-Language Models

先学习定位再阅读:基于紧凑视觉语言模型的统一PCB工程图解析

Jinghao Liu, Xingrun Liu, Gengchen Sun, Han Xiao, Xingyu Chen, Yuhui Deng

机构 * Beijing Normal–Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省数据科学交叉研究与应用重点实验室) Hong Kong Baptist University(香港浸会大学) Hong Kong aiKnow Limited(香港智知有限公司)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title);分类 cs.CV

AI总结 本研究针对PCB工程图解析的区域遗漏问题,提出优先定位课程的紧凑VLM方法,在ED数据集上提升了定位F1,构建了无检测器的统一解析基线。

Comments 14 pages, 5 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29092 2026-09-01 cs.AI cs.CV 新提交 84%

EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation

EviAnchor:通过区域视觉证据补偿减轻大型视觉语言模型的幻觉问题

Sihang Jia, Shuliang Liu, Songbo Yang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对大型视觉语言模型的幻觉问题,提出无需训练的EviAnchor框架,通过区域证据锚点和决策条件证据路由提升视觉证据利用率,在多个基准测试中改善了视觉接地性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-09-01 cs.AI cs.CV 版本更新 84%

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29834 2026-09-01 cs.CL cs.IR 新提交 82%

You Know What I Mean: A Benchmark for Agentic Conversational Reference Grounding

你懂我意思:智能体对话指代消歧基准

Karen Fuchs, Uri Katz, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本研究构建了基于GitHub代码仓库的RepoRef基准,针对对话指代消歧任务,发现现有最优智能体仅达67%成功率,为多工具环境下智能体信息处理研究提供了基准。

Comments 23 pages, 6 figures, Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30621 2026-09-01 cs.CV cs.AI 新提交 81%

Cost-efficient Active Learning for Referring Image Segmentation and Grounding

用于指称图像分割与指称的高成本效益主动学习

Junbeom Hong, Seonghoon Yu, Hyung Rok Jung, Sundong Kim, Jeany Son

机构 * Meissa KAIST(韩国科学技术院) GIST(光州科学技术院) POSTECH(浦项科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉指称的标注瓶颈,提出结合基础模型生成辅助区域-文本对与指称区域模糊度获取函数的主动学习框架,在RIS、REC基准及用户研究中均实现更优性能与更快标注速度。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30649 2026-09-01 cs.CL cs.CV 新提交 79%

Where Identity Lives: Localized, Retain-Free Identity Unlearning in Multimodal Large Language Models

身份信息的留存位置:多模态大语言模型中无保留集的本地化身份遗忘

Kangwook Ko, Jaehyuk Jang, Wonjun Lee, Hee-Seon Kim, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型身份遗忘需依赖难获取保留集的问题,提出PAVA方法,定位解码器早期到中期MLPs并结合遗忘损失与视觉属性锚定,在基准上取得良好遗忘-保留权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30584 2026-09-01 cs.CV 新提交 79%

Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

基于合成课程学习的组合式时空视频定位方法

Xingjian Wang, Shijian Wang, Yibo Wang, Zihao Yu, Runhao Fu, Xuelian Cheng, Zongyuan Ge

机构 * Monash University(莫纳什大学) Southeast University(东南大学) Shanghai University of Electric Power(上海电力大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文针对现有时空视频定位模型忽略组合式查询的问题,提出CompSTVG任务,构建合成数据引擎与STVG-CompBench基准,引入CurrSTVG框架提升模型在组合式查询上的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交 79%

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24921 2026-09-01 cs.AI 版本更新 79%

post-graph-rag: A PostgreSQL-Native Bi-Temporal Graph RAG Engine with Temporal Grounding at Synthesis

post-graph-rag:一款原生PostgreSQL图检索增强生成引擎

Chandan Rajah

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 post-graph-rag是一款开源PostgreSQL原生图RAG引擎,解决现有图RAG的基础设施、图质量、时间累积问题,在三语料库对比中构建更优图且支持时间演化特性

Comments 31 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-09-01 cs.CV 版本更新 79%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30303 2026-09-01 cs.CL 新提交 79%

Lazy Grounding: Attacking Search Agents with Factual Evidence

惰性接地:用事实证据攻击搜索智能体

Yulin Zhang, Yukun Huang, Sanxing Chen, Tianyi Lin, Ziang Yang, Xunjian Yin, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出惰性接地攻击,即搜索智能体被邻近问题的事实证据误导,实验显示其可降低准确率最高17.3个百分点,表明需防御事实证据的误用。

Comments Accepted to EMNLP 2026 (Main Conference). Code: https://github.com/frankyzha/lazy-grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30622 2026-09-01 cs.SD eess.AS 新提交 78%

Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

面向通用型大语言模型的深度伪造语音检测的文本声学接地

Yassine El Kheir, Xin Wang, Wanqing Ge, Tim Polzehl, Sebastian Moeller, Junichi Yamagishi

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) National Institute of Informatics(情报信息学研究所) Technical University of Berlin(柏林工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究针对深度伪造语音检测的域泛化问题,提出跨模态提示策略,将openSMILE提取的声学特征作为文本标记注入冻结Qwen LLM,在ITW、MLAAD基准上获16.2%宏观F1绝对提升,性能最优。

Comments 6pages + 1ref, SLT Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29480 2026-09-01 cs.SD cs.IR 新提交 78%

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

你在听什么?面向音频-文本大语言模型的时序音乐定位

Kun Fang, Ziyu Wang, Ichiro Fujinaga

机构 * Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院) CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)) Courant Institute, New York University(纽约大学柯朗研究所) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 77%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29923 2026-09-01 cs.CV cs.LG 新提交 76%

Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation

面向开放词汇语义分割中视觉-语言模型的持续测试时适应

Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana, Muhammad Salman Siddiqui, Tor Kristian Stevik, Fadi Al Machot, Kristian Hovde Liland, Habib Ullah

机构 * Norwegian University of Life Sciences (NMBU)(挪威生命科学大学) Tulane University(杜兰大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.LG

AI总结 针对开放词汇语义分割中视觉-语言模型在持续测试时分布偏移下的对齐脆弱问题,提出DAF框架,在多数据集上实现mIoU显著提升且鲁棒性良好。

Comments under review. code available at https://github.com/chandlerbing65nm/DAF.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交 75%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);MLLM(abstract_cn)

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28656 2026-09-01 cs.RO cs.CV 新提交 74%

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA:用于驾驶策略中交通规则落地与行为强化的模型

Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

机构 * Qualcomm Technologies, Inc.(高通技术公司) Qualcomm Auto Ltd Sweden(瑞典高通汽车有限公司) Qualcomm India Private Limited(高通印度私人有限公司) Arriver System Software S.r.l.(Arriver系统软件有限公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 针对行为克隆VLA驾驶策略在信号交叉口罕见规则操作上的不足,提出RedLight-VLA,通过行为重加权与并行辅助头结合,提升交通规则落地能力,在多位移指标上优于基线及单独机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-09-01 cs.AI 版本更新 74%

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30959 2026-09-01 cs.CV cs.AI 新提交 73%

LOCI: A Locator-Critic with Refinement Loop

LOCI:带精化循环的定位器-评判器

Walid Bousselham, Mathilde Caron, Arsha Nagrani, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30480 2026-09-01 cs.CV cs.LG 新提交 73%

VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

VisER:用于大视觉语言模型(LVLMs)中物体幻觉检测的视觉证据与依赖关系

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 VisER 是一种无训练双向指标,通过视觉证据与视觉依赖两个互补视角检测 LVLMs 的物体幻觉,在 AUROC、AUPR 指标上优于多个基线方法。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏