arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2507.12297 2026-08-31 cs.LG cs.CV 版本更新 88%

RegCL: Compact Continual SAM Adaptation for Visual Grounding in Multi-Sensorial Media

RegCL:用于多感官媒体视觉 grounding 的紧凑持续 SAM 适配方法

Yuan-Chen Shu, Zhiwei Lin, Xiaoyu Zhou, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.LG

AI总结 针对多感官媒体中 SAM 在动态领域性能下降的问题,提出非重放持续适配框架 RegCL,通过合并轻量适配模块实现紧凑部署,在五数据集实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28216 2026-08-31 cs.CV 新提交 84%

WALDO: One-Shot Exemplar-Conditioned Object Detection in Cluttered Scenes

WALDO:杂乱场景中的一次性示例条件目标检测

Kishor Datta Gupta, Ahmed Rafi Hasan, Md. Mahfuzur Rahman, Md. Sadman Haque, Mohd Ariful Haque

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(联合国际大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出WALDO检测头,利用V-JEPA 2.1特征实现低成本一次性示例条件目标检测,在杂乱场景的AP@50优于Grounding DINO,验证了世界模型特征对定位和不存在检测的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28192 2026-08-31 cs.CV 新提交 83%

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

在视频中定位任意目标:重新思考高效的生成式时空视频定位

Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of California, Merced(加州大学默塞德分校) Apertix(阿珀蒂克斯公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对时空视频定位的自回归解码存在延迟高、误差易传播的问题,提出并行轨迹解码,在VidSTG等数据集上实现显著的延迟降低与吞吐量提升,且可零样本泛化到多项相关任务

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-31 cs.AI 版本更新 83%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-08-31 cs.CV 版本更新 83%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :visual language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 79%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27997 2026-08-31 cs.CV cs.MM 新提交 79%

A-PAIR: A Benchmark and Identity-Consistent Grounding Framework for Air-Ground Cross-View Referring Person Detection

A-PAIR:空-地跨视角参考人物检测的基准与身份一致的定位框架

Zhoupeng Guo, Xinjie Yao, Yunqi Zhu, Zhihe Fan, Siqi Zhao, Jianjun Chen, Yichen Dong, Yan Fan, Pengfei Zhu

机构 * School of Automation, Southeast University(东南大学自动化学院) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Sports Training, Tianjin University of Sport(天津体育学院运动训练学院) Tianjin University(天津大学) National University of Defense Technology(国防科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对空-地跨视角参考人物检测的挑战,本文提出首个该任务基准A-PAIR及ICRG框架,将对级F1从16.65%提至22.28%,验证了配对检测与身份一致推理的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25662 2026-08-31 cs.CL 版本更新 78%

Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models

SHROOM-Visions 2026概览:大型视觉语言模型幻觉检测共享任务

Raúl Vázquez, Aman Sinha, Chuyuan Li, Artem Shelmanov, Artem Vazhentsev, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus

机构 * University of Helsinki(赫尔辛基大学) Politecnico di Torino(都灵理工大学) Université Bretagne Sud(南布列塔尼大学) University of Copenhagen(哥本哈根大学) University Grenoble Alpes(格勒诺布尔阿尔卑斯大学) University of Lorraine(洛林大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract)

AI总结 本文介绍了2026年在EMNLP 2026同期举办的SHROOM-Visions共享任务,该任务针对大型视觉语言模型的幻觉检测,依托SHEEP数据集开展,吸引27支团队提交600余个系统,最优系统较基线提升30-40个百分点。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-31 cs.LG 版本更新 74%

JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28108 2026-08-31 cs.RO cs.CV 新提交 70%

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA:在单一视觉-语言-动作模型(VLA)中统一基于语言和指示手势的指令模式

Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出DeicticVLA,将三种指令模式统一于单一VLA,经仿真与真实任务验证,其在未见场景和新类别下的表现优于仅用语言指令的模型,为相关设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 70%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27079 2026-08-31 cs.RO 版本更新 67%

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

GRAFT:面向精细机器人操作的 grounded 高效在线强化适应

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 GRAFT是一种高效在线VLA适应框架,通过特定视角视觉锚点聚焦任务相关线索,在四项生物医学操作任务中提升25个百分点成功率并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-31 cs.CL cs.AI cs.LG 版本更新 62%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 08/2026. 21 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-08-31 cs.CV cs.AI 版本更新 62%

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交 57%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28363 2026-08-31 cs.AI 新提交 57%

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

EvoUndo:面向大语言模型智能体执行框架的可恢复性约束自进化

Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体自进化的可恢复性问题,提出EvoUndo框架,通过协同设计验证、状态落地等,在600个任务中实现高比例的失败变更恢复,且效应存在模型依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 57%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27840 2026-08-31 cs.AI cs.IR 新提交 57%

An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark

大规模基准下跨城市兴趣点(POI)推荐的实证评估

Peibo Li, Yang Song, Hao Xue, Maarten de Rijke, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文以大规模基准Trip World开展跨城市POI推荐实证评估,发现现有SOTA方法存在三个瓶颈,且适配的智能体方法效果不佳,凸显需设计任务特定的跨城市推荐方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27675 2026-08-31 cs.AI 新提交 57%

Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community

面向所有人的智能体:分布式整理社区中构建智能体AI能力的研讨会框架

Seth Carbon, Sierra Moxon, Kimberly Van Auken, Pascale Gaudet, Christopher J. Mungall

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对智能体AI应用于生物数据库整理的障碍,构建了基于JupyterHub与Claude Code的云环境及含四个模块的研讨会,证明其可提升分布式社区的智能体AI整理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27668 2026-08-31 cs.CV 新提交 57%

Report Supervision

报告监督

Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal, Jieneng Chen, Xinze Zhou, Zheren Zhu, Chuntung Zhuanga, Sergio Decherchi, Andrea Cavalli, Kang Wang, Yang Yang, Alan Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) University Hospital Basel(巴塞尔大学医院) Stanford University(斯坦福大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Italian Institute of Technology(意大利技术研究院) University of Bologna(博洛尼亚大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。

Comments Published in Medical Image Analysis, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-31 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17685 2026-08-31 physics.geo-ph eess.SY 版本更新 50%

A Reproducible Method for Mapping Electricity Transmission Infrastructure for Space Weather Risk Assessment

一种可重复的方法用于空间天气风险评估中的电力输电基础设施映射

Dennies K. Bor, Edward J. Oughton, Evan A. Peters, Noah Rivera, C. Trevor Gaunt, Robert Weigel, Michael Wiltberger

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种可重复的方法,通过开放源码子站数据收集,利用创新的网页浏览器平台将OpenStreetMap子站位置转换为高分辨率的电力输电资产映射,用于空间天气风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏