arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-27 至 2026-08-27 共收录 85 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2601.13207 2026-08-27 cs.CV 版本更新 70%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 62%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交 62%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 62%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-08-27 cs.CV cs.AI 版本更新 62%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25866 2026-08-27 cs.CV 新提交 57%

LUTSeg: A Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation

LUTSeg:用于溃疡组织分割的纵向多专家数据集

Karen Sanchez, Carlos Hinojosa, Albert A. Ávila, Andrea C. Riano-Rojas, Diego H. Romero, Jenny C. Páez, Martina Llinás, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Subred Norte E.S.E, Hospital Simón Bolívar(北红区E.S.E西蒙·玻利瓦尔医院) Universidad del Rosario(罗萨里奥大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究针对慢性溃疡组织分割数据稀缺问题,构建LUTSeg数据集,并提出半监督框架TiSage,在低标注设置下优于基线方法。

Comments Published at ISIC in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25663 2026-08-27 cs.IR cs.AI cs.DB cs.DL 新提交 57%

Data Citation for Large Language Models: A Challenge

大语言模型的数据引用:一项挑战

Gianmaria Silvello

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文指出大语言模型的数据引用是一项开放挑战,提出训练数据归因、推理时数据引用、知识图谱事实引用三个研究方向,需跨领域协同推进以解决该问题。

Comments 7 pages, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24977 2026-08-27 cs.CR cs.CL cs.LG 新提交 57%

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

可检索但不可靠:检索增强生成中的攻击与防御研究综述

Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。

Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20754 2026-08-27 cs.CV 版本更新 57%

SPARK-SAM: Learning How to Prompt and Respond for Infrared Small Target Segmentation

SPARK-SAM:面向红外小目标分割SAM的、基于响应知识的自提示适配

Aji Mao, Zhenming Peng, Bailin Mu, Tian Pu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM直接迁移至红外小目标分割存在的提示-响应不匹配问题,提出SPARK-SAM方法,仅增0.726M参数即实现高IoU,在两个基准上排名第一。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19269 2026-08-27 cs.SE cs.AI 交叉投稿 57%

What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

内部稳定,跨样本未识别:基准效应与排名的语义识别

Xi Qin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对TraceElephant基准,揭示评估语义对结论的影响,通过分析F_asym、F_cc等的效应与排名,提出局部非蕴含见证及族索引审计方法。

Comments 31 pages; major revision; adds a commit-bound 124-unit Inspect Evals census, typed evidence-stopping taxonomy, executable claim-replay contract, full scientific appendix, and public reproducibility package

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交 50%

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25131 2026-08-27 physics.med-ph 新提交 50%

Evaluation of the Exradin A30 Parallel Plate Ion Chamber as a Reference Dosimeter in Ultra-High Dose Rate (UHDR) Electron Beams

Exradin A30平行板电离室作为超高中子剂量率(UHDR)电子束参考剂量计的评估

Mervat Alharbi, Kevin Liu, Brian Hooten, Shannon Holmes, Stefanno Alarcon-Nunez, Jeffrey Radtke, Larry DeWerd, Sam Beddar, Wesley Culberson, Emil Schueler, Ahtesham Khan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究评估Exradin A30平行板电离室作为超高中子剂量率电子束参考剂量计的性能,明确其漏电流、电荷收集效率等参数特性,证实经修正后该电离室可用于UHDR电子束参考剂量测定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26604 2026-08-27 cs.GT cs.DC cs.NI econ.TH 版本更新 50%

Credibility Trilemma in Polymatroidal Service Markets

多拟阵服务市场中的可信度三难困境

Lauri Lovén, Sujit Gujar, Kalle Timperi, Hassan Mehmood, Praveen Kumar Donta, Sasu Tarkoma, Schahram Dustdar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究多拟阵服务市场中市场运营者的策略行为,证明在非模多拟阵上不存在同时满足收益最优、激励兼容和可信的静态密封投标机制,并引入不可信成本度量该困境的福利损失。

Comments 60 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 5 篇

2608.25140 2026-08-27 cs.CV cs.CL 新提交 84%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 文档图表理解 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26053 2026-08-27 cs.RO cs.AI cs.CL cs.LG 新提交 82%

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

R^3:通过强化学习训练机器人以自然语言进行推理

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出R^3方法,通过中间训练和基于准则的强化学习将VLM转化为机器人推理器,在两个测试平台上提升了机器人的探索与泛化能力,优于仅指令式的模仿学习基线。

Comments 42 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18359 2026-08-27 cs.CV 版本更新 57%

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-27 cs.IR 新提交 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Junwei Zhou, Nan Du

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2608.25876 2026-08-27 cs.HC cs.CV 新提交 89%

Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

视觉-语言模型是否对形状的情感特质达成一致?面向生成式设计界面的跨模型审计

Luca Bux, Thiago Rios, Ingo Scholtes, Stefan Menzel

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究审计6个VLM对ShapeNet中10类3D物体的情感特质一致性,发现其一致性介于零基准与几何上限之间,据此实现UI原型指导生成式设计界面的语义控制选择。

Comments 13 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25308 2026-08-27 cs.CV 新提交 77%

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

V-Link:为视觉-语言-动作模型恢复动作DiT中丢失的视觉表征

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li

机构 * Zhejiang University(浙江大学) AGIBOT The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Simon Fraser University(西蒙菲莎大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本研究针对VLA模型中动作专家访问视觉信息不足的问题,提出V-Link方法,通过注入空间与语义查询提升动作DiT性能,在多个机器人操作基准及现实任务中均取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-27 cs.CV cs.AI cs.LG 版本更新 67%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25425 2026-08-27 cs.SE cs.AI 新提交 57%

RotDroid: Cross-Orientation State Equivalence Testing for Detecting GUI Rotation Bugs in Android Apps

RotDroid:用于检测Android应用GUI旋转漏洞的跨方向状态等价测试

Mengdi Qin, Bo Jiang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 RotDroid是一款检测Android应用GUI旋转漏洞的测试框架,通过生成SPS、构建RotBench数据集及开发RotVL模型,在相同预算下比现有技术检测到更多旋转故障,还发现94个未知漏洞且47个被确认修复。

Comments Accepted to ISSRE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 12 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-27 cs.CV 版本更新 85%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at this https URL (https://github.com/The-Responsible-AI-Initiative/SafeGesture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 79%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25375 2026-08-27 cs.CY cs.CL cs.CV 新提交 79%

GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出GGSS方法,针对生成式VLMs设计推理时去偏方案,经实验验证其在降低人口统计学偏见的同时,能较好保留模型通用视觉语言能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-08-27 cs.CV 版本更新 79%

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26035 2026-08-27 cs.CL 新提交 67%

Beyond Local Surprise: Grounded Dialogue as Selective Belief Revision under Referential Uncertainty

超越局部意外:指称不确定性下的对话作为选择性信念修正

Ziming Liu, Bhanu Chaitanya Jasti, Ziyang Xu, Hongyu Wu, Yi Wu, Jiqun Liu

机构 * University of Oklahoma(俄克拉荷马大学) University of Wisconsin–Milwaukee(威斯康星大学密尔沃基分校)

专题命中 幻觉与鲁棒性 :grounding(abstract,abstract_cn)

AI总结 该研究针对听者在指称不确定性下的对话保留/修正决策,提出数据驱动框架,发现不确定性敏感策略可在保留连贯理解的同时维持良好检索性能,其模式符合概念契约理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25561 2026-08-27 cs.CL 新提交 67%

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

EgoArgus:将视觉语言模型(VLM)作为模态接地用户支持情境助手的基准测试

Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 幻觉与鲁棒性 :VLM(title_cn)

AI总结 研究针对当前VLMs作为日常助手的模态仲裁难题,构建人工标注数据集EgoArgus,发现现有VLMs仍难胜任该任务,且现有偏差缓解方法效果有限,为部署提供了参考。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26095 2026-08-27 cs.CV cs.AI 新提交 62%

A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态无监督持续后训练的视觉依赖感知框架

Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态无监督持续后训练中现有方法忽略视觉依赖的问题,提出含VC-OT和VMA组件的VDA框架,可同时维持旧任务稳定性与新任务可塑性,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏