arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-16 至 2025-12-16 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2512.12842 2025-12-16 cs.RO cs.AI cs.LG 81%

SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding

SAGA:通过结构化可及性 grounding 实现开放世界移动操作

Kuan Fang, Yuxin Chen, Xinghao Zhu, Farzad Niroui, Lingfeng Sun, Jiuguang Wang

机构 * RAI Institute(RAI研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 SAGA通过结构化可及性接地实现开放世界移动操作,能有效处理多种任务形式并实现零样本执行。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12246 2025-12-16 cs.CV 79%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02967 2025-12-16 cs.CL cs.AI cs.IR 74%

Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines

将大语言模型 grounded 在临床证据中:一种用于查询英国 NICE 临床指南的检索增强生成系统

Matthew Lewis, Samuel Thio, Amy Roberts, Catherine Siju, Whoasif Mukit, Rebecca Kuruvilla, Zhangshu Joshua Jiang, Niko Möller-Grell, Aditya Borakati, Richard JB Dobson, Spiros Denaxas

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) Department of Biostatistics and Health Informatics, King’s College London(生物统计学与健康信息学系,伦敦国王学院) EPSRC DRIVE-Health CDT, London, U.K.(EPSRC DRIVE-Health CDT,伦敦,英国) Imperial College Healthcare NHS Trust(帝国学院医疗 NHS 信托) Black Country Healthcare NHS Foundation Trust(黑斯廷斯地区医疗 NHS 基础信托) Feldon Lane Surgery, The Dudley Group NHS Foundation Trust(费尔顿车道诊所,德比集团 NHS 基础信托) The Cleveland Clinic, London, U.K.(克利夫兰诊所,伦敦,英国) CogStack Limited(CogStack 有限公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出一种基于RAG的系统,用于查询英国NICE临床指南,通过检索增强生成技术提升回答的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00858 2025-12-16 cs.RO cs.AI cs.HC 70%

Enhancing Interpretability and Interactivity in Robot Manipulation: A Neurosymbolic Approach

提升机器人操作的可解释性和交互性:一种神经符号方法

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出一种神经符号方法,通过结合语言引导的视觉推理与机器人操作,提升可解释性和交互性,实现80.2%的成功率。

Comments Published in International Journal of Robotics Research (IJRR) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12929 2025-12-16 cs.CV cs.AI 62%

MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation

MADTempo: 多事件时间视频检索的交互系统与查询增强

Huu-An Vu, Van-Khanh Mai, Trong-Tam Nguyen, Quang-Duc Dam, Tien-Huy Nguyen, Thanh-Huong Le

机构 * Hanoi University of Science and Technology(河内科技大学) The University of Danang - University of Science and Technology(丹江-科技大学) Vietnam National University(越南国家大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MADTempo通过结合时序搜索与网络视觉定位,提升多事件视频检索的时序推理和泛化能力,增强对罕见视觉概念的检索鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13632 2025-12-16 cs.LG 57%

StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion

StutterFuse: 通过Jaccard加权度量学习和门控融合缓解语塞崩溃

Guransh Singh, Md Shah Fahad

机构 * Department of Computer Science, Birla Institute of Technology, Mesra(计算机科学系,比拉理工学院,梅斯拉)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 StutterFuse通过Jaccard加权度量学习和门控融合策略,有效缓解语塞检测中的模态崩溃问题,实现高精度多标签分类。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13008 2025-12-16 cs.CV 57%

TWLR: Text-Guided Weakly-Supervised Lesion Localization and Severity Regression for Explainable Diabetic Retinopathy Grading

TWLR: 基于文本引导的弱监督病变定位与严重程度回归用于可解释性糖尿病视网膜病变分级

Xi Luo, Shixin Xu, Ying Xie, JianZhong Hu, Yuwei He, Yuhui Deng, Huaxiong Huang

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省级交叉学科研究与数据科学应用重点实验室) Department of Statistics and Data Science, Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学统计与数据科学系) Faculty of Science, Hong Kong Baptist University(香港 Baptist大学科学学院) Data Science Research Center, Duke Kunshan University(杜克-昆山大学数据科学研究中心) Shanxi Provincial People’s Hospital(山西人民医院) The Fifth Clinical Medical school of Shanxi Medical University(山西医科大学第五临床医学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心) Department of Mathematics and Statistics, York University(约克大学数学与统计学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 TWLR通过双阶段框架实现糖尿病视网膜病变的可解释性评估,结合视觉语言模型和弱监督分割,实现病变定位与严重程度回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12501 2025-12-16 cs.AI 57%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20991 2025-12-16 cs.CV 57%

MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation

MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法

Chade Li, Pengju Zhang, Yihong Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。

Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14642 2025-12-16 cs.CV 57%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 57%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21329 2025-12-16 cs.AI physics.soc-ph 57%

Active Inference AI Systems for Scientific Discovery

主动推断AI系统用于科学发现

Karthik Duraisamy

机构 * Michigan Institute for Computational Discovery & Engineering(密歇根计算发现与工程研究所) University of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出主动推断AI系统,通过结合缓慢假设生成与快速验证推理,利用因果和多模态模型促进科学发现,强调人类判断在处理不确定性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11297 2025-12-16 cs.CL 50%

LegalRikai: Open Benchmark -- Benchmark for Complex Japanese Corporate Legal Tasks

LegalRikai:开放基准——复杂日本企业法律任务的基准

Shogo Fujita, Yuji Naraki, Yiqing Zhu, Shinsuke Mori

机构 * LegalOn Technologies, Inc.(LegalOn技术公司) Kyoto University(京都大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LegalRikai基准通过四个复杂任务评估日本企业法律实践,揭示模型在文档编辑中的不足,并提出数据集评估框架以推动法律领域实践研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01948 2025-12-16 cs.CL 50%

How Far Are We from Genuinely Useful Deep Research Agents?

我们距离真正有用的深度研究代理还有多远?

Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu, Wangchunshu Zhou

机构 * OPPO AI Agent Team(OPPO 人工智能代理团队)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出FINDER基准和DEFT分类,揭示当前深度研究代理在证据整合与推理鲁棒性规划方面的不足。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏