arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-25 至 2025-11-25 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2511.19315 2025-11-25 cs.RO 82%

Rethinking Intermediate Representation for VLM-based Robot Manipulation

重新思考基于VLM的机器人操作中的中间表示

Weiliang Tang, Jialin Gao, Jia-Hui Pan, Gang Wang, Li Erran Li, Yunhui Liu, Mingyu Ding, Pheng-Ann Heng, Chi-Wing Fu

机构 * CUHK(香港中文大学) Amazon(亚马逊) UNC(北卡罗来纳大学教堂山分校)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出SEAM表示方法,通过分解中间表示为词汇和语法,提升VLM在机器人操作中的可理解和通用性,结合检索增强的少样本学习策略实现高效操作,并在动作通用性和VLM可理解性上展示出优于主流方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23867 2025-11-25 cs.CV 79%

Sim-DETR: Unlock DETR for Temporal Sentence Grounding

Sim-DETR: 解锁用于时间句子定位的DETR

Jiajin Tang, Zhengxuan Wei, Yuchen Zhu, Cheng Shi, Guanbin Li, Liang Lin, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Sim-DETR通过改进DETR的解码器层,解决了时间句子定位中的查询冲突问题,提升了模型性能。

Comments This work is accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18270 2025-11-25 cs.RO 78%

Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search

Skypilot: 通过物理现实 grounding 提升 LLM 在 AAV 覆盖搜索中的微调

Zhongkai Chen, Yihao Sun, Chao Yan, Han Zhou, Xiaojia Xiang, Jie Jiang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(自动化工程学院,南京航空航天大学) China Academy of Launch Vehicle Technology(中国运载火箭技术研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 Skypilot通过结合MCTS和物理感知奖励函数,提升LLM在AAV覆盖搜索中的微调效果,实现高效且高质量的决策与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18164 2025-11-25 cs.CV cs.AI 73%

Nested Unfolding Network for Real-World Concealed Object Segmentation

嵌套展开网络用于现实世界隐蔽物体分割

Chunming He, Rihan Zhang, Dingming Zhang, Fengyang Xiao, Deng-Ping Fan, Sina Farsiu

机构 * Duke University(杜克大学) Nankai University(南开大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出嵌套展开网络(NUN),通过解耦恢复与分割并引入自一致性损失,提升现实世界隐蔽物体分割的性能。

Comments 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15165 2025-11-25 cs.CR cs.AI 70%

Can MLLMs Detect Phishing? A Comprehensive Security Benchmark Suite Focusing on Dynamic Threats and Multimodal Evaluation in Academic Environments

MLLMs能否检测钓鱼?一个全面的安全基准套件,聚焦于动态威胁和学术环境中的多模态评估

Jingzhuo Zhou

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出AdapT-Bench,一个针对学术环境动态钓鱼攻击的多模态安全基准套件,旨在评估MLLM的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18640 2025-11-25 cs.CV cs.AI cs.LG 67%

Health system learning achieves generalist neuroimaging models

健康系统学习实现通用神经影像模型

Akhil Kondepudi, Akshay Rao, Chenhui Zhao, Yiwei Lyu, Samir Harake, Soumyanil Banerjee, Rushikesh Joshi, Anna-Katharina Meissner, Renly Hou, Cheng Jiang, Asadur Chowdury, Ashok Srinivasan, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * Machine Learning in Neurosurgery Lab University of Michigan(密歇根大学机器学习神经外科实验室) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学) University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程) University of Michigan Radiology(密歇根大学放射学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 NeuroVFM通过健康系统学习范式,在临床MRI和CT影像上训练,实现高性能通用神经影像模型,提升放射学诊断和报告生成的准确性与临床实用性。

Comments 53 pages, 4 main figures, 10 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19149 2025-11-25 cs.CV cs.AI cs.CL 62%

From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation

从像素到帖子:基于检索的时尚描述与标签生成

Moazzam Umer Gondal, Hamad Ul Qudous, Daniya Siddiqui, Asma Ahmad Farhan

机构 * organization= School of Computing, National University of Computer \& Emerging Sciences (FAST) , city= Lahore , postcode= 54000 , country= Pakistan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于检索的时尚描述与标签生成方法,结合多件服装检测、属性推理和大语言模型,提升描述准确性和标签生成的视觉相关性。

Comments Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19046 2025-11-25 cs.CV cs.AI 62%

MedSAM3: Delving into Segment Anything with Medical Concepts

MedSAM3:深入探索医学概念中的分割任务

Anglin Liu, Rundong Xue, Xu R. Cao, Yifan Shen, Yi Lu, Xiang Li, Qianqian Chen, Jintai Chen

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM3通过引入可文本提示的医学分割模型,实现了基于开放词汇文本描述的精准解剖结构分割,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15622 2025-11-25 cs.CV cs.AI 62%

The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification

SA-FARI数据集:用于识别和鉴定的动物视频中的片段任何事物

Dante Francisco Wasmuht, Otto Brookes, Maximillian Schall, Pablo Palencia, Chris Beirne, Tilo Burghardt, Majid Mirmehdi, Hjalmar Kühl, Mimi Arandjelovic, Sam Pottie, Peter Bermant, Brandon Asheim, Yi Jin Toh, Adam Elzinga, Jason Holmberg, Andrew Whitworth, Eleanor Flatt, Laura Gustafson, Chaitanya Ryali, Yuan-Ting Hu, Baishan Guo, Andrew Westbury, Kate Saenko, Didac Suris

机构 * Conservation X Labs (CXL)(Conservation X Labs) Meta University of Bristol(布里斯托大学) Hasso Plattner Institute(哈索罗滕堡研究所) University of Oviedo(奥维多大学) Osa Conservation(Osa保护) Senckenberg Museum of Natural History(Senckenberg自然史博物馆) Max Planck Institute for Evolutionary Anthropology(马克斯·普朗克进化人类学研究所) Climate Corridors(气候走廊)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SA-FARI数据集通过高物种多样性、多地区覆盖和高质量时空标注,为野生动物多动物跟踪提供了新的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01558 2025-11-25 cs.CV cs.AI 62%

VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval

VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器

Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman

机构 * North South University(北南大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18319 2025-11-25 cs.AI cs.LG cs.SY eess.SY 62%

Weakly-supervised Latent Models for Task-specific Visual-Language Control

弱监督潜在模型用于任务特定的视觉语言控制

Xian Yeow Lee, Lasitha Vidyaratne, Gregory Sin, Ahmed Farahat, Chetan Gupta

机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 57%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 57%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 57%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18116 2025-11-25 cs.CV 57%

PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures

PromptMoE: 通过视觉引导的提示混合实现通用零样本异常检测

Yuheng Shao, Lizhang Wang, Changhao Li, Peixian Chen, Qinyuan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 PromptMoE通过视觉引导的提示混合方法,实现了通用零样本异常检测,提升了模型对未见异常的泛化能力。

Comments 14 pages, 8 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 57%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24466 2025-11-25 cs.CV 57%

SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking

SA-Person: 基于文本的人检索与场景感知重排序

Yingjia Xu, Jinlin Wu, Daming Gao, Zhen Chen, Yang Yang, Min Cao, Mang Ye, Zhen Lei

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SA-Person通过整合个体外观和全局场景上下文,提升基于文本的人检索准确性,提出ScenePerson-13W数据集和两阶段检索框架。

Comments 13 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17991 2025-11-25 cs.CV cs.CL 57%

VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format

VideoLLM 知何时言:通过视频-文本双人对话交互格式增强时间敏感视频理解

Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出视频-文本双人对话交互格式,通过MMDuetIT数据集和MAGQA任务提升VideoLLM在时间敏感任务中的表现,实现高效实时响应。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19226 2025-11-25 physics.med-ph 50%

In-vivo imaging with a low-cost MRI scanner and cloud data processing in low-resource settings

在低资源环境中使用低成本MRI扫描仪和云数据处理进行体内成像

Teresa Guallart-Naval, Robert Asiimwe, Patricia Tusiime, Mary A. Nassejje, Leo Kinyera, Lemi Robin, Maureen Nayebare, Luiz G. C. Santos, Marina Fernández-García, Lucas Swistunow, José M. Algarín, John Stairs, Michael Hansen, Ronald Amodoi, Andrew Webb, Joshua Harper, Steven J. Schiff, Johnes Obungoloch, Joseba Alonso

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究展示了在低资源环境中通过改进硬件和软件实现低成本MRI系统获得临床相关图像质量的可行性。

Comments 10 pages, 10 figures, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01588 2025-11-25 cs.SD eess.AS eess.SP 50%

Learning Perceptually Relevant Temporal Envelope Morphing

学习具有感知相关性的时序包络变形

Satvik Dixit, Sungjoon Park, Chris Donahue, Laurie M. Heller

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于感知指导的学习方法,用于生成具有时间中间性的音频包络变形,通过人类听觉研究和大规模数据集训练,优于现有方法。

Comments Accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02977 2025-11-25 cond-mat.stat-mech 50%

Open Problems within Nonextensive Statistical Mechanics

非广延统计力学中的开放问题

Kenric P. Nelson

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了非广延统计力学中的开放问题,包括熵与泛化熵的差异量化、参数q的物理解释、泛化乘积的定义改进、广义傅里叶变换的应用以及非广延熵的归一化重新审视,并提出形状参数可能用于定义系统统计复杂性。

Comments 19 pages; 1 figure; 2 tables; recommended for publication in Entropy, special issue Nonadditive Entropies and Nonextensive Statistical Mechanics

Journal ref Entropy 2024, 26(2), 118

详情

展开后加载摘要…

URL PDF HTML 收藏