arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-24 至 2025-12-24 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2512.17601 2025-12-24 cs.CV 83%

HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection

HeadHunt-VAD: 在MLLM中寻找鲁棒的异常敏感头部以实现无调优视频异常检测

Zhaolin Cai, Fan Li, Ziwei Zheng, Haixia Bi, Lijun He

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HeadHunt-VAD通过直接在冻结的MLLM中寻找鲁棒的异常敏感头部,实现高效的无调优视频异常检测。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13891 2025-12-24 cs.CV 83%

Weakly Supervised Ephemeral Gully Detection In Remote Sensing Images Using Vision Language Models

基于视觉语言模型的弱监督瞬时沟壑遥感图像检测

Seyed Mohamad Ali Tousi, Ramy Farag, John A. Lory, G. N. DeSouza

机构 * Vision Guided and Intelligent Robotics Laboratory (ViGIR)(视觉引导与智能机器人实验室) EECS Dept.(电子工程与计算机科学系) Division of Plant Science and Technology(植物科学与技术系)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出基于视觉语言模型的弱监督瞬时沟壑检测方法,通过半监督学习和噪声感知损失函数提升遥感图像检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 70%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19943 2025-12-24 cs.CV 70%

SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction

SE360:通过分层数据构建实现360度全景图的语义编辑

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SE360通过分层数据构建实现360度全景图的语义编辑,提出自主数据生成管道和两阶段数据精修策略,提升编辑质量和语义准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20451 2025-12-24 cs.CV 57%

Beyond Motion Pattern: An Empirical Study of Physical Forces for Human Motion Understanding

超越运动模式:人体运动理解中物理力的实证研究

Anh Dao, Manh Tran, Yufei Zhang, Xiaoming Liu, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究通过引入物理推断的力,提升了人体运动理解在步态识别、动作识别和视频描述中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20344 2025-12-24 cs.AI 57%

A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice

基于DeepSeek的AI系统用于临床实践中自动胸部X光解读

Yaowei Bai, Ruiheng Zhang, Yu Lei, Xuhua Duan, Jingfeng Yao, Shuguang Ju, Chaoyang Wang, Wei Yao, Yiwan Guo, Guilin Zhang, Chao Wan, Qian Yuan, Lei Chen, Wenjuan Tang, Biqiang Zhu, Xinggang Wang, Tao Sun, Wei Zhou, Dacheng Tao, Yongchao Xu, Chuansheng Zheng, Huangxuan Zhao, Bo Du

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 基于DeepSeek的AI系统在临床实践中实现自动胸部X光解读,提升诊断可靠性与效率,减少解读时间并获得专家认可。

Comments arXiv admin note: substantial text overlap with arXiv:2507.19493

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20278 2025-12-24 cs.AI 57%

Synthesizing Procedural Memory: Challenges and Architectures in Automated Workflow Generation

生成程序记忆:自动化工作流生成中的挑战与架构

Nishant Gaurav, Adit Akarsh, Ankit Ranjan, Manoj Bajaj

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过科学方法自主生成工作流技能,解决自动化技能生成中的四个结构性瓶颈。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20257 2025-12-24 cs.CV 57%

LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation

LADLE-MM:基于有限标注的多模态虚假信息检测器

Daniele Cardullo, Simone Teglia, Irene Amerini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LADLE-MM是一种基于有限标注的多模态虚假信息检测器,通过学习的集成方法在有限资源下实现高效检测,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 57%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19959 2025-12-24 cs.CG 50%

A Comprehensive Guide to Mesh Simplification using Edge Collapse

基于边折叠的网格简化全面指南

Purva Kulkarni, Aravind Shankara Narayanan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提供基于边折叠的网格简化方法的全面指南,涵盖理论基础、实现细节及实用技巧,帮助从业者和研究人员理解和应用该技术。

Comments 46 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏