arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-22 至 2025-12-22 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2510.16442 2025-12-22 cs.CV cs.AI 81%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉定位与Grounding :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17640 2025-12-22 cs.CV 70%

Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs

通过可微认知引导的多模态大语言模型进行生成式人类-物体交互检测

Zhaolin Cai, Huiyu Duan, Zitong Xu, Fan Li, Zhi Liu, Jing Liu, Wei Shen, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) Xi’an Jiao Tong University(西安交通大学) Shandong University(山东大学) Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GRASP-HO框架,通过可微认知引导的多模态大语言模型实现生成式人类-物体交互检测,解决封闭集分类与开放词汇生成之间的监督不匹配问题,实现判别感知与生成推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12146 2025-12-22 cs.CV cs.AI 62%

Multi Anatomy X-Ray Foundation Model

多解剖X光基础模型

Nishank Singla, Krisztian Koos, Farzin Haddadpour, Amin Honarmandi Shandiz, Lovish Chum, Xiaojian Xu, Qing Jin, Erhan Bas

机构 * GE HealthCare(通用电气医疗)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 XR-0通过自监督学习在多解剖X光数据上训练,实现了在多种临床任务中的高性能表现,展示了解剖多样性对构建通用医学视觉模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17733 2025-12-22 cs.IR cs.AI 57%

Diversity Recommendation via Causal Deconfounding of Co-purchase Relations and Counterfactual Exposure

通过共购关系和反事实暴露的因果去偏实现多样性推荐

Jingmao Zhang, Zhiting Zhao, Yunqi Lin, Jianghong Ma, Tianjun Wei, Haijun Zhang, Xiaofeng Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Cadence通过因果去偏共购关系和反事实暴露提升推荐多样性,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 57%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17331 2025-12-22 cs.CV 57%

SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait Animation

SynergyWarpNet:基于注意力的协同形变用于神经肖像动画

Shihang Li, Zhiqiang Gong, Minming Ye, Yue Gao, Wen Yao

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) Defense Innovation Institute, Academy of Military Science(国防创新研究院,军事科学院) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SynergyWarpNet通过基于注意力的协同形变框架,实现了高保真的说话头合成,解决了传统方法在运动转移和几何基础方面的不足。

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16928 2025-12-22 cs.LG cs.DC 57%

Dion2: A Simple Method to Shrink Matrix in Muon

Dion2: 一种简化矩阵压缩的穆恩方法

Kwangjun Ahn, Noah Amsel, John Langford

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Dion2通过稀疏化矩阵更新来简化穆恩优化器的正交化步骤,从而降低计算和通信开销,提升可扩展性。

Comments https://github.com/microsoft/dion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09116 2025-12-22 cs.CV 57%

Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention

零shot分层植物分割:通过基础分割模型和文本到图像注意力

Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura

机构 * The University of Osaka(大阪大学) Phytometrics Nagoya University(名古屋大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 ZeroPlantSeg通过基础分割模型和文本到图像注意力实现零shot分层植物分割,有效提取植物个体,优于现有方法。

Comments WACV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏