arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-27 至 2025-11-27 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2511.21375 2025-11-27 cs.CV 85%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19516 2025-11-27 cs.CV 85%

Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning

连接点:通过代理推理实现无需训练的视觉接地

Liqin Luo, Guangyao Chen, Xiawu Zheng, Yongxing Dai, Yixiong Zou, Yonghong Tian

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 GroundingAgent通过代理推理实现无需微调的视觉接地,达到65.1%的零样本准确率,并在选择阶段实现90%的准确率,展示了LLM推理能力的重要性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02607 2025-11-27 cs.CV cs.CL 83%

UniChange: Unifying Change Detection with Multimodal Large Language Model

UniChange: 通过多模态大语言模型统一变化检测

Xu Zhang, Danyang Li, Xiaohang Dong, Tianhao Wu, Hualong Yu, Jianye Wang, Qicheng Li, Xiang Li

机构 * TMCC, Computer Science, Nankai University(天津大学计算机学院,南开大学) VCIP, Computer Science, Nankai University(南开大学计算机科学系) NKIARI, Futian, Shenzhen(深圳福田国家工程研究中心) CMEE, Sichuan Agricultural University(四川农业大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 UniChange通过多模态大语言模型统一变化检测任务,引入特殊标记和文本提示,实现BCD和SCD的统一,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19111 2025-11-27 cs.CV 70%

DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection

DiffSeg30k: 一种用于局部AIGC检测的多轮扩散编辑基准

Hai Ci, Ziheng Peng, Pei Yang, Yingxin Xuan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) South China University of Technology(华南理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DiffSeg30k通过引入多轮扩散编辑基准,推动AIGC检测从二元分类到语义分割的转变,提升局部编辑定位和模型识别的可靠性。

Comments 16 pages, 10 figures; typos corrected, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20841 2025-11-27 cs.RO 67%

OVAL-Grasp: Open-Vocabulary Affordance Localization for Task Oriented Grasping

OVAL-Grasp:面向任务的开放词汇表征定位抓取

Edmond Tong, Advaith Balaji, Anthony Opipari, Stanley Lewis, Zhen Zeng, Odest Chadwicke Jenkins

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 OVAL-Grasp通过结合大语言模型和视觉-语言模型,实现面向任务的开放词汇表征抓取,有效识别物体部分并提高抓取成功率。

Comments 10 pages, 7 figures, 3 tables. Presented at the 2025 International Symposium on Experimental Robotics (ISER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21337 2025-11-27 cs.CV cs.AI 62%

Hybrid SIFT-SNN for Efficient Anomaly Detection of Traffic Flow-Control Infrastructure

混合SIFT-SNN用于交通流控制基础设施异常检测的高效方法

Munish Rathee, Boris Bačić, Maryam Doborjeh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出混合SIFT-SNN框架,通过空间特征编码与低延迟脉冲神经网络实现交通基础设施异常检测的高效实时处理。

Comments 8 pages, 6 figures. This is a preprint of a paper accepted for presentation at the 2025 International Conference on Image and Vision Computing New Zealand (IVCNZ). The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21002 2025-11-27 cs.CV cs.AI 62%

Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning

知识完善视觉:一种多模态实体感知检索增强生成框架用于新闻图像描述

Xiaoxing You, Qiang Huang, Lingyu Li, Chi Zhang, Xiaopeng Liu, Min Zhang, Jun Yu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MERGE提出了一种多模态实体感知检索增强生成框架,通过构建实体中心知识库和改进跨模态对齐,提升新闻图像描述质量和命名实体识别性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17464 2025-11-27 cs.LG cs.AI stat.ML 62%

Data Valuation by Fusing Global and Local Statistical Information

通过融合全局和局部统计信息进行数据估值

Xiaoling Zhou, Ou Wu, Michael K. Ng, Hao Jiang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong Baptist University(香港 Baptist大学) Renmin University of China(中国人民大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出融合全局和局部统计信息的增强数据估值方法,通过正则化项优化Shapley值估计,并引入动态数据估值技术提升计算效率。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21066 2025-11-27 cs.CL cs.AI 57%

Context-Aware Pragmatic Metacognitive Prompting for Sarcasm Detection

面向上下文的元认知修辞提示用于讽刺检测

Michael Iskandardinata, William Christian, Derwin Suhartono

机构 * Computer Science Department(计算机科学系) School of Computer Science(计算机科学学院) Bina Nusantara University(宾努斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于检索的元认知修辞提示方法,通过整合上下文信息提升LLMs在讽刺检测中的性能,实验显示在多个数据集上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV 57%

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18513 2025-11-27 cs.LG 57%

Enhancing Training Data Attribution with Representational Optimization

通过表征优化增强训练数据归因

Weiwei Sun, Haokun Liu, Nikhil Kandpal, Colin Raffel, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 AirRep通过优化表征提升训练数据归因效率,实现与先进梯度方法相当的性能,且推理效率提高近两数量级。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21157 2025-11-27 cs.HC 50%

QuadStretcher: A Forearm-Worn Skin Stretch Display for Bare-Hand Interaction in AR/VR

QuadStretcher:一种可穿戴皮肤拉伸显示装置用于AR/VR中的裸手交互

Taejun Kim, Youngbo Aram Shim, Youngin Kim, Sunbum Kim, Jaeyeon Lee, Geehyuk Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QuadStretcher通过前臂皮肤拉伸显示技术,实现了裸手交互中的触觉反馈,提升了AR/VR沉浸感。

Comments ACM CHI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏