arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-02 至 2026-03-02 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2602.23806 2026-03-02 cs.CV cs.AI 86%

See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent

看见、行动、适应:通过个性化VLM引导代理的主动感知用于无监督跨域视觉适应

Tianci Tang, Tielong Cai, Hongwei Wang, Gaoang Wang

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Sea$^2$通过智能姿态控制代理实现无监督跨域视觉适应,利用现成感知模型提升视觉任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18471 2026-03-02 cs.IR cs.AI cs.CL cs.LG q-fin.ST 81%

FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data

FinBloom:基于实时金融数据的知识引导大型语言模型

Ankur Sinha, Chaitanya Agarwal, Pekka Malo

机构 * Indian Institute of Management Ahmedabad(印度管理学院阿赫迈德亚德分校) Aalto University School of Business(阿尔托大学商学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 FinBloom通过实时金融数据增强LLMs能力,实现高效金融任务处理。

Comments 39 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23677 2026-03-02 cs.CV 79%

Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation

面向多领域作物杂草分割的视觉-语言语义定位

Nazia Hossain, Xintong Jiang, Yu Tian, Philippe Seguin, O. Grant Clark, Shangpeng Sun

机构 * Department of Bioresource Engineering, McGill University(生物资源工程系,麦吉尔大学) Department of Plant Science, McGill University(植物科学系,麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 VL-WS通过视觉-语言对齐实现多领域作物杂草细粒度分割,提升泛化能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24143 2026-03-02 cs.RO 78%

Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking

稳健的技能,脆弱的接地:通过多对象拾取诊断视觉语言动作策略中的受限泛化

David Emukpere, Romain Deffayet, Jean-Michel Renders

机构 * Naver Labs Europe(纳维尔实验室欧洲)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 通过多对象拾取实验发现,视觉语言动作策略在复杂环境下执行基本操作比遵循指令更可靠,表明技能获取与指令遵循脱节,需改进基准测试以更准确诊断泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 70%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-03-02 cs.CV 70%

LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, SP Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14896 2026-03-02 cs.CV 70%

Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection

利用多模态大语言模型对活动的描述进行可解释的半监督视频异常检测

Furkan Mumcu, Michael J. Jones, Anoop Cherian, Yasin Yilmaz

机构 * Department of Electrical Engineering University of South Florida(电气工程系 佛罗里达州立大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型描述活动,以实现可解释的半监督视频异常检测,有效检测复杂交互异常并提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 67%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24021 2026-03-02 cs.CV 57%

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection

在冻结的多模态大语言模型中引导和校正潜在表示流形以进行视频异常检测

Zhaolin Cai, Fan Li, Huiyu Duan, Lijun He, Guangtao Zhai

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 SteerVAD通过引导和校正冻结多模态大语言模型的潜在表示流形,提升视频异常检测的性能,仅需1%训练数据即达最优效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23869 2026-03-02 cs.CV 57%

Open-Vocabulary Semantic Segmentation in Remote Sensing via Hierarchical Attention Masking and Model Composition

通过层次化注意力掩码和模型组合实现遥感开放词汇语义分割

Mohammadreza Heidarianbaei, Mareike Dorozynski, Hubert Kanyamahanga, Max Mehltretter, Franz Rottensteiner

机构 * Institute of Photogrammetry and GeoInformation(摄影测量与地理信息研究所)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 ReSeg-CLIP通过层次化注意力掩码和模型组合方法,实现无需训练的遥感开放词汇语义分割,取得最优性能。

Comments Published in the proceedings of the British Machine Vision Conference Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23656 2026-03-02 cs.CL cs.AI 57%

TRIZ-RAGNER: A Retrieval-Augmented Large Language Model for TRIZ-Aware Named Entity Recognition in Patent-Based Contradiction Mining

TRIZ-RAGNER: 一种用于基于专利矛盾挖掘的TRIZ-aware命名实体识别的检索增强型大语言模型

Zitong Xu, Yuqing Wu, Yue Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TRIZ-RAGNER通过整合TRIZ知识和检索增强技术,提升专利矛盾挖掘中命名实体识别的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06940 2026-03-02 cs.DB cs.AI 57%

VISTA: Knowledge-Driven Vessel Trajectory Imputation with Repair Provenance

VISTA: 基于知识的船舶轨迹补全与修复溯源

Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Tiancheng Zhang, Yushuai Li, Christian S. Jensen

机构 * Department of Computer Science, Aalborg University, Denmark(计算机科学系,奥胡斯大学,丹麦) School of Computer Science and Engineering, Northeastern University, Shenyang, China(计算机科学与工程学院,东北大学,沈阳,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 VISTA通过基于知识的可解释方法实现船舶轨迹补全,生成修复溯源以提升下游决策的可信度和效率。

Comments 24 pages, 14 figures, 4 algorithms, 8 tables. Code available at https://github.com/hyLiu1994/VISTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19364 2026-03-02 cs.AI cs.MA 57%

Integrating LLM in Agent-Based Social Simulation: Opportunities and Challenges

将大语言模型整合到基于代理的社会模拟中:机遇与挑战

Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard, Benoit Gaudou, Nghi Quang Huynh, Alexis Drogoul

机构 * UR MIAT, University of Toulouse, INRAE, Castanet-Tolosan, France(法国图卢兹大学UR MIAT,INRAE,Castanet-Tolosan分校) UMI 209 UMMISCO, IRD/Sorbonne University, Bondy, France(法国Bondy IRD/索邦大学UMI 209 UMMISCO) LMI ACROSS, Thuyloi University, Hanoi, Vietnam(越南胡志明大学LMI ACROSS) UMR 5505 IRIT, University of Toulouse Capitole, Toulouse, France(法国图卢兹大学Capitole UMR 5505 IRIT) CICT, Can Tho University, Can Tho, Vietnam(越南金瓯大学CICT)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在社会模拟中的应用,分析其潜力与局限,并提出混合宪法架构作为整合LLM与传统代理模型的可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24241 2026-03-02 cs.IR cs.HC 50%

UXSim: Towards a Hybrid User Search Simulation

UXSim: 向混合用户搜索模拟迈进

Saber Zerhoudi, Michael Granitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 UXSim 通过整合传统模拟器与适应性 LLM 代理,提供更准确的用户行为模拟和可解释的验证方法。

Journal ref Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM '25), November 10--14, 2025, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24156 2026-03-02 cs.RO 50%

Humanoid Robots as First Assistants in Endoscopic Surgery

人形机器人作为内窥手术中的第一助手

Sue Min Cho, Jan Emily Mangulabnan, Han Zhang, Zhekai Mao, Yufan He, Pengfei Guo, Daguang Xu, Gregory Hager, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学院) NVIDIA Corporation(NVIDIA公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文展示了一人形机器人通过遥控协助完成尸体内窥手术,验证了其在手术辅助中的可行性并指出了后续发展的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15759 2026-03-02 cs.SD cs.MM eess.AS 50%

Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration

Sonic4D: 4D场景沉浸式探索的空间音频生成

Siyi Xie, Hanxin Zhu, Xinyi Chen, Tianyu He, Xin Li, Zhibo Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Sonic4D通过生成与4D场景一致的空间音频,提升沉浸式4D场景探索体验。

Comments 17 pages, 7 figures. Project page: https://x-drunker.github.io/Sonic4D-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏