arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 27 篇

2602.18763 2026-02-24 cs.CV cs.AI 84%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18702 2026-02-24 cs.CV cs.AI 81%

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20119 2026-02-24 cs.RO cs.AI cs.CV 79%

NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

NovaPlan: 通过闭环视频语言规划实现零样本长周期操控

Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris

机构 * Robotics and AI Institute(机器人与人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 NovaPlan通过闭环视频语言规划实现零样本长周期操控,结合高层任务分解与底层物理执行,无需先验演示即可完成复杂装配任务。

Comments 25 pages, 15 figures. Project webpage: https://nova-plan.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20648 2026-02-24 cs.CV 77%

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

LocateAnything3D: 基于视觉-语言的3D检测与链式视觉推理

Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 LocateAnything3D通过将3D检测转化为下一个token预测问题,实现了多目标3D检测,取得了Omni3D基准测试中的最佳成绩。

Comments Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19304 2026-02-24 cs.RO cs.AI cs.HC cs.MA 77%

Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation

安全且可解释的多模态路径规划用于多智能体协作

Haojun Shi, Suyu Ye, Katherine M. Guerrerio, Jianzhi Shen, Yifan Yin, Daniel Khashabi, Chien-Ming Huang, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00523 2026-02-24 cs.AI cs.CV 73%

VIRTUE: Visual-Interactive Text-Image Universal Embedder

VIRTUE: 视觉-交互文本-图像通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团有限公司) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。

Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 70%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 70%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI 70%

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 67%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19562 2026-02-24 cs.AI cs.CV 62%

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

一种多模态框架,用于将人类语言描述与视觉感知数据对齐

Joseph Bingham

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。

Comments 19 Pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04568 2026-02-24 cs.AI cs.CL cs.IR cs.LG 62%

Neurosymbolic Retrievers for Retrieval-augmented Generation

用于检索增强生成的神经符号检索器

Yash Saxena, Manas Gaur

机构 * Dept. of CSEE University of Maryland Baltimore County, Maryland, USA(电子工程系大学马里兰大学巴尔的摩县) Dept. of CSEE University of Maryland Baltimore County, MD, USA(电子工程系大学马里兰大学巴尔的摩县)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经符号 RAG 框架,通过结合知识图谱与神经检索技术,提升检索过程的透明性和生成性能。

Comments 8 pages, 2 Figures, Published in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11915 2026-02-24 cs.CL cs.AI cs.LG 62%

CORE: Measuring Multi-Agent LLM Interaction Quality under Game-Theoretic Pressures

CORE: 在博弈论压力下评估多智能体大语言模型交互质量

Punya Syon Pandey, Yongjin Yang, Jiarui Liu, Zhijing Jin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18880 2026-02-24 cs.CV cs.AI 62%

FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model

FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释

Zhou Liu, Tonghua Su, Hongshi Zhang, Fuxiang Yang, Donglin Di, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) DZ-Matrix Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) University of New South Wales(新南威尔士大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18540 2026-02-24 cs.CV cs.AI 62%

Rodent-Bench

Rodent-Bench:用于评估多模态大语言模型在啮齿动物行为标注中的性能

Thomas Heap, Laurence Aitchison, Emma Cahill, Adriana Casado Rodriguez

机构 * University of Bristol(布里斯托大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Rodent-Bench评估了多模态大语言模型在啮齿动物行为标注中的性能,发现现有模型存在时间分段、长视频处理和细微行为区分方面的挑战,为未来模型发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 57%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19308 2026-02-24 cs.RO cs.CV 57%

WildOS: Open-Vocabulary Object Search in the Wild

WildOS: 野外环境中的开放词汇物体搜索

Hardik Shah, Erica Tevere, Deegan Atha, Marcel Kaufmann, Shehryar Khattak, Manthan Patel, Marco Hutter, Jonas Frey, Patrick Spieler

机构 * Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院) Swiss Federal Institute of Technology(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院) FieldAI Inc.(FieldAI公司) Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV

AI总结 WildOS通过结合安全几何探索与语义视觉推理,实现野外环境中的开放词汇物体搜索,显著提升导航效率和自主性。

Comments 28 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19254 2026-02-24 cs.CV 57%

RegionRoute: Regional Style Transfer with Diffusion Model

RegionRoute: 区域风格迁移与扩散模型

Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Dolby Laboratories, Inc.(杜比实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18943 2026-02-24 cs.AI 57%

High Dimensional Procedural Content Generation

高维程序化内容生成

Kaijie Xu, Clark Verbrugge

机构 * McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 高维程序化内容生成通过引入非几何游戏维度作为联合状态空间的一级坐标,提升可控性和表现力,实现更广泛的游戏机制生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18811 2026-02-24 cs.CV 57%

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

跨域少样本目标检测中的多模态原型学习

Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) The University of Southern Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出LMP方法,通过结合文本和视觉信息,提升跨域少样本目标检测的精度和性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 57%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 57%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19560 2026-02-24 cs.HC 50%

Identifying, Explaining, and Correcting Ableist Language with AI

通过人工智能识别、解释和纠正歧视性语言

Kynnedy Simone Smith, Lydia B. Chilton, Danielle Bragg

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究探讨了大型语言模型在纠正歧视性语言和促进包容性沟通中的潜力,并通过实验评估了AI与人类注释在效果和用户偏好上的差异。

Comments 17 pages, 6 figures, Accepted for publication in CHI'26, Barcelona, Spain, April 13 - 17, 2026; CHI '26: ACM CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 50%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22774 2026-02-24 cs.CL 50%

Counting trees: A treebank-driven exploration of syntactic variation in speech and writing across languages

树的数量:一种基于树库的探索,研究语言中口语和写作中的句法变异

Kaja Dobrovoljc

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于树库的方法,研究口语和写作中句法结构的差异,发现口语结构较少且多样性低,揭示了模态特定的句法偏好。

Comments Accepted manuscript. Published in Corpus Linguistics and Linguistic Theory (2026)

Journal ref Corpus Linguistics and Linguistic Theory, 2026. Advance online publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 50%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏