arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-05 至 2026-02-05 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2602.04515 2026-02-05 cs.RO cs.CV 85%

EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models

EgoActor: 通过视觉语言模型将任务规划接地于空间感知的自我中心动作以实现人形机器人

Yu Bai, MingMing Yu, Chaojie Li, Ziyi Bai, Xinlong Wang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 EgoActor通过视觉语言模型将高层任务指令转化为精确的空间感知动作,实现人形机器人在真实和模拟环境中的稳健任务规划与运动执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04699 2026-02-05 cs.CV 83%

Annotation Free Spacecraft Detection and Segmentation using Vision Language Models

无需标注的空间目标检测与分割使用视觉语言模型

Samet Hicsonmez, Jose Sosa, Dan Pineau, Inder Pal Singh, Arunkumar Rathinam, Abd El Rahman Shabayek, Djamila Aouada

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠性与信任跨学科研究中心(SnT),卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉语言模型的无标注空间目标检测与分割方法,通过伪标签蒸馏提升性能,实现在多个数据集上的精度提升。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO 82%

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(abstract)

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 79%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03071 2026-02-05 cs.CV 79%

Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding

无需训练即可找到最优视频片段:用于弱监督视频定位的高斯边界优化

Sunoh Kim, Kimin Yun, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GBO方法,通过解决优化问题提升弱监督视频定位的定位性能,无需训练且兼容多种提案架构。

Comments Accepted in IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03892 2026-02-05 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 75%

Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation

分段后审计:用于语言指代音频视频分段的无参考掩码质量评估

Jinxing Zhou, Yanghao Zhou, Yaoting Wang, Zongyan Han, Jiaqi Ma, Henghui Ding, Rao Muhammad Anwer, Hisham Cholakkal

机构 * MBZUAI National University of Singapore(国立新加坡大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04047 2026-02-05 cs.HC 71%

From Crafting Text to Crafting Thought: Grounding AI Writing Support to Writing Center Pedagogy

从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法

Yijun Liu, John Gallagher, Sarah Sterman, Tal August

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。

Comments Conditionally accepted to CHI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 67%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 62%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26275 2026-02-05 cs.SE cs.AI cs.ET cs.LG cs.MA 62%

A Research Roadmap for Augmenting Software Engineering Processes and Software Products with Generative AI

生成人工智能增强软件工程过程和软件产品的研究路线图

Domenico Amalfitano, Andreas Metzger, Marco Autili, Tommaso Fulcini, Tobias Hey, Jan Keim, Patrizio Pelliccione, Vincenzo Scotti, Anne Koziolek, Raffaela Mirandola, Andreas Vogelsang

机构 * University of Naples "Federico II" Napoli Italy Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Essen Germany Karlsruhe Institute of Technology (KIT) Karlsruhe Germany Gran Sasso Science Institute (GSSI) L'Aquila Italy University of Naples "Federico II" Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Karlsruhe Institute of Technology (KIT) Gran Sasso Science Institute (GSSI)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个生成人工智能增强软件工程的路线图,通过多轮过程整合证据,系统分析生成人工智能对软件工程过程、方法和工具的影响,并确定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01733 2026-02-05 cs.HC cs.AI cs.CV 62%

DISCOVER: Identifying Patterns of Daily Living in Human Activities from Smart Home Data

DISCOVER: 从智能家庭数据中识别日常生活的活动模式

Alexander Karpekov, Archith Iyer, Sourish Gunesh Dhekane, Sonia Chernova, Thomas Plötz

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 DISCOVER通过自监督学习和可视化接口,从智能家庭数据中发现日常活动模式,以更细粒度和个性化的方式识别居民行为,为健康监测和认知退化研究提供新方法。

Comments v2: Re-submission. Under review at IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-02-05 cs.CL cs.LG 57%

Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Koraş, Amin Dada, Julian Friedrich, François Beaulieu, Paul Vozila, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 57%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02164 2026-02-05 cs.LG cs.CR 57%

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam: 基于LLM代理的协同安全发现与利用

Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

机构 * Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Co-RedTeam通过整合安全知识、代码分析和执行反馈,提升漏洞发现与利用的自动化水平,实现超过60%的漏洞利用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04450 2026-02-05 cs.HC 50%

Can Theory-Informed Message Framing Drive Honest and Motivated Performance with Better Assessment Experiences in a Remote Assessment?

基于理论的信息框架能否通过更好的评估体验促进诚实和有动力的表现?

Suvadeep Mukherjee, Björn Rohles, Gabriele Lenzini, Pedro Cardoso-Leite

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过基于理论的信息框架减少作弊,同时保持表现和体验,发现不同理论概念的信息效果相似,且支持性动机干预更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏