arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2797 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2797 篇

2603.04819 2026-03-06 cs.RO cs.AI cs.LG 70%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22939 2026-03-02 cs.CV 70%

ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

ColaVLA: 借助认知潜在推理实现自动驾驶中的分层并行轨迹规划

Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li

机构 * Tsinghua University(清华大学) CUHK MMLab(香港中文大学MMLab) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ColaVLA通过统一视觉-语言-动作框架,解决自动驾驶中轨迹规划的效率与准确性问题,实现高效、安全的多尺度轨迹生成。

Comments CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 70%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08368 2026-02-10 cs.MM cs.GR cs.HC cs.MA 70%

T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring

T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作

Zhuoyun Zheng, Yu Dong, Gaorong Liang, Guan Li, Guihua Shan, Shiyu Cheng, Dong Tian, Jianlong Zhou, Jie Liang

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.MM

AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-02-09 cs.LG cs.CL cs.RO 70%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV 70%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04144 2026-02-05 cs.AI cs.LG 70%

OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows

OMG-Agent:迈向鲁棒缺失模态生成的解耦粗到细代理工作流

Ruiting Dai, Zheyu Wang, Haoyu Yang, Yihan Liu, Chengzhi Wang, Zekun Zhang, Zishan Huang, Jiaman Cen, Lisi Mo

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 OMG-Agent通过解耦粗到细的代理工作流,有效解决多模态数据缺失问题,提升生成的鲁棒性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 70%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 70%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00598 2026-01-05 cs.CV 70%

Modality Dominance-Aware Optimization for Embodied RGB-Infrared Perception

具身RGB-红外感知的模态主导意识优化

Xianhui Liu, Siqi Jiang, Yi Xie, Yuqing Lin, Siao Liu

机构 * College of Electronics and Information Engineering(电子信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系) School of Future Science and Engineering(未来科学与工程学院) Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities(省属大学通用人工智能与大模型重点实验室)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MDACL框架,通过模态主导指数量化模态主导性,结合分层跨模态指导和对抗均衡正则化,有效缓解跨模态融合中的优化偏差,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22009 2025-12-29 cs.CV 70%

iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

iSHIFT: 轻量级慢-快 GUI 代理与自适应感知

Sarthak Mehrotra, Sairam V C Rebbapragada, Mani Hemanth Reddy Bonthu, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买) Indian Institute of Technology, Hyderabad(印度理工学院,海得拉巴)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 iSHIFT是一种轻量级GUI代理,通过慢-快混合推理和灵活标记实现高效与精确的视觉交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19933 2025-12-24 cs.CL 70%

PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation

PRISM: 一种基于个性的多智能体框架用于社交媒体模拟

Zhixiang Lu, Xueyuan Deng, Yiran Liu, Yulong Li, Qiang Yan, Imran Razzak, Jionglong Su

机构 * University of Liverpool(利物浦大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University College London(伦敦大学学院) Xi'an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Chinese Academy of Sciences(中国科学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 PRISM通过结合连续情绪演变与基于个性的决策过程,提供了一种更准确模拟社交媒体中个性驱动意见极化的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 70%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19865 2025-11-26 cs.AI 70%

Agentic AI-Empowered Conversational Embodied Intelligence Networks in 6G

基于代理AI的6G时代对话具身智能网络

Mingkai Chen, Zijie Feng, Lei Wang, Yaser Khamayseh

机构 * Key Laboratory of Broadband Wireless Communication and Sensor Network Technology(宽带无线通信与传感网络技术重点实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) College of Technological Innovation(技术创新学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于代理AI的6G时代对话具身智能网络,通过多模态融合、自适应通信和可解释性模块,提升复杂任务执行效率与语义一致性。

Comments 7 pages, 8 figures. Preprint submitted to IEEE Vehicle Technology Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06417 2025-11-11 cs.AI 70%

AUTO-Explorer: Automated Data Collection for GUI Agent

Xiangwu Guo, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20462 2025-11-06 cs.AI 70%

TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems

Xiao Zhang, Qi Wang, Mingyi Li, Yuan Yuan, Mengbai Xiao, Fuzhen Zhuang, Dongxiao Yu

机构 * School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27363 2025-11-03 cs.AI 70%

ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use

Mengjie Deng, Guanting Dong, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21809 2025-10-28 cs.CV cs.RO 70%

Embodied Navigation with Auxiliary Task of Action Description Prediction

Haru Kondoh, Asako Kanezaki

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(日本科学技术研究所AIP)

专题命中 多模态Agent :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments ICCV 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20838 2025-10-27 cs.AI cs.MA 70%

Sketch2BIM: A Multi-Agent Human-AI Collaborative Pipeline to Convert Hand-Drawn Floor Plans to 3D BIM

Abir Khan Ratul, Sanjay Acharjee, Somin Park, Md Nazmus Sakib

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09507 2025-10-13 cs.CV cs.RO 70%

PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs

Zixin Zhang, Kanghao Chen, Xingwang Lin, Lutao Jiang, Xu Zheng, Yuanhuiyi Lyu, Litao Guo, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Beihang University(北航大学) Knowin

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25185 2025-09-30 cs.CV 70%

PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images

Shuoshuo Zhang, Zijian Li, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Yujiu Yang, Rui Wang

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20499 2025-09-26 cs.RO cs.AI 70%

Boosting Zero-Shot VLN via Abstract Obstacle Map-Based Waypoint Prediction with TopoGraph-and-VisitInfo-Aware Prompting

Boqi Li, Siyuan Li, Weiyi Wang, Anran Li, Zhong Cao, Henry X. Liu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12026 2025-09-26 cs.CV 70%

3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering

Rongtao Xu, Han Gao, Mingming Yu, Dong An, Shunpeng Chen, Changwei Wang, Li Guo, Xiaodan Liang, Shibiao Xu

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15635 2025-09-22 cs.AI 70%

MicroRCA-Agent: Microservice Root Cause Analysis Method Based on Large Language Model Agents

Pan Tang, Shixiang Tang, Huanqi Pu, Zhiqing Miao, Zhixing Wang

机构 * School of Communication and Information Engineering, Shanghai University, Shanghai, China(上海大学通信与信息工程学院) School of Communication and Electronic Engineering, East China Normal University, Shanghai, China(华东师范大学通信与电子工程学院) School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 18 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11824 2025-09-18 cs.HC cs.AI 70%

AppAgent v2: Advanced Agent for Flexible Mobile Interactions

Yanda Li, Chi Zhang, Wenjia Jiang, Wanqi Yang, Bin Fu, Pei Cheng, Xin Chen, Ling Chen, Yunchao Wei

机构 * University of Technology Sydney(悉尼技术大学) Tencent(腾讯) Beijing Jiaotong University(北京交通大学) Westlake University(西湖大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01275 2025-09-04 cs.CV 70%

Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation

Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2025-09-04 cs.RO cs.CV 70%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10414 2025-08-13 eess.IV cs.CV 70%

Style transfer between Microscopy and Magnetic Resonance Imaging via Generative Adversarial Network in small sample size settings

Monika Pytlarz, Adrian Onicas, Alessandro Crimi

机构 * Sano – Centre for Computational Personalised Medicine(Sano 个性化医学计算中心)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 2023 IEEE International Conference on Image Processing (ICIP)

Journal ref 2023 IEEE International Conference on Image Processing (ICIP), Kuala Lumpur, Malaysia, 2023, pp. 1120-1124

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17462 2025-07-24 cs.CV 70%

ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents

Chang Nie, Guangming Wang, Zhe Lie, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Key Laboratory of System Control and Information Processing, Ministry of Education of China(自动化与智能感知学院,上海交通大学;系统控制与信息处理重点实验室,中华人民共和国教育部)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏