arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2797 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2797 篇

2511.12937 2025-11-26 cs.AI cs.CV 62%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19417 2025-11-25 cs.CL cs.AI cs.LG 62%

Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration

Be My Eyes: 通过多智能体协作扩展大型语言模型到新模态

James Y. Huang, Sheng Zhang, Qianchu Liu, Guanghui Qin, Tinghui Zhu, Tristan Naumann, Muhao Chen, Hoifung Poon

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 BeMyEyes通过多智能体协作扩展LLMs到多模态推理,利用高效VLMs与强大LLMs的互补优势,实现轻量级开源解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19046 2025-11-25 cs.CV cs.AI 62%

MedSAM3: Delving into Segment Anything with Medical Concepts

MedSAM3:深入探索医学概念中的分割任务

Anglin Liu, Rundong Xue, Xu R. Cao, Yifan Shen, Yi Lu, Xiang Li, Qianqian Chen, Jintai Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM3通过引入可文本提示的医学分割模型,实现了基于开放词汇文本描述的精准解剖结构分割,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15997 2025-11-21 cs.AI cs.MM 62%

Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art

Sensorium Arc:面向海洋数据探索与交互生态艺术的AI代理系统

Noah Bissell, Ethan Paley, Joshua Harrison, Juliano Calil, Myungin Lee

机构 * Immersive Media Design University of Maryland College Park(沉浸媒体设计大学马里兰大学学院公园分校) Center for the Study of the Force Majeure University of California, Santa Cruz(重大研究机构加州大学圣克鲁兹分校) Virtual Planet Technologies(虚拟星球技术)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 Sensorium Arc通过AI代理将海洋数据转化为生动叙事,结合科学洞察与生态诗意,实现沉浸式环境数据探索与交互生态艺术

Comments (to appear) NeurIPS 2025 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15370 2025-11-20 cs.CL cs.AI 62%

The Empowerment of Science of Science by Large Language Models: New Tools and Methods

Guoqiang Liang, Jingqian Gong, Mengxuan Li, Gege Lin, Shuo Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments The manuscript is currently ongoing the underreview process of the journal of information science

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11751 2025-11-18 cs.CV cs.AI cs.MA 62%

Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Zhenghao He, Aidong Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09956 2025-11-17 cs.LG cs.AI cs.CV cs.ET 62%

DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey

Yu Qiao, Phuong-Nam Tran, Ji Su Yoon, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * Kyung Hee University(韩国庆熙大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments 45 pages, 12 figures

Journal ref ACM Computing Surveys, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10705 2025-11-17 cs.AI cs.CL 62%

Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents

Yuan Zhao, Hualei Zhu, Tingyu Jiang, Shen Li, Xiaohang Xu, Hao Henry Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05965 2025-11-11 cs.CV cs.AI 62%

Adaptive Agent Selection and Interaction Network for Image-to-point cloud Registration

Zhixin Cheng, Xiaotian Yin, Jiacheng Deng, Bohao Liao, Yujia Chen, Xu Zhou, Baoqun Yin, Tianzhu Zhang

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06733 2025-11-06 cs.AI cs.CL cs.IR 62%

Reinforcement Learning Foundations for Deep Research Systems: A Survey

Wenjun Li, Zhi Chen, Jingru Lin, Hannan Cao, Wei Han, Sheng Liang, Zhi Zhang, Kuicai Dong, Dexun Li, Chen Zhang, Yong Liu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments 39 pages, second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20637 2025-11-06 cs.LG cs.AI cs.CL 62%

GDS Agent for Graph Algorithmic Reasoning

Borun Shi, Ioannis Panagiotas

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27210 2025-11-03 cs.AI cs.CV 62%

GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation

Tao Liu, Chongyu Wang, Rongjie Li, Yingchen Yu, Xuming He, Bai Song

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02652 2025-11-03 cs.AI cs.CL cs.IR 62%

HiRA: A Hierarchical Reasoning Framework for Decoupled Planning and Execution in Deep Search

Jiajie Jin, Xiaoxi Li, Guanting Dong, Yuyao Zhang, Yutao Zhu, Yang Zhao, Hongjin Qian, Zhicheng Dou

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CL、cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24760 2025-10-30 cs.CL cs.AI 62%

Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise Environments

Mengyuan Chen, Chengjun Dai, Xinyang Dong, Chengzhe Feng, Kewei Fu, Jianshe Li, Zhihan Peng, Yongqi Tong, Junshao Zhang, Hong Zhu

机构 * Industrial Brain Team, Dingtalk, Alibaba Group(钉钉工业大脑团队,钉钉,阿里巴巴集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15963 2025-10-28 cs.CV cs.AI cs.LG 62%

ESCA: Contextualizing Embodied Agents via Scene-Graph Generation

Jiani Huang, Amish Sethi, Matthew Kuo, Mayank Keoliya, Neelay Velingker, JungHo Jung, Ser-Nam Lim, Ziyang Li, Mayur Naik

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted as a Spotlight Paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15566 2025-10-28 cs.CV cs.AI 62%

BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent

Shaojie Zhang, Ruoceng Zhang, Pei Fu, Shaokang Wang, Jiahui Yang, Xin Du, Shiqi Cui, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

机构 * Xiaomi Inc(小米公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21900 2025-10-28 cs.CL cs.AI 62%

Deep Literature Survey Automation with an Iterative Workflow

Hongbo Zhang, Han Cui, Yidong Wang, Yijian Tian, Qi Guo, Cunxiang Wang, Jian Wu, Chiyu Song, Yue Zhang

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Peking University(北京大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19245 2025-10-23 cs.CY cs.AI cs.HC cs.LG cs.MM 62%

See, Think, Act: Online Shopper Behavior Simulation with VLM Agents

Yimeng Zhang, Jiri Gesi, Ran Xue, Tian Wang, Ziyi Wang, Yuxuan Lu, Sinong Zhan, Huimin Zeng, Qingjun Cui, Yufan Guo, Jing Huang, Mubarak Shah, Dakuo Wang

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Northeastern University(东北大学) Northwestern University(西北大学) University of Central Florida(佛罗里达中央大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17462 2025-10-20 cs.RO cs.AI cs.CV 62%

General-Purpose Robotic Navigation via LVLM-Orchestrated Perception, Reasoning, and Acting

Bernard Lange, Anil Yildiz, Mansur Arief, Shehryar Khattak, Mykel Kochenderfer, Georgios Georgakis

机构 * Stanford University(斯坦福大学) Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11260 2025-10-14 cs.CV cond-mat.mtrl-sci cs.AI physics.data-an 62%

A Large-Language-Model Assisted Automated Scale Bar Detection and Extraction Framework for Scanning Electron Microscopic Images

Yuxuan Chen, Ruotong Yang, Zhengyang Zhang, Mehreen Ahmed, Yanming Wang

机构 * Shanghai Jiao Tong Global College(上海交通大学全球学院) Shanghai Jiao Tong University(上海交通大学) Global Institute of Future Technology(全球未来技术研究院) AI Lab, Xiaomi Corporation(小米公司AI实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07634 2025-10-07 cs.RO cs.AI cs.CV 62%

Neural Brain: A Neuroscience-inspired Framework for Embodied Agents

Jian Liu, Xiongtao Shi, Thai Duy Nguyen, Haitian Zhang, Tianxiang Zhang, Wei Sun, Yanjie Li, Athanasios V. Vasilakos, Giovanni Iacca, Arshad Ali Khan, Arvind Kumar, Jae Won Cho, Ajmal Mian, Lihua Xie, Erik Cambria, Lin Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Department of Information and Communication Technology, University of Agder(阿格德大学信息与通信技术系) Department of Information Engineering and Computer Science, University of Trento(特伦特大学信息工程与计算机科学系) Elm Company(Elm公司) Division of Computational Science and Technology, KTH Royal Institute of Technology(皇家理工学院计算科学与技术系) School of Artificial Intelligence and Data Science, Sejong University(世宗大学人工智能与数据科学学院) Department of Computer Science of the University of Western Australia(西澳大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments 51 pages, 17 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04039 2025-10-07 cs.CV cs.AI 62%

\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding

Bin Lei, Nuo Xu, Ali Payani, Mingyi Hong, Chunhua Liao, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04023 2025-10-07 cs.AI cs.CL 62%

LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions

Mizanur Rahman, Amran Bhuiyan, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Ridwan Mahbub, Ahmed Masry, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Vector Institute for AI(人工智能矢量研究所) Dialpad Inc.(Dialpad公司) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Survey paper; 45 data science agents; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24133 2025-09-30 cs.CV cs.CL 62%

Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding

Zhecheng Li, Guoxian Song, Yiwei Wang, Zhen Xiong, Junsong Yuan, Yujun Cai

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) University of California, Merced(加州大学默塞德分校) University of Southern California(南加州大学) University at Buffalo(布法罗大学) The University of Queensland(昆士兰大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22631 2025-09-29 cs.CV cs.CL 62%

LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision

Debargha Ganguly, Sumit Kumar, Ishwar Balappanawar, Weicong Chen, Shashank Kambhatla, Srinivasan Iyengar, Shivkumar Kalyanaraman, Ponnurangam Kumaraguru, Vipin Chaudhary

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15275 2025-09-25 cs.CV cs.AI 62%

Challenges and Trends in Egocentric Vision: A Survey

Xiang Li, Heqian Qiu, Lanxiao Wang, Hanwen Zhang, Chenghao Qi, Linfeng Han, Huiyu Xiong, Hongliang Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

Comments This article was accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14480 2025-09-25 cs.RO cs.CL cs.CV cs.LG 62%

GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering

Saumya Saxena, Blake Buchanan, Chris Paxton, Peiqi Liu, Bingqing Chen, Narunas Vaskevicius, Luigi Palmieri, Jonathan Francis, Oliver Kroemer

机构 * Carnegie Mellon University(卡内基梅隆大学) Neya Systems(Neya系统) Agility Robotics(敏捷机器人) Hello Robot Bosch Center for AI(博世人工智能中心)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Project website: https://saumyasaxena.github.io/grapheqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10571 2025-09-23 cs.AI cs.CL 62%

Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning

Konstantinos I. Roumeliotis, Ranjan Sapkota, Manoj Karkee, Nikolaos D. Tselikas

机构 * University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃蒙特大学信息与电信系) Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12279 2025-09-17 cs.CV cs.AI 62%

Domain Adaptive SAR Wake Detection: Leveraging Similarity Filtering and Memory Guidance

He Gao, Baoxiang Huang, Milena Radenkovic, Borui Li, Ge Chen

机构 * College of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) Laboratory for Regional Oceanography and Numerical Modeling, Qingdao Marine Science and Technology Center(青岛海洋科学与技术中心区域海洋学与数值模拟实验室) School of Computer Science and Information Technology, The University of Nottingham(诺丁汉大学计算机科学与信息学院) State Key Laboratory of Physical Oceanography, Department of Marine Technology, Ocean University of China(中国海洋大学物理海洋学国家重点实验室,海洋技术系)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12618 2025-09-17 cs.RO cs.AI cs.CV 62%

ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation

Zekai Zhang, Weiye Zhu, Hewei Pan, Xiangchen Wang, Rongtao Xu, Xing Sun, Feng Zheng

机构 * Southern University of Science and Technology, China(南方科技大学,中国) Spatialtemporal AI, China(时空AI,中国) MBZUAI, UAE(MBZUAI,阿联酋) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏