arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2602.03028 2026-02-04 cs.CV 77%

MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration

MUSE:一种通过闭环认知协调的多智能体框架用于无约束故事构思

Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen

机构 * Li Auto(利奥自动化)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 MUSE通过闭环认知协调的多智能体框架,提升长篇叙事的连贯性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03320 2026-02-04 cs.CV cs.AI 62%

MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning

MedSAM-Agent: 通过多轮代理强化学习赋能交互式医学图像分割

Shengyuan Liu, Liuxin Bao, Qi Yang, Wanting Geng, Boyun Zheng, Chenxin Li, Wenting Chen, Houwen Peng, Yixuan Yuan

机构 * Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hunyuan Group, Tencent(腾讯洪音集团) Institute of Automation, the Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Dalian University of Technology, Dalian, China(大连理工大学) Stanford University, Stanford, USA(斯坦福大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM-Agent通过多轮代理强化学习提升医学图像分割的交互效率与准确性

Comments 23 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 62%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00197 2026-02-04 q-bio.QM cs.AI cs.CL 62%

Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction

Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测

Yang Tan, Yuanxi Yu, Can Wu, Bozitao Zhong, Mingchen Li, Guisheng Fan, Jiankang Zhu, Yafeng Liang, Nanqing Dong, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science(南方大学(科学)) East China University of Science and Technology(东中国科学与技术大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。

Comments 22 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03376 2026-02-04 cs.RO cs.CV 57%

PlanTRansformer: Unified Prediction and Planning with Goal-conditioned Transformer

PlanTRansformer: 一种结合目标条件变换器的统一预测与规划

Constantin Selzer, Fabina B. Flohr

机构 * Department of Electrical Engineering and Information Technology, Intelligent Vehicles Lab (IVL), Munich University of Applied Science(电气工程与信息科技系,智能车辆实验室(IVL),慕尼黑应用科学大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 PlanTRansformer通过整合目标条件预测、动态可行性等技术,提升自动驾驶中的预测与规划性能。

Comments Submitted and accepted at IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02961 2026-02-04 cs.AI 57%

Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth

生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架

Faye Zhang, Qianyu Cheng, Jasmine Wan, Vishwakarma Singh, Jinfeng Rao, Kofi Boakye

机构 * Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 50%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02959 2026-02-04 cs.LG cs.SY eess.SY 50%

Human-Centric Traffic Signal Control for Equity: A Multi-Agent Action Branching Deep Reinforcement Learning Approach

以人为中心的交通信号控制以实现公平性:一种多智能体动作分支深度强化学习方法

Xiaocai Zhang, Neema Nassir, Lok Sang Chan, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种以人为中心的多智能体动作分支深度强化学习方法,通过分解交通走廊控制并优化旅行者公平性,有效减少受延迟旅行者数量,提升交通信号系统的公平性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12311 2026-02-04 cs.RO 50%

Scene-Adaptive Motion Planning with Explicit Mixture of Experts and Interaction-Oriented Optimization

场景自适应运动规划与显式专家混合及交互导向优化

Hongbiao Zhu, Liulong Ma, Xian Wu, Xin Deng, Xiaoyao Liang

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪公司自动驾驶新技术研究院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EMoE-Planner,通过显式专家混合和交互导向优化,解决复杂城市环境中自主驾驶轨迹规划的多模态、场景多样性和环境交互问题,实现超越传统规则算法的性能。

Comments Main text 10 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏