arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2601.19151 2026-08-31 cs.AI cs.MA 版本更新 83%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 80%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 80%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27994 2026-08-31 cs.CR cs.SE 新提交 78%

Moirae: A Multimodal Agent Collaborative Framework for Dynamic Android Malware Detection

Moirae:用于动态Android恶意软件检测的多模态智能体协作框架

Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究提出多模态智能体协作框架Moirae,通过融合多维度运行时证据实现动态Android恶意软件检测,在未见过的数据集上零样本准确率达90.06%,优于现有基线且抗概念漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 74%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 70%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-08-31 cs.LG cs.AI cs.CV cs.RO eess.SY 版本更新 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-08-31 cs.AI 版本更新 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28437 2026-08-31 eess.SY cs.RO 新提交 50%

LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control

LUCID:一种用于QoS保障机器人控制的闭环数字孪生智能体AI框架

Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu, Hyun Jong Yang

专题命中 多模态Agent :multimodal(abstract)

AI总结 LUCID是一种LLM智能体编排的云机器人框架,将TP-RRM动态编排于DITL环境,结合路径规划与RRM验证器,可适应动态条件并降低规划延迟,保障机器人控制的QoS。

Comments 10 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏