arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2821 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2821 篇

1302.7096 2026-06-03 cs.NE cs.SY eess.SY 50%

Using Artificial Intelligence Models in System Identification

使用人工智能模型进行系统辨识

Wesam Elshamy

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究修改遗传算法和粒子群优化算法以适应系统辨识的多模态问题,并应用于感应电机参数辨识,结果表明粒子群优化算法在多模态问题上优于遗传算法。

Comments MSc. Thesis, Electrical Power and Machines Dept. Cairo University, Egypt, May 2007

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01667 2026-06-02 cs.LG 50%

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS: 智能体测试时学习分配缩放

Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出ATLAS框架,让LLM编排器通过单一

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 50%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27095 2026-06-02 cs.LG 50%

Adversarial Dual On-Policy Distillation from Expressive Teacher

来自表达性教师的对抗性双在线策略蒸馏

Zhenglin Wan, Jingxuan Wu, Xingrui Yu, Chubin Zhang, Mingcong Lei, Bo An, Ivor W. Tsang, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出FA-OPD方法,通过对抗性双在线策略蒸馏,结合流匹配教师和轻量MLP学生,利用奖励和动作双通道信号,在机器人导航、操作和运动任务中优于强基线,且对噪声和有限演示鲁棒。

Comments arXiv admin note: substantial text overlap with arXiv:2510.09222

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24881 2026-06-02 cs.RO 50%

Learning Transferable Motor Skills for Geometry-Aware Robotic Surface Tasks

面向几何感知的机器人表面任务的可迁移运动技能学习

Miroslav David, Karla Stepanova, Robert Babuska

机构 * Czech Institute of Informatics, Robotics, and Cybernetics(捷克信息学、机器人学与自动化研究所) Czech Technical University in Prague(布拉格捷克技术大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种模块化框架,将几何运动规划与执行级专家行为解耦,通过可解释的原子运动规则和神经网络推断,实现跨几何形状的迁移学习。

Comments In: Workshop on Geometry in the Age of Data-Driven Robotics, ICRA 2026, Vienna, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30539 2026-06-01 cs.MA 50%

A Theory-Guided LLM Pedagogical Agent for STEM+C Scaffolding Without Over-Reliance

理论引导的LLM教学代理:用于STEM+C支架式教学,避免过度依赖

Clayton Cohn, Surya Rayala, Siyuan Guo, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Ryan Li, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Ashwin T S, Meiyi Ma, Gautam Biswas

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于证据-决策-反馈框架的多智能体协作代理Copa,结合社会认知理论与社会建构主义,通过自适应对话支持促进STEM+C学习,实验证明其能增强学生信心和概念表达能力而不导致依赖。

Comments Submitted to Computers & Education. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14324 2026-06-01 stat.ML cs.LG 50%

Learning-to-Defer with Expert-Conditional Advice

基于专家条件建议的学习-延迟决策

Yannis Montreuil, Leïna Montreuil, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi

机构 * School of Computing(计算学院) Département de Mathématiques(数学系) National University of Singapore(新加坡国立大学) Sorbonne University(索邦大学) Fédération ENAC(ENAC联合会) ISAE-SUPAERO ONERA Agency for Science, Technology and Research(科技研究局) Université de Toulouse(图卢兹大学) Institute for Infocomm Research(信息与通信研究所)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究在决策时可为专家提供额外信息(建议)的延迟学习问题,提出一种在复合专家-建议动作空间上的增广替代损失,并证明其一致性保证和最优策略恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22743 2026-05-29 physics.med-ph cond-mat.mtrl-sci physics.bio-ph 50%

Combining quasi-static and high frequency experiments for the viscoelastic characterization of brain tissue

结合准静态和高频实验对脑组织进行粘弹性表征

Laura Ruhland, Nina Reiter, Silvia Budday, Kai Willner

专题命中 多模态Agent :multi-modal(abstract)

AI总结 通过准静态大应变流变仪和高频磁共振弹性成像实验,校准分数阶Kelvin-Voigt模型,统一不同时间尺度的脑组织力学行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05968 2026-05-29 cs.LG cs.MA 50%

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

离线多智能体强化学习通过序列得分分解

Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Computer Science, Tongji University, Shanghai, China(同济大学计算机科学学院) Vector Institute(向量研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对离线合作多智能体强化学习中联合动作空间高维和异质行为数据导致的策略分布偏移问题,提出序列得分函数分解方法,利用扩散模型从多模态离线数据中学习每个智能体的正则化信号,指导策略更新至高分、分布内区域,在多个粒子环境和多智能体MuJoCo基准上实现最先进性能。

Comments ICML 2026 Accepted

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25007 2026-05-26 cs.IR 50%

Meta-Modal Agent: Sequential Evidence Routing for Missing-Modality Candidate Reranking

元模态智能体:面向缺失模态候选重排序的序列证据路由

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Zhishu Shen, Jiong Jin, Zhu Sun

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出元模态智能体(MMA),将缺失模态问题转化为序列证据路由任务,通过基于大语言模型的候选池重排序器,结合平衡缺失任务强化学习,在冷启动场景下显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24203 2026-05-26 cs.RO 50%

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance

Afford-VLA:通过内化可操作性实现动作对齐的视觉规划

Runze Wang, Yuqian Fu, Yu Li, Tao Lin, Tianwen Qian, Mohamed Elhoseiny, Bo Zhao, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) KAUST(康斯坦丁·亚历山大科研大学) SJTU(上海交通大学) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出Afford-VLA框架,通过内化任务条件可操作性作为显式视觉规划接口,利用可学习<AFF>令牌查询交互区域并解码为紧凑嵌入以直接条件化动作生成,在多个模拟基准上取得最先进性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21844 2026-05-22 nlin.AO cond-mat.stat-mech physics.soc-ph 50%

A Utility-Driven Bounded-Confidence Model for Opinion Dynamics

基于效用的有界信心意见动力学模型

Alex Siebenmorgen, Juan G. Restrepo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于效用的有界信心模型,研究意见动态中的社会影响,通过效用景观和学习率确定有效势能,并展示多模态效用函数下的意见状态切换和集群合并。

Comments 5 pages with 4 figures plus Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21406 2026-05-21 cs.RO 50%

MC-Risk: Multi-Component Risk Fields for Risk Identification and Motion Planning

MC-Risk:多组件风险场用于风险识别和运动规划

Maximilian Link, Yingjie Xu, Yingbai Hu, Yinlong Liu

机构 * Technical University of Munich(慕尼黑技术大学) The Chinese University of Hong Kong(香港中文大学) City University of Macau(澳门城市大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24316 2026-05-15 cs.GR 50%

Large-Scale Photogrammetric Documentation of St. John's Co-Cathedral: A Workflow for Cultural Heritage Preservation

大规模摄影测量记录圣约翰共祭坛:文化保护的流程

Matthew Kenely, Mark Bugeja, Andre Grima, Peter Pullicino, Matthew Pullicino, Dylan Seychell

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文介绍了一种用于大规模摄影测量记录马耳他瓦莱塔圣约翰共祭坛的完整流程,该建筑为世界遗产,具有复杂的巴洛克建筑和卡拉瓦乔作品。通过七晚的夜间拍摄,采集了99,000张照片,利用DSLR相机、无人机和激光雷达扫描,生成包含25-30十亿三角形的高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14154 2026-05-15 physics.chem-ph 50%

TSAgent: An Agentic Workflow for Autonomous Transition State Search

TSAgent:一种用于自主过渡态搜索的智能工作流

Varun Madhavan, Ankit Mathanker, Dean M. Sweeney, Oluwatosin A. Ohiro, Yixin Wang, Bryan R. Goldsmith

专题命中 多模态Agent :multimodal(abstract)

AI总结 TSAgent通过持续的计划-执行-分析-重新计划循环,自动在密度泛函理论水平上搜索过渡态,实现了83%的准确率,并在对比实验中表现出优于人类专家的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06138 2026-05-14 cs.LG 50%

Flow Matching for Offline Reinforcement Learning with Discrete Actions

基于流匹配的离线强化学习中离散动作的处理

Fairoz Nower Khan, Nabuat Zaman Nahim, Ruiquan Huang, Haibo Yang, Peizhong Ju

机构 * Department of Computer Science, University of Kentucky(计算机科学系,肯塔基大学) Department of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学系,罗切斯特理工学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种适用于离散动作空间的流匹配框架,通过连续时间马尔可夫链和因子化条件路径,扩展了离线强化学习的应用范围,并在多种任务中展示了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15784 2026-05-12 physics.soc-ph 50%

Comparing Analytical Approaches for Bike Station Expansion: A Location-Allocation Study in Trondheim, Norway

比较自行车站点扩展的分析方法:挪威特罗姆瑟市的选址-分配研究

M. Tsaqif Wismadi, Oluwaleke Yusuf, Adil Rasheed, Yngve Karl Frøyen, Thomas Alexander Sick Nielsen

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过对比三种选址分配方法,探讨了不同模型对城市空间优先级的影响,发现方法选择对空间决策结果有根本性影响。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09522 2026-05-12 cs.MA 50%

Emergent Communication for Co-constructed Emotion Between Embodied Agents via Collective Predictive Coding

通过集体预测编码实现具身智能体间共构情感的涌现通信

Zehang Zhang, Nguyen Le Hoang, Tadahiro Taniguchi, Takato Horii

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过集体预测编码框架,利用Metropolis-Hastings命名游戏模型,研究具身智能体间共构情感的涌现通信过程,发现通信显著提升情感类别的对齐性和一致性,并验证了内脏异质性对共享情感意义的构成作用。

Comments 13 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09265 2026-05-12 cs.CE 50%

Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling

基于代理的AI用于粒子模拟:自动化SPH工作流用于碎屑流建模

Danrong Zhang, Ruijia Wang, Chenying Liu, Yumeng Zhao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出首个用于无网格模拟的代理AI工作流,通过整合工具编排、多模态输入和人机交互,实现了碎片流建模的端到端模拟,展示了多模态输入在提升用户体验和减少失败模式方面的优势。

Comments 24 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08801 2026-05-12 cs.LG 50%

Data-driven transport modelling without overfit

基于数据的运输建模无需过拟合

Peter Vanya, Katarína Šimková, Rastislav Farkaš

机构 * Sev.en Global Investments(Sev.en全球投资) Vrije Universiteit Brussels(布鲁塞尔自由大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Ministry of Finance of the Slovak Republic(斯洛伐克共和国财政部)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于交通流量计数的数据驱动建模方法,通过可解释的模型权重和受控路径提升模型复杂度与准确性,用于预测公共政策干预后的交通流。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07101 2026-05-11 cs.MA stat.ML 50%

Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning

去中心化扩散策略学习用于增强合作多智能体强化学习中的探索

Yuyang Zhang, Haldun Balim, Na Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出去中心化扩散策略学习方法,通过扩散概率模型提升多智能体强化学习中的探索能力,解决了高维动作空间下的策略表达限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01166 2026-05-11 cs.RO 50%

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05338 2026-05-08 cs.RO 50%

Track A*: Fast Visibility-Aware Trajectory Planning for Active Target Tracking

Track A*: 为主动目标跟踪的快速可见性感知轨迹规划

Hanxuan Chen, Kangli Wang, Ji Pei

机构 * Autel Robotics(奥特 Robotics)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出Track A*,一种基于离线搜索的轨迹规划器,用于在离散的四维时空网格上实现可见性感知的目标跟踪。通过分层有向无环图搜索和三种工程优化,Track A*在保证实用性的同时提升了可扩展性,实验证明其在计算成本低的情况下具有稳健的可见性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00708 2026-05-04 cs.LG 50%

Deep Kernel Learning for Stratifying Glaucoma Trajectories

基于深度核学习的青光眼轨迹分层

Bruce Rushing, Angela Danquah, Alireza Namazi, Arjun Dirghangi, Heman Shakeri

机构 * Research Computing(研究计算中心) University of Virginia(弗吉尼亚大学) School of Data Science(数据科学学院) School of Medicine(医学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种深度核学习方法,利用高斯过程后端对多模态电子健康记录数据建模,识别青光眼患者不同亚群,区分疾病进展与当前严重程度,为临床决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13007 2026-05-04 cs.LG cs.CE 50%

Latent Generative Modeling of Random Fields from Limited Training Data

从有限训练数据中学习随机场的潜在生成建模

James E. Warner, Tristan A. Shah, Patrick E. Leser, Geoffrey F. Bomarito, Joshua D. Pribe, Michael C. Stanley

机构 * NASA Langley Research Center(美国国家航空航天局兰利研究中心) Texas Tech. University(德克萨斯技术大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种结合领域知识的潜在空间生成模型,用于在数据有限时建模随机场,通过约束-aware VAE和函数解码器学习紧凑的潜在表示,提升生成质量与鲁棒性。

Comments 24 pages plus references and appendices, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27887 2026-05-01 stat.ME 50%

Meta-Analysis Without Normality: Estimating the True Effect Distribution with Penalized Gaussian Mixtures

无需正态性:基于惩罚高斯混合的真效应分布估计

Daihe Sui, Elizabeth Tipton

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于惩罚高斯混合的方法,用于在不假设正态分布的情况下估计真效应分布,适用于大规模异质数据集,提高尾部概率和密度估计的准确性。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27435 2026-05-01 cs.CY 50%

Structural Dissolution: How Artificial Intelligence Dismantles Coordination Architecture and Reconfigures the Political Economy of Production

结构溶解:人工智能如何解构协调架构并重构生产的政治经济

Chao Li, Chunyi Zhao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出结构溶解框架,探讨人工智能如何重构传统产业的协调架构,通过内部化人类多模态接口,导致生产关系的质变,产生四个主要转变:企业与行业边界的消解、价值创造从物理资源和人力协作转向持续的数据流、领域特定数据精炼基础设施的兴起以及区域数据主权实体的出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05907 2026-04-30 cs.RO 50%

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 多模态Agent :multimodal(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏