arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2821 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2821 篇

2603.03121 2026-03-04 cs.SE 50%

RippleGUItester: Change-Aware Exploratory Testing

RippleGUItester: 基于变更的探索性测试

Yanqi Su, Michael Pradel, Chunyang Chen

专题命中 多模态Agent :multimodal(abstract)

AI总结 RippleGUItester通过基于大语言模型的变更影响分析,结合多模态bug检测,发现由代码变更引入的bug,提升测试效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15602 2026-03-04 cs.NE 50%

Estimate Hitting Time by Hitting Probability for Elitist Evolutionary Algorithms

通过击中概率估计精英进化算法的击中时间

Jun He, Siang Yew Chong, Xin Yao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出通过击中概率的漂移分析方法,用于估计精英进化算法的击中时间,通过引入路径处理多模态适应度景观,简化了击中概率的计算并比较了两种算法的性能。

Journal ref IEEE Transactions on Evolutionary Computation 12 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00079 2026-03-04 cs.HC 50%

Enhancing the Interpretability of SHAP Values Using Large Language Models

利用大语言模型增强SHAP值的可解释性

Xianlong Zeng, Kewen Zhu

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文利用大语言模型提升SHAP值的可解释性,使非技术用户更易理解模型预测。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01687 2026-03-03 cs.NI 50%

Predictive Importance Sampling Based Coverage Verification for Multi-UAV Trajectory Planning

基于预测重要性采样的多无人机轨迹规划覆盖验证

Snehashish Ghosh, Sasthi C. Ghosh

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于预测重要性采样的多无人机轨迹规划覆盖验证方法,通过LSTM-MDN和防御性混合采样提升鲁棒性,实现更高效的覆盖管理。

Comments This article has been submitted to a conference for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00522 2026-03-03 cs.HC 50%

SIAgent: Spatial Interaction Agent via LLM-powered Eye-Hand Motion Intent Understanding in VR

SIAgent:通过LLM驱动的眼手运动意图理解实现VR中的空间交互代理

Zhimin Wang, Chenyu Gu, Feng Lu

专题命中 多模态Agent :multimodal(abstract)

AI总结 SIAgent通过LLM驱动的意图识别与代理执行,实现VR中基于自然眼手运动的高容忍度交互框架。

Comments Virtual reality, spatial interaction, intent recognition, agent-based execution, large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18676 2026-02-26 cs.HC 50%

MagHeart: Exploring Playful Avatar Co-Creation and Shared Heartbeats for Icebreaking in Hybrid Meetings

MagHeart:探索混合会议中的 playful 虚拟角色共创与共享心跳以促进破冰

Black Sun, Haiyang Xu, Ge Kacy Fu, Liyue Da, Eve Hoggan

专题命中 多模态Agent :multimodal(abstract)

AI总结 MagHeart通过playful虚拟角色共创和共享心跳技术,促进混合会议中的对称破冰,探索远程参与者在会议开始时的物质和感知存在,同时揭示隐私和情境适当性等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20923 2026-02-25 cs.RO 50%

ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models

ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测

Jiarong Wei, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE

专题命中 多模态Agent :multi-modal(abstract)

AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。

Comments ICRA 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19764 2026-02-24 cs.RO 50%

Towards Dexterous Embodied Manipulation via Deep Multi-Sensory Fusion and Sparse Expert Scaling

通过深度多感官融合与稀疏专家扩展实现灵巧的具身体验

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Zhihao xia, Qionglin Ren, Chunxu tian, Zhongxue Ga

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Engineering, Harbin Institute of Technology(信息科学与工程学院,哈尔滨工业大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 DeMUSE通过深度多感官融合与稀疏专家扩展,实现复杂物理互动的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18572 2026-02-24 cs.LG q-fin.ST 50%

Sub-City Real Estate Price Index Forecasting at Weekly Horizons Using Satellite Radar and News Sentiment

基于卫星雷达和新闻情绪的周频次下辖城市房地产价格指数预测

Baris Arat, Hasan Fehmi Ates, Emre Sefer

机构 * Ozyegin University(奥兹根大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过结合卫星雷达与新闻情绪数据,实现了下辖城市房地产价格指数的周频预测,显著提升了长期预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03175 2026-02-23 cs.LG 50%

Probe-then-Commit Multi-Objective Bandits: Theoretical Benefits of Limited Multi-Arm Feedback

探查-然后承诺多目标老虎机:有限多臂反馈的理论优势

Ming Shi

机构 * Department of Electrical Engineering, University at Buffalo(电气工程系,布法罗大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出PtC-P-UCB算法,通过有限探查提升多目标老虎机的性能,实现$1/\sqrt{q}$的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13404 2026-02-17 astro-ph.EP physics.pop-ph 50%

The Interplanetary Habitable Zone

星际宜居带

Caleb Scharf

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出了一种评估星际宜居带的多模式指标,并通过基于代理的模型探讨了星际生命扩散与资源利用之间的平衡。

Comments 38 pages, 14 color figures, submitted to The Astrobiology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10285 2026-02-17 cs.RO 50%

Adaptive Time Step Flow Matching for Autonomous Driving Motion Planning

自适应时间步长流匹配用于自动驾驶运动规划

Ananya Trivedi, Anjian Li, Mohamed Elnoor, Yusuf Umut Ciftci, Avinash Singh, Jovin D'sa, Sangjae Bae, David Isele, Taskin Padir, Faizan M. Tariq

机构 * HRI Honda Research Institute(本田研究院) Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学) Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种基于条件流匹配的自适应时间步长框架,用于实时自动驾驶轨迹规划,通过在线调整推理步骤数和轨迹后处理提升性能。

Comments Accepted to Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12565 2026-02-16 cs.HC 50%

GatheringSense: AI-Generated Imagery and Embodied Experiences for Understanding Literati Gatherings

GatheringSense: 基于人工智能生成影像与具身体验的文人聚会理解

You Zhou, Bingyuan Wang, Hongcheng Guo, Rui Cao, Zeyu Wang

专题命中 多模态Agent :multimodal(abstract)

AI总结 GatheringSense通过AI生成影像与具身体验相结合,探索文人聚会的文化理解与共鸣,提出双路径框架并提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12072 2026-02-13 stat.AP 50%

Enhanced Forest Inventories for Habitat Mapping: A Case Study in the Sierra Nevada Mountains of California

增强的森林调查用于栖息地制图:加利福尼亚州内华达山脉的案例研究

Maxime Turgeon, Michael Kieser, Dwight Wolfe, Bruce MacArthur

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出增强森林调查方法,通过整合遥感数据与地面调查,用于高分辨率野生动物栖息地制图,为森林管理和生态保护提供空间明确的工具。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10109 2026-02-11 cs.RO 50%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10054 2026-02-11 cs.HC 50%

AIDED: Augmenting Interior Design with Human Experience Data for Designer-AI Co-Design

AIDED: 通过人类经验数据增强室内设计以实现设计师-人工智能协同设计

Yang Chen Lin, Chen-Ying Chen, Kai-Hsin Hou, Hung-Yu Chen, Po-Chih Kuo

专题命中 多模态Agent :multimodal(abstract)

AI总结 AIDED通过整合人类经验数据提升室内设计的创造力和客户互动,探索不同数据模态对设计结果的影响,并提出未来AI工具的设计方向。

Comments 29 pages, 14 figures, Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO 50%

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11510 2026-02-10 stat.OT stat.CO 50%

Here Be Dragons: Bimodal posteriors arise from numerical integration error in longitudinal models

此处有龙:纵向模型中双峰后验分布源于数值积分误差

Tess O'Brien, Matthew T. Moores, David Warton, Daniel Falster

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文研究了纵向模型中数值积分误差导致的双峰后验分布问题,提出通过合适方法避免双峰性,对贝叶斯反演方法有重要影响。

Comments 33 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06966 2026-02-10 cs.RO 50%

Embodied Intelligence for Flexible Manufacturing: A Survey

具身智能在柔性制造中的应用:综述

Kai Xu, Hang Zhao, Ruizhen Hu, Min Yang, Hao Liu, Hui Zhang, Haibin Yu

机构 * National University of Defense Technology(中国人民解放军国防科技大学) Wuhan University(武汉大学) Shenzhen University(深圳大学) Hunan University(湖南大学) Shenyang Institute of Automation Chinese Academy of Sciences(中国科学院沈阳自动化研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了具身智能在柔性制造中的应用,分析了感知、控制和决策三个层面的技术挑战,并提出三阶段进化模型以指导其发展。

Comments in chinese language. ROBOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06030 2026-02-10 cs.MA cs.LG 50%

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

PhysicsAgentABM: 基于物理的生成基于主体的建模

Kavana Venkatesh, Yinhan He, Jundong Li, Jiaming Cui

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 PhysicsAgentABM通过结合符号推理与神经网络,实现基于物理的生成式主体建模,提升大规模模拟的准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00260 2026-02-06 eess.SP 50%

Sensor Insoles: A Review

智能传感鞋垫:综述

Bastian Latsch, Felix Herbst, Mark Suppelt, Julian Seiler, Stephan Schaumann, Sven Suppelt, Alexander A. Altmann, Martin Grimmer, and Mario Kupnik

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了智能传感鞋垫在足部压力测量中的应用,分析了现有技术的局限性,并提出未来多模态传感器和多轴传感的发展方向。

Comments 20 pages, 8 figures, review article published in IEEE Sensors Journal

Journal ref IEEE Sensors Journal, vol. 26, no. 3, pp. 3577-3596, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 50%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02959 2026-02-04 cs.LG cs.SY eess.SY 50%

Human-Centric Traffic Signal Control for Equity: A Multi-Agent Action Branching Deep Reinforcement Learning Approach

以人为中心的交通信号控制以实现公平性:一种多智能体动作分支深度强化学习方法

Xiaocai Zhang, Neema Nassir, Lok Sang Chan, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种以人为中心的多智能体动作分支深度强化学习方法,通过分解交通走廊控制并优化旅行者公平性,有效减少受延迟旅行者数量,提升交通信号系统的公平性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12311 2026-02-04 cs.RO 50%

Scene-Adaptive Motion Planning with Explicit Mixture of Experts and Interaction-Oriented Optimization

场景自适应运动规划与显式专家混合及交互导向优化

Hongbiao Zhu, Liulong Ma, Xian Wu, Xin Deng, Xiaoyao Liang

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪公司自动驾驶新技术研究院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EMoE-Planner,通过显式专家混合和交互导向优化,解决复杂城市环境中自主驾驶轨迹规划的多模态、场景多样性和环境交互问题,实现超越传统规则算法的性能。

Comments Main text 10 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 50%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22431 2026-02-03 cs.SE 50%

TreeMind: Automatically Reproducing Android Bug Reports via LLM-empowered Monte Carlo Tree Search

TreeMind: 通过LLM赋能的蒙特卡洛树搜索自动重现Android bug报告

Zhengyu Chen, Zhaoyi Meng, Wenxiang Zhao, Wansen Wang, Wenchao Huang, Jie Cui, Hong Zhong, Yan Xiong

专题命中 多模态Agent :multi-modal(abstract)

AI总结 TreeMind结合LLM与MCTS算法,通过语义推理和反馈导航,高效重现Android bug报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18745 2026-02-02 cond-mat.mtrl-sci 50%

Spin defects in hexagonal boron nitride as two-dimensional strain sensors

六方氮化硼中的自旋缺陷作为二维应变传感器

Z. Mu, Z. Zhang, J. Fraunié, C. Robert, G. Seine, B. Gil, G. Cassabois, V. Jacques

专题命中 多模态Agent :multimodal(abstract)

AI总结 六方氮化硼中的硼空位色心被证实可作为高精度二维应变传感器,用于测量多层hBN晶片在应力下的拉曼模式位移,为范德瓦尔异质结构的应变计量提供新工具。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25889 2026-01-30 cs.LG 50%

$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models

$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调

Kang Chen, Zhihao Liu, Tonghe Zhang, Zhen Guo, Si Xu, Hao Lin, Hongzhi Zang, Xiang Li, Quanlu Zhang, Zhaofei Yu, Guoliang Fan, Tiejun Huang, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Carnegie Mellon University(卡内基梅隆大学) Infinigence AI Zhongguancun Academy(中关村学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18492 2026-01-27 cs.RO 50%

DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation

DV-VLN:基于可靠大语言模型的视觉-语言导航的双重验证

Zijun Li, Shijie Li, Zhenxi Zhang, Bin Li, Shoujun Zhou

机构 * Robotics Engineering Program, College of Engineering, Zhejiang Normal University(浙江师范大学工程学院机器人工程专业) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Department of Health Technology and Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息技术系)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 DV-VLN通过生成-验证范式提升大语言模型在视觉-语言导航中的可靠性,通过双重验证机制提高导航决策的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏