arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2603.18771 2026-03-20 cs.RO 50%

Empathetic Motion Generation for Humanoid Educational Robots via Reasoning-Guided Vision--Language--Motion Diffusion Architecture

通过推理引导的视觉-语言-运动扩散架构生成 empathetic 动作 for 人类教育机器人

Fuze Sun, Lingyu Li, Lekan Dai, Xinyu Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出RG-VLMD框架,通过多模态情感估计、教学推理和教学-动作条件运动合成,生成适应性且语义一致的机器人行为。实验表明,推理引导的指令条件生成提升了教育人机交互中的动作可控性和教学表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18755 2026-03-20 math.AP 50%

Spreading of pathological proteins through brain networks: a case study for Alzheimers disease

病理蛋白通过脑网络的传播:阿尔茨海默病的案例研究

G. Landi, A. Scaravelli, M. C. Tesi, C. Testa

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过数学建模研究阿尔茨海默病中tau蛋白的传播,探讨不同网络框架对蛋白质动态的影响,并验证模型与临床数据的一致性。

Comments 23 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16612 2026-03-18 cs.GR 50%

Retrieval-Augmented Sketch-Guided 3D Building Generation

增强检索的草图引导3D建筑生成

Zhengyang Wang, Nuttapong Rochanavibhata, Yuxiao Ren, Xusheng Du, Ye Zhang, Haoran Xie

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出多阶段3D生成框架,通过结合生成与检索方法实现组件级编辑与个性化定制,解决日本独栋房屋早期设计阶段因缺乏统一表示导致的设计漂移问题。

Comments 10 pages, 4 figures, Proceeding of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16550 2026-03-18 cs.RO 50%

ASCENT: Transformer-Based Aircraft Trajectory Prediction in Non-Towered Terminal Airspace

ASCENT:基于Transformer的非塔台终端空域飞机轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ASCENT模型,通过轻量级Transformer架构实现多模态3D飞机轨迹预测,结合领域感知的3D坐标归一化和参数化预测,实验表明其在TrajAir和TartanAviation数据集上优于现有方法。

Comments ICRA 2026. Project Page at https://a-pru.github.io/ascent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16116 2026-03-18 eess.SP 50%

Knowledge Distillation for Collaborative Learning in Distributed Communications and Sensing

知识蒸馏在分布式通信与感知中的协同学习

Nhan Thanh Nguyen, Mengyuan Ma, Nir Shlezinger, Junil Choi, Yonina C. Eldar, A. Lee Swindlehurst, Markku Juntti

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文探讨了知识蒸馏和协同学习在6G分布式通信与感知节点中部署轻量级AI模型的有效性,通过系统性数值研究证明其在多模态感知辅助波束跟踪中的性能提升与复杂度降低。

Comments This paper has been submitted to IEEE Communications Magazine and under review for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14056 2026-03-17 cs.RO cs.SY eess.SY 50%

Amortizing Trajectory Diffusion with Keyed Drift Fields

通过键控漂移场实现轨迹扩散的 amortization

Gokul Puthumanaillam, Melkior Ornik

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出键控漂移策略,通过单步推理实现轨迹扩散行为,保留多样候选计划生成和实时控制循环中的状态条件能力,降低规划延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15746 2026-03-17 cs.LG cond-mat.mtrl-sci 50%

A Unified Generative-Predictive Framework for Deterministic Inverse Design

一种统一的生成-预测框架用于确定性反向设计

Reza T. Batley, Sourav Saha

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Janus框架,结合编码器-解码器与预测性KHRONOS 头,解决异质材料微结构反向设计问题,实现高效物理引导的生成与预测。

Journal ref AIAA SciTech Forum, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13839 2026-03-17 cs.CE 50%

NetSpatial: Spatially Conditional Traffic Generation for Cellular Planning and Operations

NetSpatial: 基于空间条件的蜂窝网络生成用于蜂窝规划与运营

Shiyuan Zhang, Jiale Du, Yuanwei Liu, Kaibin Huang, Hongyang Du

专题命中 多模态生成 :multimodal(abstract)

AI总结 NetSpatial通过空间条件生成蜂窝网络流量,结合多模态城市数据,实现部署规划与运营决策,实验显示其在流量预测和能效方面有显著优势。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13265 2026-03-17 cs.LG 50%

Knowledge, Rules and Their Embeddings: Two Paths towards Neuro-Symbolic JEPA

知识、规则及其嵌入:迈向神经符号JEPA的两条路径

Yongchao Huang, Hassan Raza

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出双向神经符号框架RiJEPA,通过能量约束和多模态双编码架构注入归纳偏置,重塑表示流形,实现几何逻辑盆地;并通过连续可微逻辑替代离散规则,实现连续规则发现,提升生成与推理能力。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12868 2026-03-16 cs.RO 50%

Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies

超越模仿:用于自适应扩散导航策略的强化学习微调

Junhe Sheng, Ruofei Bai, Kuan Xu, Ruimeng Liu, Jie Chen, Shenghai Yuan, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) A*STAR, Singapore(A*STAR,新加坡) National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10980 2026-03-12 cs.RO 50%

PPGuide: Steering Diffusion Policies with Performance Predictive Guidance

PPGuide: 通过性能预测引导操控扩散策略

Zixing Wang, Devesh K. Jha, Ahmed H. Qureshi, Diego Romeres

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PPGuide通过性能预测引导技术,在推理时引导预训练的扩散策略避免失败模式,提升机器人操作的鲁棒性。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25622 2026-03-12 cs.IR 50%

Taming the Long Tail: Denoising Collaborative Information for Robust Semantic ID Generation

驯服长尾:去噪协作信息以实现稳健的语义ID生成

Yi Xu, Moyu Zhang, Chaofan Fan, Jinxin Hu, Xiaochen Li, Yu Zhang, Xiaoyi Zeng, Jing Zhang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出ADC-SID框架,通过自适应去噪协作信息提升语义ID生成的稳健性,解决行为-内容对齐和行为权重分配中的噪声问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09075 2026-03-11 eess.IV 50%

M2Diff: Multi-Modality Multi-Task Enhanced Diffusion Model for MRI-Guided Low-Dose PET Enhancement

M2Diff:多模态多任务增强扩散模型用于MRI引导的低剂量PET增强

Ghulam Nabi Ahmad Hassan Yar, Himashi Peiris, Victoria Mar, Cameron Dennis Pain, Zhaolin Chen

专题命中 多模态生成 :multi-modal(abstract)

AI总结 M2Diff通过多模态多任务扩散模型,利用MRI和低剂量PET扫描分别学习模态特定特征,并通过层次化特征融合重建标准剂量PET,从而提升重建保真度。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04436 2026-03-10 cs.RO cs.SY eess.SY 50%

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

PAD-TRO: 用于直接轨迹优化的投影增强扩散模型

Jushan Chen, Santiago Paternain

机构 * Department of Electrical, Computer, and Systems Engineering, Rensselaer Polytechnic Institute(电气、计算机与系统工程系,罗切斯特理工学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PAD-TRO提出了一种基于模型的扩散方法,通过无梯度投影机制直接生成状态序列,实现了在四旋翼航点导航中零动态可行性误差和更高的成功率。

Comments Final manuscript. Accepted for publication at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09889 2026-03-10 cs.RO 50%

Diffusion-SAFE: Diffusion-Native Human-to-Robot Driving Handover for Shared Autonomy

Diffusion-SAFE: 基于扩散模型的人机协同驾驶交接机制

Yunxin Fan, Monroe Kennedy

专题命中 多模态生成 :multimodal(abstract)

AI总结 Diffusion-SAFE通过基于扩散模型的闭环框架实现安全的人机协同驾驶交接,支持从演示中直接进行安全评估和计划生成,实验显示在模拟和真实赛车中均取得高交接成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09998 2026-03-06 math.AP 50%

Stability and bifurcation analysis in a mechanochemical model of pattern formation

机械化学模型中图案形成的稳定性与分岔分析

Szymon Cygan, Anna Marciniak-Czochra, Finn Münnich, Dietmar Oelz

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究通过机械化学反馈机制,在无需第二抑制剂的情况下,实现单峰模式的稳健形成。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03731 2026-03-05 cs.DC 50%

HyperParallel: A Supernode-Affinity AI Framework

HyperParallel:一种超节点亲和性AI框架

Xin Zhang, Beilei Sun, Teng Su, Qinghua Zhang, Chong Bao, Lei Chen, Xuefeng Jin

专题命中 多模态生成 :multimodal(abstract)

AI总结 HyperParallel框架通过超节点亲和性设计,提升AI训练和推理效率,降低编程复杂度和系统调优开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21150 2026-03-05 cs.LG 50%

CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization

CAD-Tokenizer: 向基于文本的CAD原型设计迈进:通过模态特定的分词

Ruiyu Wang, Shizhao Sun, Weijian Ma, Jiang Bian

机构 * University of Toronto(多伦多大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CAD-Tokenizer通过模态特定的分词策略,提升文本引导的CAD原型设计效率与生成质量。

Comments ICLR2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02778 2026-03-04 cond-mat.mtrl-sci 50%

Unlocking the Potential of Ni2+ and Ni2+-Cr3+ Synergy for Bifunctional Pressure and Temperature Optical Sensing

解锁Ni²+和Ni²⁺-Cr³+协同作用在双功能压力和温度光学传感中的潜力

M. Szymczak, L. Marciniak

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过Ni²+和Cr³+协同发光实现高灵敏度双功能压力温度传感,首次展示其在近红外测压中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16733 2026-03-04 eess.SP 50%

Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art

生成扩散模型用于无线网络:基础、架构与最新进展

Dayu Fan, Rui Meng, Xiaodong Xu, Yiming Liu, Guoshun Nan, Chenyuan Feng, Shujun Han, Song Gao, Bingxuan Xu, Dusit Niyato, Tony Q. S. Quek, Ping Zhang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。

Comments 46 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21983 2026-02-26 cs.RO 50%

Humanizing Robot Gaze Shifts: A Framework for Natural Gaze Shifts in Humanoid Robots

使机器人目光转移人性化:一种在人形机器人中实现自然目光转移的框架

Jingchao Wei, Jingkai Qin, Yuxiao Cao, Jingcheng Huang, Xiangrui Zeng, Min Li, Zhouping Yin

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(机械科学与工程学院,华中科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出RGS框架,通过结合认知注意力机制与生物模仿运动生成,实现人形机器人自然且上下文合适的人类化目光转移。

Comments submitted to AIM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21427 2026-02-26 cs.LG cs.RO 50%

Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning

基于流的单步完成:用于高效且表达性的策略学习

Prajwal Koirala, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 SSCP是一种基于流的单步完成策略,通过增强的流匹配目标实现高效且表达性的策略学习,适用于多种RL场景。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20644 2026-02-25 cs.SE 50%

An LLM-driven Scenario Generation Pipeline Using an Extended Scenic DSL for Autonomous Driving Safety Validation

基于扩展Scenic DSL的LLM驱动场景生成流水线用于自动驾驶安全验证

Fida Khandaker Safa, Yupeng Jiang, Xi Zheng

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩展Scenic DSL和LLM的场景生成流水线,实现高精度自动驾驶安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 50%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 多模态生成 :multimodal(abstract)

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26308 2026-02-24 cs.RO 50%

Anomaly detection for generic failure monitoring in robotic assembly, screwing and manipulation

通用故障监控中机器人装配、拧螺钉和操作中的异常检测

Niklas Grambow, Lisa-Marie Fenner, Felipe Kempkes, Philip Hotz, Dingyuan Wan, Jörg Krüger, Kevin Haninger

机构 * Department of Automation at Fraunhofer IPK(弗劳恩霍夫研究所自动化部门) Department of Industrial Automation Technology at TU Berlin(柏林技术大学工业自动化技术部门)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种适用于多种机器人任务的异常检测方法,通过比较不同自编码器方法,验证了其在不同任务和控制策略中的泛化能力,并展示了在布线和拧螺钉任务中高可靠性的检测效果。

Comments 8 pages, 5 figures, 4 tables, the paper has been accepted for publication in the IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22007 2026-02-19 cs.LG 50%

Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models

扩散模型中分类器自由引导的分阶段动态

Cheng Jin, Qitan Shi, Yuantao Gu

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文研究了扩散模型中分类器自由引导的分阶段动态,揭示了引导对采样过程三个阶段的影响,并提出时间变化的引导策略以提升质量和多样性。

Comments 24 pages, 10 figures, accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15026 2026-02-17 cs.CE 50%

Deep Generative Models in Condition and Structural Health Monitoring: Opportunities, Limitations and Future Outlook

深度生成模型在条件与结构健康监测中的应用:机遇、局限与未来展望

Xin Yang, Chen Fang, Yunlai Liao, Jian Yang, Konstantinos Gryllias, Dimitrios Chronopoulos

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文探讨深度生成模型在条件与结构健康监测中的应用,分析其优势与局限,并提出未来研究方向。

Comments 70 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12987 2026-02-16 cs.HC 50%

GroundLink: Exploring How Contextual Meeting Snippets Can Close Common Ground Gaps in Editing 3D Scenes for Virtual Production

GroundLink:探索上下文会议片段如何在虚拟制作3D场景编辑中弥合常见共识差距

Gun Woo, Park, Frederik Brudy, George Fitzmaurice, Fraser Anderson

专题命中 多模态生成 :cross-modal(abstract)

AI总结 GroundLink通过在虚拟制作3D场景编辑中引入会议知识仪表板和跨模态同步功能,帮助专业人员更高效地建立团队共识。

Comments 27 pages, 13 figures, to appear at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12932 2026-02-16 stat.ML cs.LG 50%

TFTF: Training-Free Targeted Flow for Conditional Sampling

TFTF:无训练目标流用于条件采样

Qianqian Qu, Jun S. Liu

机构 * Zhili College, Tsinghua University, Beijing, China(清华大学紫荆学院) Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系) Department of Statistics, Harvard University, Cambridge, MA, USA(哈佛大学统计系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 TFTF通过引入随机流和重采样技术,实现无训练条件采样,提升高维和多模态场景下的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏