arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 217 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 217 篇

2605.01171 2026-06-09 cs.CV cs.LG 版本更新 57%

CADFit: Precise Mesh-to-CAD Program Generation with Hybrid Optimization

CADFit:基于混合优化的精确网格到CAD程序生成

Ghadi Nehme, Eamon Whalen, Faez Ahmed

机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(麻省理工学院机械工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CADFit框架,通过基于几何反馈的增量拟合和验证参数化操作,从网格中恢复复杂可编辑的CAD构造序列,在多个基准上优于现有方法,并显著降低无效比率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21747 2026-06-09 cs.CV 版本更新 57%

MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding

MotionGPT-2:用于运动生成与理解的通用运动-语言模型

Yuan Wang, Di Huang, Yaqi Zhang, Wanli Ouyang, Jile Jiao, Xuetao Feng, Dan Xu, Shixiang Tang

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Intime Department Store(Intime百货) Deepeleph HKUST(香港科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出MotionGPT-2,一种统一的大规模运动-语言模型,通过预训练大语言模型支持多模态控制条件,实现运动生成、描述和补全等多种任务,并引入Part-Aware VQVAE实现细粒度身体和手部运动表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06048 2026-06-08 cs.CV 版本更新 57%

LLM-Conditioned Synthesis of Pathological Gaits via Structured Gait-Language Representations

基于结构化步态-语言表示的LLM条件病理步态合成

Mritula Chandrasekaran, Sanket Kachole, Jarek Francik, Dimitrios Makris

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出一种多模态LLM引导框架,通过结构化文本描述合成病理步态3D数据,利用运动标记化、病理感知语言条件、LLM语义增强和语言到步态生成,改善下游分类性能。

Comments Accepted at CVPR MOMA Workshop 2026 and selected for spotlight presentation at the workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19611 2026-06-08 cs.CV cs.ET 版本更新 57%

Physics Guided Conditional Diffusion Framework for Generative Inverse Design of Manufacturable Metasurface based Absorbers

基于物理引导的条件扩散模型的超材料吸收体逆向设计

Vineetha Joy, Jamshed Palai, Satwik Sahu, Anshuman Kumar, Amit Sethi, Hema Singh

机构 * Centre for Electromagnetics, CSIR-National Aerospace Laboratories(电磁研究中心,国家航空航天实验室) Birla Institute of Technology and Science, Pilani(比拉理工学院,皮兰) Indian Institute of Technology, Bombay(孟买印度理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于物理引导的条件扩散框架,用于设计具有特定电磁响应的超材料吸收体,通过特征线性调制和预训练的替代电磁模拟器,提高了设计效率和条件准确性,实验表明该方法在2-18GHz频率范围内能够快速生成实用的超材料结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22950 2026-08-21 stat.ML cs.LG math.ST stat.ME stat.TH 版本更新 50%

Diffusion-based Denoising Beats Vanilla Score Matching in Parameter Estimation: A Theoretical Explanation

基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释

Benedikt Lütke Schwienhorst, Nadja Klein, Johannes Lederer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00490 2026-08-19 eess.SY cs.SY 版本更新 50%

Cooperative Safety Intelligence over V2X Networks: A Survey

车联网中协同安全智能:一项综述

Jiaxun Zhang, Qian Xu, Zhenning Li, Yuan Wu, Chengzhong Xu, Keqiang Li

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了V2X环境下协同安全智能的研究进展,围绕SPD框架分析了协同感知、多模态预测和风险感知规划的发展,提出基于SPD的设计原则和评估实践,以提升交通安全水平。

Comments Published in IEEE Communications Surveys & Tutorials (Early Access). DOI: 10.1109/COMST.2026.3723946

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03820 2026-08-18 stat.ML cs.LG 版本更新 50%

A Quantitative Approximation Framework for Flow Distillation in Diffusion Models

扩散模型中流蒸馏的定量近似框架

Weiguo Gao, Ming Li, Lei Shi, Hanfei Zhou

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对扩散模型中的流蒸馏,提出一个定量近似框架,将少步采样视为学习流映射组合下的误差传播,通过理论分析和实验验证了稳定性平衡的非均匀时间网格能显著降低端到端相对MSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 50%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-12 cs.ET 版本更新 50%

Scale-CDA: A Scalable Retrofit Platform for Cooperative Driving Automation in Production Vehicles

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 多模态生成 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19088 2026-08-11 quant-ph math-ph math.MP physics.optics 版本更新 50%

Efficient and scalable inter-module switching for distributed quantum computing architectures

分布式量子计算架构的高效可扩展模块间交换

Kamil Bradler

专题命中 多模态生成 :any-to-any(abstract)

AI总结 针对分布式量子计算模块间的高效可扩展交换需求,基于广义马赫-曾德尔干涉仪构建去中心化交换方案,实现主动光深度随逻辑块数对数缩放且不损失连通性。

Comments v2: an example showing asymptotic scaling of resources and active optical depth added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17145 2026-08-10 cs.GR 版本更新 50%

Text2Villa: Hierarchical Generation of 3D Indoor Environments with Physics-Aware Analysis-by-Synthesis

Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成

Xiang Tang, Ruotong Li, Xiaopeng Fan

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。

Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06800 2026-08-07 stat.ML cs.LG math.PR 版本更新 50%

A Reverse-BSDE Diffusion Sampler

反向倒向随机微分方程扩散采样器

Jairon H. N. Batista, Flávio B. Gonçalves, Yuri F. Saporito, Rodrigo S. Targino

机构 * FGV EMAp

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究将反向时间扩散采样器重新表述为前向-后向随机微分方程,证明其与原方法等价并分解近似误差,经合成目标实验验证,该方法对复杂全局结构目标的采样具有良好前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08022 2026-08-03 stat.ML cs.LG cs.NA math.NA math.PR math.ST stat.TH 版本更新 50%

Provable Diffusion Posterior Sampling for Bayesian Inversion

可证明的扩散后验采样用于贝叶斯反问题

Jinyuan Chang, Chenguang Duan, Yuling Jiao, Ruoxuan Li, Jerry Zhijian Yang, Cheng Yuan

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种基于扩散的可证明后验采样方法,通过数据学习分数以捕捉先验分布结构,并提供非渐近误差界以确保复杂多模态后验分布的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06696 2026-07-31 stat.ML cs.LG stat.ME 版本更新 50%

Heat-Kernel Entropy Profiles and Geometric Effective Sample Size for Weighted Measures on Manifolds

流形上加权测度的热核熵剖面与几何有效样本量

Kisung You, Boram Cho

机构 * Baruch College(巴克尔学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究紧致流形上加权测度,引入热核熵剖面这一多尺度总结方法,通过内在热流扩散加权原子并跟踪尺度不均匀性,可计算二阶Rényi熵的几何有效样本量,实验表明其能揭示传统总结遗漏的结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05117 2026-07-31 cs.RO 版本更新 50%

SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation

SeedPolicy: 通过自进化扩散策略实现机器人操控的水平扩展

Youqiang Gui, Yuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, Shuaicheng Liu

机构 * Sichuan University(四川大学) Dexmal Inc.(Dexmal公司) Independent Researcher(独立研究员) UESTC

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出SEGA模块,通过门控注意力机制提升扩散策略在长时域操控中的表现,实验表明其在RoboTwin 2.0基准上优于现有方法,具有更高的效率和性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11214 2026-07-30 eess.SP cs.IT math.IT 版本更新 50%

CSI Prediction Using Diffusion Models

基于扩散模型的信道状态信息(CSI)预测

Mehdi Sattari, Javad Aliakbari, Alexandre Graell i Amat, Tommy Svensson

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种基于扩散模型的新型概率CSI预测框架,分解任务为时间编码器与扩散生成器,研究多种推理方案与骨干,仿真显示其性能优于现有最先进基线模型。

Comments Accepted, IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21026 2026-07-23 stat.ML cs.LG 版本更新 50%

Diffusion-based Annealed Boltzmann Generators : benefits, pitfalls and hopes

基于退火的玻尔兹曼生成器:益处、陷阱与希望

Louis Grenioux, Maxence Noble

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文研究了基于退火蒙特卡洛的玻尔兹曼生成器,探讨了扩散模型在其中的应用及其在高维多模态目标中的性能表现。

Comments TMLR camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 50%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10201 2026-07-21 cs.GR 版本更新 50%

B-repLer: Language-guided Editing of CAD Models

B-repLer:CAD模型的语言引导编辑

Yilin Liu, Niladri Shekhar Dutt, Changjian Li, Niloy J. Mitra

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。

Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10051 2026-07-21 q-bio.NC cs.ET 版本更新 50%

An Intelligent Infrastructure as a Foundation for Modern Science

作为现代科学基础的智能基础设施

Satrajit S. Ghosh

专题命中 多模态生成 :multimodal(abstract)

AI总结 以神经科学多模态和多尺度数据增长为背景,提出将基础设施转变为动态、与人工智能契合的生态系统的范式转变,给出实施原则的操作指南,强调人工智能协调作用,有望加速科学发现并转化为社会利益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14125 2026-07-15 stat.ML cs.LG 版本更新 50%

Spectral Diffusion Processes

谱扩散过程

Angus Phillips, Thomas Seror, Michael Hutchinson, Valentin De Bortoli, Arnaud Doucet, Emile Mathieu

机构 * University of Oxford(牛津大学) ENS, CNRS, PSL University Paris(巴黎高等师范学院、国家科学研究中心、巴黎大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究将扩散模型应用于函数空间上的随机过程,通过谱表示分离随机部分与时空结构,用有限维扩散模型建模谱系数,经截断确保模型有效性,投影回原空间对应相关噪声扩散模型,还展示了方法在多模态数据建模及条件采样上的有效性。

Comments This version (v3) extends the previous workshop version (v2) with conditional sampling and theoretical results. Work carried out in 2022/23. V2 appeared in Score-based Methods Workshop at the 36th Conference on Neural Information Processing Systems (NeurIPS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17527 2026-07-14 cs.RO 版本更新 50%

Safer Trajectory Planning with CBF-guided Diffusion Model for Unmanned Aerial Vehicles

基于CBF引导扩散模型的无人机安全轨迹规划

Peiwen Yang, Shiyu Bai, Weisong Wen, Yixin Gao, Jiahao Hu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出AeroTrajGen框架,通过CBF引导采样提升扩散模型在无人机轨迹生成中的安全性与敏捷性,减少碰撞率94.7%。

Comments Some equations need to be checked

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05576 2026-07-14 cs.RO 版本更新 50%

Task Parameter Extrapolation via Learning Inverse Tasks from Forward Demonstrations

通过从正向演示中学习逆向任务进行任务参数外推

Serdar Bahar, Fatih Dogangun, Matteo Saveriano, Yukie Nagai, Emre Ugur

机构 * Bogazici University(博雅科技大学) University of Trento(特伦托大学) The University of Tokyo(东京大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种基于任务逆向学习的联合学习方法,通过利用辅助正向演示实现准确且高效的知识转移,以解决机器人学习中的泛化问题。

Comments Accepted for publication in IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03564 2026-07-14 cs.LG 版本更新 50%

CoGenCast: A Coupled Autoregressive-Flow Generative Framework for Time Series Forecasting

CoGenCast:用于时间序列预测的耦合自回归流生成框架

Mingyue Cheng, Yaguo Liu, Daoyu Wang, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对时间序列预测需兼顾语义理解与随机建模的问题,提出CoGenCast框架,将预训练大语言模型与流匹配机制结合,通过修改注意力拓扑重配置模型,集成流匹配机制捕捉动态,实现多模态预测和跨域统一训练,实验显示性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16565 2026-07-14 eess.SY cs.SY 版本更新 50%

Agentic AI-RAN Empowering Synergetic Sensing, Communication, Computing, and Control

智能人工智能无线接入网络助力协同感知、通信、计算和控制

Lingxiao Sun, Zhaoyang Zhang, Zihan Lin, Zirui Chen, Weijie Zhou, Zhaohui Yang, Tony Q. S. Quek

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究6G低空无线网络中,智能人工智能无线接入网络(Agentic AI-RAN)架构助力协同SC3任务执行。提出面向任务的架构解决资源受限边缘环境异构负载协调难题,经无人机系统原型验证,该框架在6G关键任务低空网络中具可行性。

Comments 7 pages, 5 figures, 1 table; revised version with minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03360 2026-07-09 math.ST stat.TH 版本更新 50%

Structured drift design for denoising diffusion models

去噪扩散模型的结构化漂移设计

Mahsa Taheri

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出几何感知Ornstein-Uhlenbeck过程,通过方差感知各向异性漂移嵌入数据几何结构,改善扩散模型对多模态、高相关分布的模式分离和相关性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01894 2026-07-09 cs.LG 版本更新 50%

Bifidelity Parameter Estimation Using Conditional Diffusion Models

使用条件扩散模型的双保真参数估计

Caroline Tatsuoka, Minglei Yang, Dongbin Xiu, Guannan Zhang

机构 * UT-Battelle, LLC(UT-巴特勒公司) US Department of Energy(美国能源部) The Ohio State University(俄亥俄州立大学) Oak Ridge National Laboratory(橡树岭国家实验室) Oak Ridge(橡树岭) Computer Science and Mathematics Division(计算机科学与数学 division)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对复杂系统参数估计不确定性量化,提出双保真方法。先构建低保真条件生成模型,特定情况时用其细化采样空间,再训练高保真无条件生成模型,经数值示例和实际应用验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09832 2026-06-26 astro-ph.GA astro-ph.CO astro-ph.IM 版本更新 50%

LITMUS: Bayesian Lag Recovery in Reverberation Mapping with Fast Differentiable Models

LITMUS:基于快速可微模型的贝叶斯滞后恢复在回波测绘中的应用

Hugh McDougall, Tamara M. Davis, Benjamin J. S. Pope

专题命中 多模态生成 :multimodal(abstract)

AI总结 LITMUS利用快速可微模型实现回波测绘中滞后恢复,通过处理季节观测窗口的多模态混叠问题,提高滞后验证的准确性,显著优于现有方法JAVELIN。

Comments 17 Pages, 10 Figures

Journal ref pasa.2026.10149

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21860 2026-06-24 math.OC stat.ML 版本更新 50%

Pathwise Learning of Stochastic Dynamical Systems with Partial Observations

部分观测下随机动力系统的路径学习

Nicole Tianjiao Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出一种摊销路径生成方法,通过变分推断和受控SDE表示,从噪声观测中学习随机动力系统的滤波分布,实现不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18457 2026-06-23 eess.SP 版本更新 50%

Sense Smarter, Think Better: A Survey on Edge Perception for Next-Generation Networks

智能感知,更优思考:面向下一代网络的边缘感知

Zhonghao Lyu, Xiaowen Cao, Xianxin Song, Yuchen Li, Jiacheng Wang, Shuoyao Wang, Yuanhao Cui, Weijie Yuan, Xianghao Yu, Guangxu Zhu, Hai Liu, Jie Xu, Derrick Wing Kwan Ng, Shuguang Cui

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏