arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2512.20699 2026-04-20 gr-qc astro-ph.HE 50%

Comparing next-generation detector configurations for high-redshift gravitational wave sources with neural posterior estimation

比较下一代探测器配置用于高红移引力波源的性能:基于神经后验估计

Filippo Santoliquido, Jacopo Tissino, Ulyana Dupletsa, Marica Branchesi, Jan Harms

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文利用神经后验估计方法评估了下一代引力波探测器网络配置,研究高红移双黑洞并合源的探测性能,发现2L MisA配置在天空定位和体积定位上优于三角形ET配置。

Comments 18 pages, 13 figures, 5 tables. Published in A&A

Journal ref A&A 708, A175 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21912 2026-04-16 cs.LG stat.ML 50%

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching

离散指导匹配:用于离散流匹配的精确指导

Zhengyan Wan, Yidong Ouyang, Liyan Xie, Fang Fang, Hongyuan Zha, Guang Cheng

机构 * School of Statistics, East China Normal University(华东师范大学统计学院) Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计系) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种新的离散数据指导框架,通过推导所需分布的精确转移率,提高采样效率,并展示了其在能量引导模拟和文本到图像生成中的有效性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12992 2026-04-15 stat.ML cs.LG econ.EM 50%

Causal Diffusion Models for Counterfactual Outcome Distributions in Longitudinal Data

因果扩散模型用于纵向数据中的反事实结果分布

Farbod Alinezhad, Jianfei Cao, Gary J. Young, Brady Post

机构 * Department of Economics, Northeastern University(东北大学经济学系) Center for Health Policy and Healthcare Research, Northeastern University(东北大学健康政策与医疗研究中心) Department of Public Health and Health Sciences, Bouvé College of Health Sciences, Northeastern University(东北大学布维健康科学学院公共卫生与健康科学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出因果扩散模型,用于生成在连续干预下的反事实结果分布,通过新颖的残差去噪架构和关系自注意力机制,提升了复杂时间依赖性和多模态结果轨迹的捕捉能力,同时在高混杂环境下实现了更高的分布准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11793 2026-04-14 cs.RO 50%

Disentangled Point Diffusion for Precise Object Placement

解耦点扩散用于精确物体放置

Lyuxing He, Eric Cai, Shobhit Aggarwal, Jianjun Wang, David Held

机构 * Carnegie Mellon University(卡内基梅隆大学) ABB Inc.(ABB公司)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10566 2026-04-14 cs.SI cs.CY 50%

Israel-Hamas War on X: A Case Study of Coordinated Campaigns and Information Integrity

X平台上的以色列-哈马斯战争:协调行动与信息完整性案例研究

Tuğrulcan Elmas, Filipi Nascimento Silva, Manita Pote, Priyanka Dey, Keng-Chi Chang, Jinyi Ye, Luca Luceri, Cody Buntain, Emilio Ferrara, Alessandro Flammini, Fil Menczer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过分析2023年以色列-哈马斯战争期间的推文,研究协调行动与信息完整性之间的关系,发现协调行动主要依赖低复杂度策略,且信息完整性、毒性及情绪信号互不相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09817 2026-04-14 cs.LG 50%

NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

NeuroFlow:迈向从神经活动统一的视觉编码和解码

Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew F. Luo, Jiamin Wu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。

Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 50%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03654 2026-04-07 cs.IR 50%

Joint Behavior-guided and Modality-coherence Conditional Graph Diffusion Denoising for Multi Modal Recommendation

多模态推荐的联合行为引导和模态一致性条件图扩散去噪

Xiangchen Pan, Wei Wei

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出JBM-Diff模型,通过多视图信息传播和特征融合去除多模态特征中的冗余信息,并从行为角度检测样本对的偏序一致性以提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03133 2026-04-06 physics.soc-ph 50%

Understanding the complexity of frequency and phase angle fluctuations in power grids

理解电力网络中频率和相角波动的复杂性

Alessandro Lonardi, Jacques M. Maritz, Leonardo Rydin Gorjão, Christian Beck

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过超级统计建模方法,分析了电力网络中频率和相角波动的复杂性,揭示了市场驱动的功率波动对电网动态的影响,并展示了低维有效电网模型对南非数据的拟合能力。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03066 2026-04-06 eess.SY cs.SY 50%

Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems

重新定义生命周期终点:面向电子再制造系统的智能自动化

Sibo Tian, Xiao Liang, Sara Behdad, Minghui Zheng

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文探讨电子再制造中智能自动化的核心挑战与机遇,分析机器人、控制与AI在构建可扩展、安全的再制造系统中的作用,提出多模态感知、不确定性决策等方法,为未来再制造系统发展提供指导。

Comments Accepted at the American Control Conference (ACC) 2026; to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05094 2026-04-06 cs.HC 50%

Agentic Link Construction for Environment and Intent Aware 6G Communication

面向环境和意图感知的6G通信代理链路构建

Zhaoyang Li, Shangzhuo Xie, Qianqian Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于强化学习的多模态通信决策模型,实现链路构建的语义对齐与个性化适应,提升6G通信的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01567 2026-04-03 cs.RO 50%

AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation

AnchorVLA:基于锚定扩散的高效端到端移动操作

Jia Syuen Lim, Zhizhen Zhang, Peter Bohm, Brendan Tidd, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Robotics and Autonomous Systems Group, CSIRO(CSIRO机器人与自主系统组)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出AnchorVLA,一种基于扩散的VLA策略,通过锚定扩散头在局部去噪以保留多模态动作生成,减少推理成本并提高移动操作的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29855 2026-04-01 cs.GR 50%

PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

PosterReward: 解锁高质量图形设计生成的准确评估

Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27058 2026-03-31 cs.LG cs.RO 50%

Liquid Networks with Mixture Density Heads for Efficient Imitation Learning

具有混合密度头的液体网络用于高效模仿学习

Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文比较了具有混合密度头的液体网络与扩散策略在多个任务中的性能,发现液体网络参数更少、预测误差更低且推理更快,且在样本效率实验中表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26981 2026-03-31 stat.ME math.ST stat.AP stat.TH 50%

Boosting multi-view association testing via devariation

通过去变异提升多视图关联检验

Ruyi Pan, Yinqiu He, Jun Young Park

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出去变异方法,通过惩罚低秩因子模型捕捉视图内依赖,提升统计功效,验证了其在多模态神经影像数据中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26696 2026-03-31 cs.RO 50%

Topological Motion Planning Diffusion: Generative Tangle-Free Path Planning for Tethered Robots in Obstacle-Rich Environments

拓扑运动规划扩散:用于缆绳机器人在障碍密集环境中的生成无纠缠路径规划

Yifu Tian, Xinhang Xu, Thien-Minh Nguyen, Muqing Cao

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出TMPD框架,结合终身拓扑记忆,通过扩散模型生成可行轨迹候选,并利用拓扑后端过滤优化,实现无碰撞和无纠缠的高效路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26466 2026-03-30 cs.RO 50%

Adapt as You Say: Online Interactive Bimanual Skill Adaptation via Human Language Feedback

根据指令适应:通过人类语言反馈实现在线交互双臂技能适应

Zhuo Li, Dianxi Li, Tao Teng, Quentin Rouxel, Zhipeng Dong, Dennis Hong, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学T-Stone机器人研究所协作与多功能机器人(CLOVER)实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系) Department of Advanced Robotics, Istituto Italiano di Tecnologia(意大利技术研究院先进机器人系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出BiSAIL框架,通过交互语言反馈实现零样本在线适应,提升双臂技能在任务变化中的适应性、泛化能力和跨身体可扩展性。

Comments 11 pages, 15 figures, submitted to IEEE TMECH

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22886 2026-03-30 cs.LG cs.RO 50%

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

任务标记:一种灵活的适应行为基础模型的方法

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

机构 * Technion(以色列理工学院) NVIDIA Research(英伟达研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出任务标记方法,通过强化学习学习任务特定编码器,使行为基础模型适应特定任务,同时保持灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25481 2026-03-27 cs.RO 50%

LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation

LILAC:基于语言的物体中心光学流用于开环轨迹生成

Motonari Kambara, Koki Seno, Tomoya Kaichi, Yanan Wang, Komei Sugiura

机构 * Keio University(庆应义塾大学) KDDI Research Inc.(KDDI研究所)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本文提出LILAC模型,通过结合视觉与语言信息生成物体中心光学流,并转化为6自由度机械臂轨迹,实验显示其在多个基准和实际物体操作中表现更优。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10328 2026-03-26 stat.ML cs.LG 50%

Accelerated Parallel Tempering via Neural Transports

加速的神经传输并行退火

Leo Zhang, Peter Potaptchik, Jiajun He, Yuanqi Du, Arnaud Doucet, Francisco Vargas, Hai-Dang Dau, Saifuddin Syed

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Cornell University(康奈尔大学) Xaira Therapeutics National University of Singapore(新加坡国立大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出利用神经采样器加速并行退火,通过减少相邻分布间的重叠需求,提升多模态采样效率并降低计算成本。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO 50%

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23142 2026-03-25 cs.SE 50%

Can Language Models Pass Software Testing Certification Exams? a case study

语言模型能否通过软件测试认证考试?一项案例研究

Fitash Ul Haq, Jordi Cabot

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究评估了60种语言模型在ISTQB认证考试中的表现,探讨LLM在软件测试任务中的能力及考试设计改进建议。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22502 2026-03-25 cs.RO 50%

MapForest: A Modular Field Robotics System for Forest Mapping and Invasive Species Localization

MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统

Sandeep Zachariah, Francisco Yandun, Sachet Korada, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。

Comments 8 pages, 9 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16480 2026-03-25 math.PR 50%

Pattern block method for generating random numbers : Reformulation and generalization of the Ziggurat method using conditional random variables

模式块方法用于生成随机数:利用条件随机变量重新公式化和推广Ziggurat方法

Kensuke Ishitani

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出模式块方法,扩展Ziggurat方法,用于生成多峰密度函数和多维分布的随机数,并通过实例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG 50%

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22160 2026-03-24 stat.AP cs.LG 50%

Data Curation for Machine Learning Interatomic Potentials by Determinantal Point Processes

通过确定性点过程数据筛选机器学习互原子势

Joanna Zou, Youssef Marzouk

机构 * Computational Science & Engineering Massachusetts Institute of Technology(计算科学与工程 马萨诸塞理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出利用确定性点过程筛选原子构型子集,以生成高质量训练集,提升分子系统机器学习表示的准确性与鲁棒性。

Comments Original publication at https://openreview.net/forum?id=PKGP7tg65A

Journal ref ICLR AI4MAT Workshop (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21481 2026-03-24 cs.IR 50%

TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation

TagLLM: 一种用于笔记推荐的细粒度标签生成方法

Zhijian Chen, Likai Wang, Lei Chen, Yaguang Dou, Jialiang Shi, Tian Qi, Dongdong Hao, Mengying Lu, Cheng Ye, Chao Wei

专题命中 多模态生成 :multimodal(abstract)

AI总结 TagLLM通过用户兴趣手册和多模态CoT提取构建细粒度标签数据,采用标签知识蒸馏提升小模型生成能力,有效提升笔记推荐的点击率和用户停留时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01192 2026-03-24 cs.RO 50%

Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation

统一的生成-细化规划:连接引导流匹配与基于模型的预测控制以实现社交导航

Kazuki Mizuta, Karen Leung

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种结合奖励引导条件流匹配与模型预测路径积分的统一生成-细化框架,以提升社交导航中安全、任务性能和计算时间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 50%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19029 2026-03-20 cs.RO 50%

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏