arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2508.01504 2026-02-16 cs.LG 50%

Instruction-based Time Series Editing

基于指令的时间序列编辑

Jiaxing Qiu, Dongliang Guo, Brynne Sullivan, Teague R. Henry, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 InstructTime是一种基于指令的时间序列编辑器,通过自然语言指令实现灵活且可控的编辑,能够生成高质量的编辑结果并适应新条件。

Comments (KDD 26) Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10587 2026-02-12 stat.ML cs.LG 50%

Deep Bootstrap

深度Bootstrap

Jinyuan Chang, Yuling Jiao, Lican Kang, Junjie Shi

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于条件扩散模型的深度Bootstrap框架,用于非参数回归,通过统一生成框架实现高效采样和准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10544 2026-02-12 cs.LG cs.NA math.NA 50%

Bridging the Compression-Precision Paradox: A Hybrid Architecture for Clinical EEG Report Generation with Guaranteed Measurement Accuracy

弥合压缩-精度悖论:一种用于临床EEG报告生成的混合架构,保证测量精度

Wuyang Zhang, Zhen Luo, Chuqiao Gu, Jianming Ma, Yebo Cao, Wangming Yuan, Yinzhi Jin

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·马歇尔大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本研究提出了一种混合架构,通过信号处理和跨模态翻译实现临床EEG报告生成,保证测量精度,减少误报并提升检测速度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08910 2026-02-10 cond-mat.dis-nn cond-mat.stat-mech q-bio.NC q-bio.PE 50%

Structural coarse-graining enables noise-robust functional connectivity and reveals hidden inter-subject variability

结构粗粒化实现噪声鲁棒的功能连接并揭示隐藏的跨受试者变异性

Izaro Fernandez-Iriondo, Antonio Jimenez-Marin, Jesus Cortes, Pablo Villegas

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种结合扩散结构粗粒化和频谱噪声过滤的方法,以从有限时间数据中恢复可靠的高维功能网络,揭示隐藏的跨受试者变异。

Comments 10 Pages, 4 Figures and Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07735 2026-02-10 cs.LG q-bio.BM 50%

TerraBind: Fast and Accurate Binding Affinity Prediction through Coarse Structural Representations

TerraBind: 通过粗粒结构性表示实现快速且准确的结合亲和力预测

Matteo Rossi, Ryan Pederson, Miles Wang-Henderson, Ben Kaufman, Edward C. Williams, Carl Underkoffler, Owen Lewis Howell, Adrian Layer, Stephan Thaler, Narbe Mardirossian, John Anthony Parkhill

机构 * Terray Therapeutics, Inc.(Terray Therapeutics公司)

专题命中 多模态生成 :multimodal(abstract)

AI总结 TerraBind通过粗粒结构性表示实现了快速且准确的结合亲和力预测,其推理速度比现有方法快26倍,同时在亲和力预测准确性上提升了约20%。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06990 2026-02-10 eess.SP 50%

A Pre-trained EEG-to-MEG Generative Framework for Enhancing BCI Decoding

一种预训练的EEG到MEG生成框架用于增强BCI解码

Zhuo Li, Shuqiang Wang

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本文提出了一种基于EEG-MEG时空耦合表示的跨模态生成框架,通过合成MEG信号提升BCI解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05855 2026-02-06 cs.RO cs.LG 50%

A Hybrid Autoencoder for Robust Heightmap Generation from Fused Lidar and Depth Data for Humanoid Robot Locomotion

一种用于人形机器人运动的融合激光雷达和深度数据的鲁棒高度图生成的混合自编码器

Dennis Bank, Joost Cordes, Thomas Seel, Simon F. G. Ehlers

机构 * Institute of Mechatronic Systems, Leibniz University Hannover(机械系统研究所,莱比锡洪堡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种混合自编码器,通过融合激光雷达和深度数据生成鲁棒的高度图,以提升人形机器人在非结构化环境中的运动性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 50%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03112 2026-02-05 cs.RO 50%

A Unified Candidate Set with Scene-Adaptive Refinement via Diffusion for End-to-End Autonomous Driving

通过扩散生成场景自适应候选集的统一候选集用于端到端自动驾驶

Zhengfei Wu, Shuaixi Pan, Shuohan Chen, Shuo Yang, Yanjun Huang

机构 * School of Automotive Studies, Tongji University, Shanghai, China(同济大学汽车学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CdDrive通过扩散生成场景自适应候选集,提升端到端自动驾驶的候选集设计与轨迹平滑性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02924 2026-02-04 cs.LG cs.SY eess.SY 50%

How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?

如何通过扩散模型使拉格朗日量引导安全强化学习?

Xiaoyuan Cheng, Wenxuan Yuan, Boyang Li, Yuanchao Xu, Yiming Yang, Hao Liang, Bei Peng, Robert Loftin, Zhuo Sun, Yukun Hu

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) University of California, San Diego(加州大学圣地亚哥分校) Kyoto University(京都大学) King's College London(伦敦国王学院) University of Sheffield(谢菲尔德大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出ALGD算法,通过增强拉格朗日方法解决安全强化学习中的稳定性问题,实现稳定有效的政策生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14943 2026-02-04 cs.HC 50%

State of the Art of LLM-Enabled Interaction with Visualization

大语言模型赋能的可视化交互现状

Mathis Brossier, Tobias Isenberg, Konrad Schönborn, Jonas Unger, Mario Romero, Johanna Björklund, Anders Ynnerman, Lonni Besançon

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。

Comments Submitted to STARs of EuroVis'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00941 2026-02-03 cs.NI 50%

LMTE: Putting the "Reasoning" into WAN Traffic Engineering with Language Models

LMTE:利用语言模型进行WAN流量工程中的推理

Xinyu Yuan, Yan Qiao, Zonghui Wang, Meng Li, Wenzhi Chen

专题命中 多模态生成 :multimodal(abstract)

AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。

Comments Accepted as a conference paper at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00808 2026-02-03 cs.RO 50%

Physics-informed Diffusion Mamba Transformer for Real-world Driving

物理引导的扩散Mamba变换器用于现实驾驶

Hang Zhou, Qiang Zhang, Peiran Liu, Yihao Qin, Zhaoxu Yan, Yiding Ji

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) MoSense Technologies

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种结合Mamba和注意力机制的扩散模型,通过整合物理约束提升自动驾驶轨迹预测的准确性和可解释性。

Journal ref International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11818 2026-02-03 cs.LG 50%

SynCoGen: Synthesizable 3D Molecule Generation via Joint Reaction and Coordinate Modeling

SynCoGen: 通过联合反应和坐标建模实现可合成的3D分子生成

Andrei Rekesh, Miruna Cretu, Dmytro Shevchuk, Vignesh Ram Somnath, Pietro Liò, Robert A. Batey, Mike Tyers, Michał Koziarski, Cheng-Hao Liu

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(多伦多儿童医院) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Vector Institute(向量研究所) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Caltech(加州理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 SynCoGen通过联合反应和坐标建模实现可合成的3D分子生成,实现了分子构建块、化学反应和原子坐标的联合分布采样,在无条件小分子生成和药物发现中表现出色。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21524 2026-01-30 eess.SP 50%

Channel Extrapolation for MIMO Systems with the Assistance of Multi-path Information Induced from Channel State Information

利用通道状态信息诱导的多路径信息进行MIMO系统的通道外推

Yuan Gao, Xinyi Wu, Jiang Jun, Zitian Zhang, Zhaohui Yang, Shugong Xu, Cheng-Xiang Wang, Zhu Han

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于多路径信息的通道外推框架,利用CSI诱导的PDP特征提升6G网络中CSI获取的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17138 2026-01-30 q-bio.BM 50%

AI Developments for T and B Cell Receptor Modeling and Therapeutic Design

人工智能在T细胞和B细胞受体建模及治疗设计中的发展

Linhui Xie, Aurelien Pelissier, Yanjun Shao, Maria Rodriguez Martinez

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究利用人工智能技术,通过预测和生成框架改进T和B细胞受体建模,提升治疗设计的效率和临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19504 2026-01-28 q-fin.CP 50%

Generating Alpha: A Hybrid AI-Driven Trading System Integrating Technical Analysis, Machine Learning and Financial Sentiment for Regime-Adaptive Equity Strategies

生成Alpha:一种融合技术分析、机器学习和金融情绪的混合AI驱动交易系统,用于适应性股票策略

Varun Narayan Kannan Pillai, Akshay Ajith, Sumesh K J

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种融合技术分析、机器学习和金融情绪的混合AI交易系统,通过多模态AI实现适应性股票策略,取得135.49%的回报率。

Comments Preprint. Full version of an accepted conference paper (ComSIA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00884 2026-01-27 stat.CO stat.ML 50%

Generating Synthetic Data with Locally Estimated Distributions for Disclosure Control

通过局部估计分布生成合成数据以实现披露控制

Ali Furkan Kalay

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出局部重采样器方法,通过局部估计分布生成合成数据,有效降低异常值导致的披露风险,提升数据效用与隐私保护的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16639 2026-01-26 cs.HC cs.DB 50%

HapticMatch: An Exploration for Generative Material Haptic Simulation and Interaction

HapticMatch: 生成材料触觉模拟与交互的探索

Mingxin Zhang, Yu Yao, Yasutoshi Makino, Hiroyuki Shinoda, Masashi Sugiyama

专题命中 多模态生成 :multimodal(abstract)

AI总结 HapticMatch通过视觉到触觉的生成框架,利用新型数据集和条件生成模型,实现高保真的触觉模拟与交互,提升VR/AR中的沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14228 2026-01-21 cs.LG 50%

Attention-Based Offline Reinforcement Learning and Clustering for Interpretable Sepsis Treatment

基于注意力机制的离线强化学习与聚类用于可解释的脓毒症治疗

Punit Kumar, Vaibhav Saran, Divyesh Patel, Nitin Kulkarni, Alina Vereshchaka

机构 * Department of Computer Science(计算机科学系) Engineering University at Buffalo Buffalo, New York, USA(布法罗大学工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出基于注意力机制的离线强化学习与聚类方法,用于可解释的脓毒症治疗决策支持,通过多模块整合提升治疗准确性和可解释性。

Comments 8 pages, 6 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13250 2026-01-21 cs.RO 50%

Diffusion-based Inverse Model of a Distributed Tactile Sensor for Object Pose Estimation

基于扩散的分布式触觉传感器逆模型用于物体姿态估计

Ante Marić, Giammarco Caroleo, Alessandro Albini, Julius Jankowski, Perla Maiolino, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Oxford Robotics Institute(牛津机器人研究所)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩散模型的分布式触觉传感器逆模型,用于在无视觉数据情况下提高物体姿态估计的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12901 2026-01-21 cs.RO 50%

PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning

PlannerRFT: 通过闭环和样本高效微调强化扩散规划器

Hongchen Li, Tianyu Li, Jiazhi Yang, Haochen Tian, Caojun Wang, Lei Shi, Mingyang Shang, Zengrong Lin, Gaoqiang Wu, Zhihui Hao, Xianpeng Lang, Jia Hu, Hongyang Li

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Meituan(美团) Li Auto Inc.(李自动公司)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PlannerRFT通过闭环和样本高效微调提升扩散规划器的多模态轨迹生成能力,实现高效探索与鲁棒性增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD 50%

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 50%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(abstract)

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10708 2026-01-16 cs.LG math.ST stat.TH 50%

High-accuracy and dimension-free sampling with diffusions

高精度和无维度的扩散采样

Khashayar Gatmiry, Sitan Chen, Adil Salim

机构 * UC Berkeley(伯克利大学) Harvard University(哈佛大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于低次近似与插值方法的扩散模型求解器,实现了高精度采样且不依赖环境维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09163 2026-01-15 cs.RO 50%

CEI: A Unified Interface for Cross-Embodiment Visuomotor Policy Learning in 3D Space

CEI:一种用于3D空间跨身体视觉运动策略学习的统一接口

Tong Wu, Shoujie Li, Junhao Gong, Changqing Guo, Xingting Li, Shilong Mu, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CEI提出了一种跨身体视觉运动策略学习框架,通过功能相似性量化和梯度优化实现不同机械臂和末端执行器间的演示转移,实验显示在模拟和现实任务中均取得高转移效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07823 2026-01-13 eess.SY cs.RO cs.SY 50%

Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions

机器人中的视频生成模型——应用、研究挑战与未来方向

Zhiting Mei, Tenny Yin, Ola Shorinwa, Apurva Badithela, Zhonghe Zheng, Joseph Bruno, Madison Bland, Lihan Zha, Asher Hancock, Jaime Fernández Fisac, Philip Dames, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) Temple University(Temple 大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07307 2026-01-13 cs.NI 50%

Low-Altitude Satellite-AAV Collaborative Joint Mobile Edge Computing and Data Collection via Diffusion-based Deep Reinforcement Learning

低空卫星-无人机协同联合移动边缘计算与数据采集 via 基于扩散的深度强化学习

Boxiong Wang, Hui Kang, Jiahui Li, Geng Sun, Zemin Sun, Jiacheng Wang, Dusit Niyato, Shiwen Mao

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出基于扩散的深度强化学习方法,用于低空卫星-无人机协同联合移动边缘计算与数据采集,以提高效率和性能。

Comments 18 pages, 12 figures, accepted by IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15716 2026-01-13 cs.RO 50%

DiffPF: Differentiable Particle Filtering with Generative Sampling via Conditional Diffusion Models

DiffPF: 基于条件扩散模型的可微粒子滤波器通过生成采样

Ziyu Wan, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,国立新加坡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 DiffPF通过条件扩散模型实现高精度后验采样,提升动态系统状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04915 2026-01-09 cs.HC 50%

OnomaCompass: A Texture Exploration Interface that Shuttles between Words and Images

OnomaCompass: 一种连接词语与图像的纹理探索界面

Miki Okamura, Shuhey Koyama, Li Jingjing, Yoichi Ochiai

专题命中 多模态生成 :cross-modal(abstract)

AI总结 OnomaCompass通过连接拟声词与图像的潜在空间,帮助用户更高效地发现材料,减少工作量并提升用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏