arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4965 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4965 篇

2505.20001 2026-05-12 cs.CV 79%

NEXT: Multi-Grained Mixture of Experts via Text-Modulation for Multi-Modal Object Re-Identification

NEXT: 通过文本调制的多粒度专家混合实现多模态物体重识别

Shihao Li, Huaibo Huang, Junxian Duan, Aihua Zheng, Jin Tang, Jixin Ma

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) New Laboratory of Pattern Recognition(模式识别新实验室) CASIA(中国科学院自动化所) University of Chinese Academy of Sciences(中国科学院大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Greenwich(格林威治大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出NEXT框架,通过文本调制分离语义和结构分支,融合多粒度专家特征,提升多模态物体重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09981 2026-05-12 q-bio.BM cs.AI 79%

Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation

Yeti: 一种紧凑的蛋白质结构分词器用于重建和多模态生成

Nabin Giri, Steven Farrell, Kristofer E. Bouchard

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 Yeti是一种基于无查找量化的小型蛋白质结构分词器,通过端到端训练实现多模态学习,其在代码本利用和生成能力上表现优异,生成的结构与序列能产生合理结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-05-12 cs.CV 79%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01666 2026-05-12 quant-ph cs.AI cs.LG 79%

Synthesis of discrete-continuous quantum circuits with multimodal diffusion models

多模扩散模型在离散-连续量子电路合成中的应用

Florian Fürrutter, Zohim Chandani, Ikko Hamamura, Hans J. Briegel, Gorka Muñoz-Gil

机构 * Department of Theoretical Physics, University of Innsbruck(因斯布鲁克大学理论物理系) Quantum Algorithm Engineering, NVIDIA Corporation(NVIDIA公司量子算法工程)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模扩散模型用于高效合成量子电路,通过生成电路结构和连续参数,在门数量和噪声条件下优于现有方法,并利用快速生成能力构建大规模电路数据集。

Comments Main Text: 11 pages, 8 figures and 1 table; Code available at: https://github.com/FlorianFuerrutter/genQC

Journal ref Machine Learning: Science and Technology 7.2 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 79%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08252 2026-05-12 cs.CV 79%

Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)

通过因果-扩散桥进行多模态情绪识别(Affect-Diff)

Ankit Sanjyal

机构 * Department of Computer Science -- Data Science(计算机科学系——数据科学部) Fordham University(福特汉姆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对CMU-MOSEI数据集中情绪类别不平衡问题,Affect-Diff通过因果图、正则化潜在压缩和扩散先验机制提升识别性能,验证了其在平衡准确率和少数类敏感性上的优势。

Comments 10 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08029 2026-05-11 cs.CV cs.LG 79%

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

STARFlow2:连接语言模型与归一化流以实现统一的多模态生成

Ying Shen, Tianrong Chen, Yuan Gao, Yizhe Zhang, Yuyang Wang, Miguel Ángel Bautista, Shuangfei Zhai, Joshua M. Susskind, Jiatao Gu

机构 * Apple(苹果公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出STARFlow2,通过归一化流与预训练视觉语言模型结合,实现高效的多模态生成,采用深度浅层流设计和统一FAE潜在空间,提升生成效率与性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05359 2026-05-11 cs.CV 79%

Multimodal Latent Reasoning via Hierarchical Visual Cues Injection

多模态潜在推理 via 分层视觉提示注入

Yiming Zhang, Qiangyu Yan, Borui Jiang, Kai Han

机构 * Nanyang Technological University(南洋理工大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06439 2026-05-08 cs.CY cs.CV cs.ET 79%

From Review to Design: Ethical Multimodal Driver Monitoring Systems for Risk Mitigation, Incident Response, and Accountability in Automated Vehicles

从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统

Bilal Khana, Waseem Shariff, Rory Coyne, Muhammad Ali Farooq, Peter Corcoran

机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI 79%

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00526 2026-05-04 cs.CV 79%

IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations

IdentiFace:面向犯罪调查的可识别嫌疑人面部生成多模态迭代扩散框架

Weichen Liu, Yixin Yang, Changsheng Chen, Alex Kot

机构 * Southeast University(东南大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出IdentiFace框架,通过多模态输入设计和迭代生成流程提升可识别嫌疑人面部生成的条件控制与特征调整能力,贡献了面部身份损失函数和两个专用数据集,实验证明其在身份检索上的优越性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 79%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV 79%

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23584 2026-04-28 cs.CV cs.IR 79%

Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

多模态检索增强生成中视觉证据的身份解耦匿名化

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science University of Oxford, UK

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出身份解耦MRAG框架,通过在检索与生成之间插入生成匿名化模块,解耦人脸身份与属性,利用生成对抗网络和拒绝采样器实现隐私保护。

Comments ACM International Conference on Multimedia Retrieval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22212 2026-04-27 eess.IV cs.CV cs.LG 79%

Multimodal Diffusion to Mutually Enhance Polarized Light and Low Resolution EBSD Data

多模态扩散用于互为增强的偏振光与低分辨率EBSD数据

Harry Dong, Timofey Efimov, Megna Shah, Jeff Simmons, Sean Donegan, Marc De Graef, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) Air Force Research Laboratory(空军研究实验室) Yale University(耶鲁大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态扩散模型,通过结合偏振光和低分辨率EBSD数据,提升数据收集效率,实现颗粒边界预测、超分辨率和去噪等任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01650 2026-04-27 cs.HC cs.AI 79%

AromaGen: Interactive Generation of Rich Olfactory Experiences with Multimodal Language Models

AromaGen:基于多模态语言模型的交互式丰富嗅觉体验生成

Yunge Wen, Awu Chen, Jianing Yu, Jas Brooks, Hiroshi Ishii, Paul Pu Liang

机构 * MIT Media Lab(MIT媒体实验室) Harvard Graduate School of Design(哈佛设计研究生院) MIT CSAIL(MIT计算机科学与人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 AromaGen利用多模态语言模型实现基于文本和视觉输入的实时嗅觉生成,通过迭代优化提升嗅觉混合物的自然度,达到与真实食物香气相似的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21146 2026-04-24 cs.CV 79%

WFM: 3D Wavelet Flow Matching for Ultrafast Multi-Modal MRI Synthesis

WFM:用于超快速多模态MRI合成的3D小波流匹配

Yalcin Tur, Mihajlo Stojkovic, Ulas Bagci

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Machine and Hybrid Intelligence Lab, Feinberg School of Medicine, Northwestern University(北western大学费因伯格医学院机器与混合智能实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出WFM方法,通过学习基于小波空间条件均值的直接流,实现高效多模态MRI合成,单模型在BraTS 2024上达到26.8 dB PSNR和0.94 SSIM,速度比扩散模型快250-1000倍。

Comments 17 pages, 4 figures, 3 tables. Accepted at MIDL 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20796 2026-04-23 cs.CV 79%

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解和生成

Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, Qi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan Wu, Yi Xin, Junbo Zhao

机构 * AGI Research Center, Inclusion AI(AGI研究中心,Inclusion AI)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 LLaDA2.0-Uni结合全语义离散分词器、MoE-based dLLM和扩散解码器,实现多模态理解和生成,通过SigLIP-VQ离散化视觉输入,提升推理效率,支持交错生成与推理,展现强大的图像生成与编辑能力。

Comments LLaDA2.0-Uni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20715 2026-04-23 cs.CV 79%

GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

GeoRelight: 基于灵活多模态扩散变换器的联合几何重照明与重建

Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero

机构 * Codec Avatars Lab, Meta(Meta编码器动画实验室) University of Tübingen(图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学院,萨尔兰信息校园)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出GeoRelight,通过联合解决几何重建与重照明问题,利用iNOD和混合数据训练方法提升性能,优于传统顺序模型和忽略几何的系统。

Comments CVPR 2026 Highlight; Project page: https://yuxuan-xue.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 79%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV 79%

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 79%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07786 2026-04-20 cs.CV cs.LG 79%

Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video

跨模态情绪迁移用于谈话人脸视频中的情绪编辑

Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态情绪迁移(C-MET)方法,通过建模语音与视觉特征空间间的情绪语义向量,提升生成视频的情绪表达与真实感,实验表明其在MEAD和CREMA-D数据集上比现有方法提升14%的情绪准确性。

Comments Accepted to CVPR 2026. Project Page: https://chanhyeok-choi.github.io/C-MET/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14574 2026-04-17 cs.CV 79%

M3D-Net: Multi-Modal 3D Facial Feature Reconstruction Network for Deepfake Detection

M3D-Net:面向深度伪造检测的多模态3D面部特征重建网络

Haotian Wu, Yue Cheng, Shan Bian

机构 * College of Mathematics and Informatics(数学与信息学院) South China Agricultural University(华南农业大学) Wushan Road, Tianhe District(天河南路) Guangzhou(广州) China(中国)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出M3D-Net,通过多模态特征融合和3D重建模块提升深度伪造检测的准确性和鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14268 2026-04-17 cs.CV 79%

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

HY-World 2.0:一个多模态世界模型用于重建、生成和模拟3D世界

Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang, Junta Wu, Zhenyang Liu, Yuning Gong, Yang Liu, Bo Yuan, Chao Zhang, Coopers Li, Dongyuan Guo, Fan Yang, Haiyu Zhang, Hang Cao, Jianchen Zhu, Jiaxin Lin, Jie Xiao, Jihong Zhang, Junlin Yu, Lei Wang, Lifu Wang, Lilin Wang, Linus, Minghui Chen, Peng He, Penghao Zhao, Qi Chen, Rui Chen, Rui Shao, Sicong Liu, Wangchen Qin, Xiaochuan Niu, Xiang Yuan, Yi Sun, Yifei Tang, Yifu Sun, Yihang Lian, Yonghao Tan, Yuhong Liu, Yuyang Yin, Zhiyuan Min, Tengfei Wang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 HY-World 2.0通过多模态输入生成高保真3D场景,改进了先前版本,引入了多项创新以提升全景真实性、3D场景理解和规划能力,并升级了WorldStereo和WorldMirror模型,实现了3D世界交互探索。

Comments Project Page: https://3d-models.hunyuan.tencent.com/world/ ; Code: https://github.com/Tencent-Hunyuan/HY-World-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23468 2026-04-17 cs.RO cs.AI cs.LG 79%

Multi-Modal Manipulation via Multi-Modal Policy Consensus

多模态操控 via 多模态策略共识

Haonan Chen, Jiaming Xu, Hongyu Chen, Kaiwen Hong, Binghao Huang, Chaoqi Liu, Jiayuan Mao, Yunzhu Li, Yilun Du, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出通过多模态策略共识实现多模态操控,采用扩散模型分解策略并利用路由网络动态组合模态贡献,提升机器人操控任务中多模态推理能力。

Comments 8 pages, 7 figures. Project website: https://policyconsensus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13046 2026-04-16 cs.DB cs.CL cs.IR cs.LG cs.PL 79%

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

面向LLM驱动触发生成的领域特定语言

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax

机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。

Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11334 2026-04-14 cs.AI 79%

Dynamic Summary Generation for Interpretable Multimodal Depression Detection

动态摘要生成用于可解释的多模态抑郁症检测

Shiyu Teng, Jiaqing Liu, Hao Sun, Yu Li, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Faculty of Engineering, University of the Ryukyus(琉球大学工学部)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种粗到细的多阶段框架,利用大语言模型实现准确且可解释的多模态抑郁症检测,通过生成临床摘要指导多模态融合模块,提升诊断准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 79%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 多模态生成 :MLLM(title);分类 cs.CV、cs.CL、cs.AI

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏