Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations
专题命中 多模态生成 :multimodal(title)
Comments 20 pages, 11 figures, submitted to TRO
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title)
Comments 20 pages, 11 figures, submitted to TRO
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
Comments 17 pages, 8 figures
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multi-modal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :cross-modal(title)
Comments This paper is accepted at ICRA 2023
专题命中 多模态生成 :multimodal(title)
Comments Matches published version in PRD. 19 pages (including appendix and bibliography), 14 figures
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
Comments 42 pages,3 Figures,4 Tables, 13 Supplemental Figures, 11 Supplemental Tables
专题命中 多模态生成 :multi-modal(title)
Comments 17 pgs, 8 figures
Journal ref Phys. Rev. E 97, 042402 (2018)
专题命中 多模态生成 :multimodal(title)
Comments SPIE Medical Imaging 2016, Proc. SPIE Medical Imaging: Biomedical Applications in Molecular, Structural, and Functional Imaging, 2016
Journal ref SPIE Medical Imaging, pp. 97881Y-97881Y. 2016
当前谁主导?用于图表转代码生成的令牌级模态仲裁
专题命中 多模态生成 :cross-modal(abstract,abstract_cn);分类 cs.AI
AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。
持久故事世界模拟与连续角色定制
机构 * Xiamen University(厦门大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。
面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。
Comments Accepted by ECCV 2026
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。
ReGraph:从食物图像生成食谱图的学习方法
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信体智能研究院) ; Singapore Management University(新加坡管理大学)
专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 本研究针对现有食谱生成方法的过程结构捕捉不足问题,构建了ReGraph食谱图数据集并提出RGL两阶段框架,可让LMM从食物图像生成结构化食谱图,提升了烹饪实体与过程关系的生成效果。
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。
MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; StepFun(阶跃星辰) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。
Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page
生成式AI时代的深度伪造媒体生成与检测:综述与展望
机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。
Comments Accepted in ACM Computing Surveys
VIPER:用于物理上合理的视频生成的视觉上下文物理推理
机构 * Zhejiang University(浙江大学) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。
Comments tech report
超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。
Comments 13 pages
Axolotl3D:用于精确3D形状完成的统一框架
机构 * NVIDIA(英伟达)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。
Comments Accepted to ECCV 2026
RS-RIE-Bench:推理引导的遥感图像编辑基准测试
机构 * Huawei(华为)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。