arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-01 至 2025-12-01 共收录 111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 11 篇

2311.18773 2025-12-01 cs.CV 79%

Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains

Spacewalk-18:多模态和长形式程序视频理解的基准测试,用于新领域

Zitian Tang, Rohan Myer Krishnan, Zhiqiu Yu, Chen Sun

机构 * Brown University(布朗大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Spacewalk-18是一个用于多模态和长形式程序视频理解的新领域基准测试,通过步骤识别和视频问答任务评估模型在新领域和长时序上下文中的泛化能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22362 2025-12-01 cs.LG 78%

Efficient-Husformer: Efficient Multimodal Transformer Hyperparameter Optimization for Stress and Cognitive Loads

Efficient-Husformer: 高效多模态Transformer超参数优化用于压力和认知负荷检测

Merey Orazaly, Fariza Temirkhanova, Jurn-Gyu Park

机构 * The School of Engineering and Digital Sciences, Nazarbayev University(工程与数字科学学院,纳扎尔拜耶夫大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 Efficient-Husformer通过超参数优化提升多模态生理信号分析的效率和准确性,实现压力和认知负荷检测的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21693 2025-12-01 cs.MM 74%

Designing a Multimodal Viewer for Piano Performance Analysis -- a Pedagogy-First Approach

为钢琴表演分析设计多模态查看器——一种以教学为导向的方法

Joonhyung Bae, Hyeyoon Cho, Kirak Kim, Dawon Park, Taegyun Kwon, Yoon-Seok Choi, Hyeon Hur, Shigeru Kai, Yohei Wada, Satoshi Obata, Akira Maezawa, Jaebum Park, Jonghwa Park, Juhan Nam

专题命中 视频多模态 :multimodal(title);分类 cs.MM

AI总结 本研究提出了一种以教学为导向的多模态查看器,通过整合视频、动作捕捉和乐谱,为钢琴教学提供具体的视觉反馈,以提高教学指导的清晰度和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 62%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23477 2025-12-01 cs.CV 57%

Video-CoM: Interactive Video Reasoning via Chain of Manipulations

Video-CoM:通过操作链进行交互式视频推理

Hanoona Rasheed, Mohammed Zumri, Muhammad Maaz, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) University of California Merced(加州梅尔 Ced 大学) Google Research(谷歌研究院) Linköping University(林奈大学) Australian National University(澳大利亚国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-CoM通过操作链实现交互式视频推理,提升视频理解任务的性能和可解释性

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11423 2025-12-01 cs.AI 57%

CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction

CURENet:结合统一表示以实现高效的慢性疾病预测

Cong-Tinh Dao, Nguyen Minh Thao Phan, Jun-En Ding, Chenwei Wu, David Restrepo, Dongsheng Luo, Fanyi Zhao, Chun-Chieh Liao, Wen-Chih Peng, Chi-Te Wang, Pei-Fu Chen, Ling Chen, Xinglong Ju, Feng Liu, Fang-Ming Hung

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Can Tho University(Cần Thơ 大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Florida International University(佛罗里达国际大学) Southern Utah University(南方犹他大学) Far Eastern Memorial Hospital(东方纪念医院) Yuan Ze University(元智大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 CURENet通过整合多模态EHR数据,利用LLMs和Transformer编码器提升慢性疾病预测的准确率,达到94%以上的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19637 2025-12-01 cs.CV 57%

Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction

通过互样本分析和内样本分析增强部分相关视频检索

Junlong Ren, Gangjian Zhang, Yu Hu, Jian Shu, Hui Xiong, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种增强部分相关视频检索的方法,通过互样本分析和内样本分析,结合时间一致性预测模块,提升视频与文本查询的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02364 2025-12-01 eess.AS 57%

State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data

最先进的无视频分割源 VoxCeleb 数据嵌入

Sara Barahona, Ladislav Mošner, Themos Stafylakis, Oldřich Plchot, Junyi Peng, Lukáš Burget, Jan Černocký

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种无需视频分割的说话人嵌入提取方法,利用弱标注数据训练提取器,实现了最先进的说话人验证性能,并提供了无需视觉的替代数据集创建方案。

Comments Accepted at the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22036 2025-12-01 cs.CL cs.LG 57%

ResearchArcade: Graph Interface for Academic Tasks

ResearchArcade: 用于学术任务的图界面

Jingjun Xu, Chongshan Lin, Haofei Yu, Tao Feng, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

AI总结 ResearchArcade是一种基于图的学术任务接口,通过统一多源数据和多模态信息,提升机器学习模型在学术研究中的性能与应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 6 篇

2511.21827 2025-12-01 cs.AI cs.CV 84%

Evaluating Strategies for Synthesizing Clinical Notes for Medical Multimodal AI

评估合成临床笔记的策略以用于医疗多模态AI

Niccolo Marini, Zhaohui Liang, Sivaramakrishnan Rajaraman, Zhiyun Xue, Sameer Antani

机构 * Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家医学图书馆内部研究部,国家卫生研究院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了合成临床笔记的生成策略,通过优化提示设计和医学元数据,提升医疗多模态AI在分类和跨模态检索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21707 2025-12-01 cs.NI cs.AI 83%

Sensing and Understanding the World over Air: A Large Multimodal Model for Mobile Networks

通过空气感知和理解世界:为移动网络设计的大型多模态模型

Zhuoran Duan, Yuhao Wei, Guoshun Nan, Zijun Wang, Yan Yan, Lihua Xiong, Yuhan Ran, Ji Zhang, Jian Li, Qimei Cui, Xiaofeng Tao, Tony Q. S. Quek

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications (BUPT), Beijing(中国移动网络技术国家工程研究中心,北京邮电大学) Beiyou Shenzhen Institute(北邮深圳研究所) School of Cyber Security, University of Chinese Academy of Sciences (UCAS)(中国科学院大学网络安全学院) China Telecom Co., Ltd.(中国电信股份有限公司) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种无线原生多模态模型,利用无线信号进行对比学习,验证了其在无线网络中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22997 2025-12-01 cs.CV cs.RO 79%

MrGS: Multi-modal Radiance Fields with 3D Gaussian Splatting for RGB-Thermal Novel View Synthesis

MrGS: 多模态辐射场与3D高斯点云融合用于RGB-热成像新视角合成

Minseong Kweon, Janghyun Kim, Ukcheol Shin, Jinsun Park

机构 * Minnesota Robotics Institute (MnRI), University of Minnesota, Twin Cities(明尼苏达大学罗学院(MnRI)、明尼苏达大学双城分校) Department of Information Convergence Engineering (Artificial Intelligence Major), Pusan National University(信息融合工程系(人工智能专业),釜山国立大学) Department of Energy Engineering, Korea Institute of Energy Technology (KENTECH)(能源工程系,韩国能源技术研究所(KENTECH)) School of Computer Science and Engineering, Pusan National University(计算机科学与工程学院,釜山国立大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 MrGS通过多模态辐射场与3D高斯点云融合,实现RGB和热成像新视角合成,利用物理原理建模热传导和辐射现象,提升重建精度与效率。

Comments Accepted at Thermal Infrared in Robotics (TIRO) Workshop, ICRA 2025 (Best Poster Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 57%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22470 2025-12-01 cs.CV 57%

Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval

混合、统一和迭代:一种基于文本的人员异常检索新框架

Tien-Huy Nguyen, Huu-Loc Tran, Huu-Phong Phan-Nguyen, Quang-Vinh Dinh

机构 * University of Information Technology Vietnam National University(信息技术大学越南国家大学) AI VIETNAM Lab(AI越南实验室)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 本文提出了一种混合、统一和迭代的新型框架,通过结合局部-全局视角和统一图像-文本模型,提升基于文本的人员异常检索性能。

Comments Accepted on World Wide Web 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22253 2025-12-01 cs.IR cs.CV 57%

UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries

UNION: 一种轻量级的目标表示用于高效零样本图像引导检索与可选文本查询

Hoang-Bao Le, Allie Tran, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 UNION通过融合图像嵌入与空文本提示,实现高效零样本图像引导检索,仅需5,000训练样本即在多个基准测试中超越传统基线。

Comments Accepted at ICDM - MMSR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 20 篇

2511.22943 2025-12-01 cs.CL cs.CV 84%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21698 2025-12-01 cs.MM cs.AI 84%

TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement

TIP和Polish:通过共同性-差异性建模与细化的文本-图像-原型引导的多模态生成

Zhiyong Ma, Jiahao Chen, Qingyuan Chuai, Zhengping Li

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 TIPPo通过共同性-差异性建模与细化,提升多模态生成的主题一致性和风格一致性。

Comments Submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07565 2025-12-01 cs.CV 83%

OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

OpenDance: 基于大规模互联网数据的多模态可控3D舞蹈生成

Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang

机构 * Peking University(北京大学) Huawei Cloud(华为云)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OpenDance通过构建大规模舞蹈数据集和提出统一的可控生成框架,实现了多模态的3D舞蹈生成,支持音乐、文本、关键点和轨迹等多种条件控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23321 2025-12-01 cs.SE 82%

Chart2Code-MoLA: Efficient Multi-Modal Code Generation via Adaptive Expert Routing

Chart2Code-MoLA: 通过自适应专家路由实现高效的多模态代码生成

Yifei Wang, Jacky Keung, Zhenyu Mao, Jingyu Zhang, Yuchen Cao

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract)

AI总结 Chart2Code-MoLA通过自适应专家路由实现高效多模态代码生成,提升生成准确性、降低内存消耗并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23386 2025-12-01 cs.CV 79%

VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

VQRAE:用于多模态理解、生成和重建的表示量化自编码器

Sinan Du, Jiahao Guo, Bo Li, Shuhao Cui, Zhengzhuo Xu, Yifu Luo, Yongxian Wei, Kun Gai, Xinggang Wang, Kai Wu, Chun Yuan

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 VQRAE通过统一的分词器生成连续语义特征和离散标记,提升多模态理解、生成和重建的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12770 2025-12-01 cs.LG cs.CE 78%

MolEdit: Knowledge Editing for Multimodal Molecule Language Models

MolEdit: 多模态分子语言模型的知识编辑

Zhenyu Lei, Patrick Soga, Yaochen Zhu, Yinhan He, Yushun Dong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) Florida State University(佛罗里达州立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MolEdit通过多专家知识适配器和专家意识编辑切换器,提升多模态分子语言模型的编辑可靠性与局部性,实现分子与描述词的高效互转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM 74%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 多模态生成 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 70%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 70%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 70%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 多模态生成 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 62%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 62%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 57%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22863 2025-12-01 cs.CV 57%

CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

CoordSpeaker: 利用手势描述生成协调的 caption-驱动的语音同步手势生成

Fengyi Fang, Sicheng Yang, Wenming Yang

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoordSpeaker通过引入手势描述框架和条件潜在扩散模型,实现了协调的caption驱动的语音同步手势生成,解决了手势生成中的语义先验间隙和多模态控制难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22773 2025-12-01 cs.RO cs.AI 57%

CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance

CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障

Rui Heng Yang, Xuan Zhao, Leo Maxime Brunswic, Montgomery Alban, Mateo Clemente, Tongtong Cao, Jun Jin, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei(华为) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。

Comments 4 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏