arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 82 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2602.02175 2026-02-04 cs.CV 83%

CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization

CIEC: 通过隐式和显式线索耦合实现多模态弱监督操作定位

Xinquan Yu, Wei Lu, Xiangyang Luo, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) MoE Key Laboratory of Information Technology(信息技术关键实验室) Key Laboratory of Information Security Technology(信息安全技术重点实验室) Sun Yat-sen University(中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 CIEC通过耦合隐式和显式线索,实现多模态弱监督操作定位,利用粗粒度标注提升图像-文本对的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03007 2026-02-04 cs.CV cs.AI cs.LG 81%

VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering

VOILA:基于信息价值的保真度选择框架用于成本感知的多模态问答

Rahul Atul Bhope, K. R. Jayaram, Vinod Muthusamy, Ritesh Kumar, Vatche Isahagian, Nalini Venkatasubramanian

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VOILA通过基于信息价值的自适应保真度选择,在多模态问答中实现成本优化与高精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03822 2026-02-04 cs.CL 70%

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考

Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) The University of Western Australia(西澳大学) Stanford University(斯坦福大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。

Comments Accepted at the The Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 67%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL 62%

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21249 2026-02-04 cs.CV cs.AI cs.LG 62%

Decipher-MR: A Vision-Language Foundation Model for 3D MRI Representations

Decipher-MR:一种用于3D MRI表示的视觉-语言基础模型

Zhijian Yang, Noel DSouza, Istvan Megyeri, Xiaojian Xu, Amin Honarmandi Shandiz, Farzin Haddadpour, Krisztian Koos, Laszlo Rusko, Emanuele Valeriano, Bharadwaj Swaninathan, Lei Wu, Parminder Bhatia, Taha Kass-Hout, Erhan Bas

机构 * GE Healthcare(通用电气医疗)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Decipher-MR是一种专门针对3D MRI的视觉-语言基础模型,通过自监督学习和报告引导的文本监督,实现对多种医学任务的高效支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02786 2026-02-04 cs.LG 50%

LEMON: Local Explanations via Modality-aware OptimizatioN

LEMON:通过模态感知优化实现局部解释

Yu Qin, Phillip Sloan, Raul Santos-Rodriguez, Majid Mirmehdi, Telmo de Menezes e Silva Filho

机构 * University of Bristol(布里斯托大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 LEMON是一种高效的多模态局部解释框架,通过模态感知优化生成统一解释,减少计算成本并提升解释忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2510.11129 2026-02-04 cs.CV cs.AI 84%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02591 2026-02-04 cs.SD cs.AI 70%

VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis

VividVoice: 一个统一的框架,用于场景感知的视觉驱动语音合成

Chengyuan Ma, Jiawei Jin, Ruijie Xiong, Chunxiang Jin, Canxiang Yan, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Ant Group, China(蚂蚁集团)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 VividVoice通过构建大规模多模态数据集和设计核心对齐模块,提升了场景感知的视觉驱动语音合成的音频保真度和多模态一致性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 62%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02602 2026-02-04 cs.CR cs.LG 50%

Position: 3D Gaussian Splatting Watermarking Should Be Scenario-Driven and Threat-Model Explicit

位置:3D高斯散射水印应基于场景驱动和威胁模型明确

Yangfan Deng, Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, United States(马里兰大学学院公园分校)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文主张3D资产水印技术应基于场景驱动和威胁模型明确,以提升知识产权保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2602.02453 2026-02-04 cs.AI 79%

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03230 2026-02-04 cs.CV 70%

EventFlash: Towards Efficient MLLMs for Event-Based Vision

EventFlash: 向基于事件的视觉高效MLLMs迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 EventFlash通过时空令牌稀疏化技术,实现高效事件视觉处理,提升吞吐量并支持更长的事件流处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02551 2026-02-04 cs.LG cs.AI cs.CV 62%

EEO-TFV: Escape-Explore Optimizer for Web-Scale Time-Series Forecasting and Vision Analysis

EEO-TFV:面向网络级时间序列预测和视觉分析的逃逸-探索优化器

Hua Wang, Jinghao Lu, Fan Zhang

机构 * School of Computer and Artificial Intelligence, Ludong University(计算机与人工智能学院,鲁东大学) School of Computer Science and Technology, Shandong Technology and Business University(计算机科学与技术学院,山东技术与商务大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 EEO-TFV通过轻量级Transformer架构与逃逸-探索优化器,提升网络级时间序列预测和视觉分析的性能与泛化能力。

Comments Main paper: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17873 2026-02-04 cs.CV cs.AI 62%

SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model

SurgVidLM:迈向多粒度外科视频理解的大型语言模型

Guankun Wang, Junyi Wang, Wenjin Mo, Long Bai, Kun Yuan, Ming Hu, Jinlin Wu, Junjun He, Yiming Huang, Nicolas Padoy, Zhen Lei, Hongbin Liu, Nassir Navab, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑技术大学) Monash University(墨尔本大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SurgVidLM通过多粒度分析提升外科视频理解能力,结合全局与局部机制实现更精确的手术流程解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23729 2026-02-04 cs.CV 57%

Proteus-ID: ID-Consistent and Motion-Coherent Video Customization

Proteus-ID:身份一致且运动协调的视频定制

Guiyu Zhang, Chen Shi, Zijian Jiang, Xunzhi Xiang, Jingjing Qian, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Voyager Research, Didi Chuxing(Voyager Research与滴滴出行)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Proteus-ID通过多模态身份融合、时间感知身份注入和自适应运动学习,实现了身份一致且运动协调的视频定制,提升了视频生成的真实性和流畅度。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02982 2026-02-04 cs.HC 50%

Invisible Users in Digital Health: A Scoping Review of Digital Interventions to Promote Physical Activity Among Culturally and Linguistically Diverse Women

数字健康中的隐形用户:一项关于促进文化及语言多样性女性身体活动的数字干预措施的综述

Yilin Ke, Yun Suen Pai, Burkhard C. Wuensche, Angus Donald Campbell, Mairi Gunn

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究提出文化嵌入互动框架,通过整合文化适应与长期策略,解决数字健康干预在文化多样性女性中持续参与度不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02769 2026-02-04 cs.LG 50%

BiTimeCrossNet: Time-Aware Self-Supervised Learning for Pediatric Sleep

BiTimeCrossNet:面向儿童睡眠的时序自监督学习

Saurav Raj Pandey, Harlin Lee

机构 * Department of Computer Science, UNC Chapel Hill(UNC夏洛特分校计算机科学系) School of Data Science and Society, UNC Chapel Hill(UNC夏洛特分校数据科学与社会学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 BiTimeCrossNet通过引入时间信息和交叉注意力机制,在儿童睡眠分析中实现更高效的多模态自监督学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2508.04136 2026-02-04 cs.CV cs.AI 81%

UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval

UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索

Hongyu Guo, Xiangzhao Hao, Jiarui Guo, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 79%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03713 2026-02-04 cs.IR 78%

Multimodal Generative Recommendation for Fusing Semantic and Collaborative Signals

多模态生成推荐:融合语义和协同信号

Moritz Vandenhirtz, Kaveh Hassani, Shervin Ghasemlou, Shuai Shao, Hamid Eghbalzadeh, Fuchun Peng, Jun Liu, Michael Louis Iuzzolino

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MSCGRec通过融合语义和协同信号,提升大规模物品集上的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03432 2026-02-04 cs.IR 78%

Failure is Feedback: History-Aware Backtracking for Agentic Traversal in Multimodal Graphs

失败是反馈:面向多模态图中代理遍历的历史感知回溯

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 FiF通过历史感知回溯和经济理性的代理工作流程,提升多模态图中检索的适应性和效率。

Comments Project page: https://failureisfeedback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04536 2026-02-04 cs.LG cs.AI q-bio.NC 57%

NOBLE -- Neural Operator with Biologically-informed Latent Embeddings to Capture Experimental Variability in Biological Neuron Models

NOBLE -- 基于生物启发性潜在嵌入的神经算子:捕捉生物神经元模型中的实验变异

Luca Ghafourpour, Valentin Duruisseaux, Bahareh Tolooshams, Philip H. Wong, Costas A. Anastassiou, Anima Anandkumar

机构 * ETH Zürich(苏黎世联邦理工学院) California Institute of Technology(加州理工学院) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所) Cedars-Sinai Medical Center(Cedars-Sinai 医疗中心) Archimedes AI, Athena Research Center(Archimedes AI,Athena 研究中心)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 NOBLE通过生物启发性潜在嵌入和神经算子框架,高效生成具有实验变异性的合成神经元,实现神经动态的准确预测和模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 16 篇

2602.00508 2026-02-04 cs.CV 85%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01769 2026-02-04 cs.LG cs.AI 83%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02590 2026-02-04 cs.RO 82%

StepNav: Structured Trajectory Priors for Efficient and Multimodal Visual Navigation

StepNav: 为高效且多模态视觉导航引入结构化轨迹先验

Xubo Luo, Aodi Wu, Haodong Han, Xue Wan, Wei Zhang, Leizheng Shu, Ruisuo Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract)

AI总结 StepNav通过结构化多模态轨迹先验提升视觉导航的鲁棒性、效率和安全性。

Comments 8 pages, 7 figures; Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09131 2026-02-04 cs.GR cs.AI cs.CV 81%

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

无需训练的文本引导颜色编辑与多模态扩散变换器

Zixin Yin, Xili Dai, Ling-Hao Chen, Deyu Zhou, Jianan Wang, Duomin Wang, Gang Yu, Lionel M. Ni, Lei Zhang, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学) Astribot StepFun

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 ColorCtrl通过多模态扩散变换器实现无需训练的文本引导颜色编辑,精准控制颜色属性并保持一致性,优于现有方法和商业模型。

Comments https://zxyin.github.io/ColorCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12728 2026-02-04 cs.CV cs.MM 81%

SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation

SpecFLASH: 一种基于潜在引导的半自回归推测解码框架,用于高效多模态生成

Zihua Wang, Ruibo Li, Haozhe Du, Joey Tianyi Zhou, Yu Zhang, Xu Yang

机构 * Southeast University, Nanjing, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学) A STAR Centre for Frontier AI Research (CFAR), Singapore(A STAR前沿人工智能研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 SpecFLASH是一种针对多模态生成的高效推测解码框架,通过潜在引导的token压缩和半自回归解码方案,显著提升视觉任务的解码速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12203 2026-02-04 cs.CV 79%

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

LazyDrag: 通过显式对应关系在多模态扩散变换器上实现稳定的拖拽编辑

Zixin Yin, Xili Dai, Duomin Wang, Xianfang Zeng, Lionel M. Ni, Gang Yu, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科技大学) StepFun The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 LazyDrag通过显式对应关系实现多模态扩散变换器的稳定拖拽编辑,消除了隐式点匹配依赖,提升生成能力与精确控制。

Comments https://zxyin.github.io/LazyDrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20418 2026-02-04 eess.IV cs.CV 79%

Diff4MMLiTS: Advanced Multimodal Liver Tumor Segmentation via Diffusion-Based Image Synthesis and Alignment

Diff4MMLiTS: 通过基于扩散的图像合成与对齐的先进多模态肝肿瘤分割

Shiyun Chen, Li Lin, Pujin Cheng, ZhiCheng Jin, JianJian Chen, HaiDong Zhu, Kenneth K. Y. Wong, Xiaoying Tang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(电子与电气工程系,南方科技大学,深圳,中国) Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong SAR, China(电气与电子工程系,香港大学,香港特别行政区,中国) Department of Radiology, Zhongda Hospital, Medical School, Southeast University, Nanjing, China(放射科,中大医院,医学院,东南大学,南京,中国) Jiaxing Research Institute, Southern University of Science and Technology, Jiaxing, China(嘉兴研究所,南方科技大学,嘉兴,中国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Diff4MMLiTS通过基于扩散的图像合成与对齐技术,实现肝肿瘤的多模态分割,无需严格对齐的多模态数据,提升了分割性能。

Comments International Workshop on Machine Learning in Medical Imaging, 668-678

详情

展开后加载摘要…

URL PDF HTML 收藏