Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
Tele-Omni: 一种用于视频生成与编辑的统一多模态框架
机构 * TeleAI
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Tele-Omni: 一种用于视频生成与编辑的统一多模态框架
机构 * TeleAI
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。
概念增强的多模态RAG:迈向可解释且准确的放射科报告生成
机构 * Department of Engineering(工程系) ; Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) ; Università Campus Bio-Medico of Roma(罗马大学生物医学校园) ; Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) ; Sapienza University of Rome(罗马萨皮恩扎大学) ; Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) ; Umeå University(乌梅拉大学) ; UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。
图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习
机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。
Comments Accepted by ICLR 2026
训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出SynSelect框架,通过三阶段合成与选择生成高质量多模态推理数据,提升模型推理能力。
基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体
机构 * Jinan University, Guangzhou, China ; Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China ; Western University, Ontario, Canada ; Guangdong University of Technology, Guangzhou, China ; Tsinghua University, Beijing, China
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。
PaperX: 一种多模态学术演示生成的统一框架与学者DAG
机构 * CASIA(中国科学院自动化研究所) ; UCAS(乌尔姆大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。
Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX
通过大语言模型多模态奖励分解对齐对话代理
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。
Comments 9 pages, 3 figures, 3 tables
多模态先验增强的文本驱动3D人-物交互生成
机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Beihang University(北京航空航天大学) ; Department of Computer Science, University of Durham(杜伦大学计算机科学系) ; Zhongguancun Laboratory(中关村实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出MP-HOI框架,通过多模态先验、增强物体表示、模态感知MoE模型和级联扩散技术,提升文本驱动的3D人-物交互生成效果。
SchröMind: 通过求解薛定谔桥问题减轻多模态大语言模型中的幻觉
机构 * Fujitsu Research \& Development Center Co.,LTD., Beijing, China Fujitsu Limited, Tokyo, Japan
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 SchröMind通过求解薛定谔桥问题,有效减轻多模态大语言模型中的幻觉问题,提升模型在医疗等高风险领域的应用能力。
Comments ICASSP 2026
基于去噪扩散模型的多模态图像重建与合成统一框架
机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) ; Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) ; Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) ; Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) ; Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) ; Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) ; Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。
同时触觉-视觉感知用于学习多模态机器人操作
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) ; Beijing Key Lab of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室) ; Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) ; State Key Lab for General Artificial Intelligence(一般人工智能国家重点实验室) ; Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学武汉人工智能研究院) ; Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 TacThru-UMI通过结合同时触觉-视觉感知与现代学习框架,实现了高精度多模态机器人操作。
UniLiP: 适配CLIP以实现统一的多模态理解、生成与编辑
机构 * Center for Data Science, Peking University(北京大学数据科学中心) ; Alibaba Group(阿里巴巴集团) ; CASIA ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 UniLIP通过两阶段训练和双条件架构,提升CLIP在多模态理解、生成和编辑任务中的性能,实现高效参数下的高表现。
PairUni: 用于统一多模态语言模型的成对训练
机构 * ByteDance(字节跳动)
专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.CL
AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。
Comments 22 pages, 11 figures, and 10 tables
通过跨模态注意力安装实现对齐的新视角图像和几何合成
机构 * NAVER AI Lab(NAVER AI实验室) ; KAIST AI(韩国科学技术院人工智能学院) ; SNU AIIS(首尔国立大学人工智能研究所)
专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散的框架,通过跨模态注意力蒸馏实现新视角图像和几何的对齐生成,提升几何鲁棒性和重建质量。
Comments Project page at https://cvlab-kaist.github.io/MoAI
M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。
LazyDrag: 通过显式对应关系在多模态扩散变换器上实现稳定的拖拽编辑
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; StepFun ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 LazyDrag通过显式对应关系实现多模态扩散变换器的稳定拖拽编辑,消除了隐式点匹配依赖,提升生成能力与精确控制。
Comments https://zxyin.github.io/LazyDrag
Diff4MMLiTS: 通过基于扩散的图像合成与对齐的先进多模态肝肿瘤分割
机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(电子与电气工程系,南方科技大学,深圳,中国) ; Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong SAR, China(电气与电子工程系,香港大学,香港特别行政区,中国) ; Department of Radiology, Zhongda Hospital, Medical School, Southeast University, Nanjing, China(放射科,中大医院,医学院,东南大学,南京,中国) ; Jiaxing Research Institute, Southern University of Science and Technology, Jiaxing, China(嘉兴研究所,南方科技大学,嘉兴,中国)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Diff4MMLiTS通过基于扩散的图像合成与对齐技术,实现肝肿瘤的多模态分割,无需严格对齐的多模态数据,提升了分割性能。
Comments International Workshop on Machine Learning in Medical Imaging, 668-678
Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能
Comments Accepted by AAAI26
多模态科学学习超越扩散与流
机构 * Graduate Group in Applied Mathematics and Computational Science(应用数学与计算科学联合研究生组) ; Department of Computer and Information Science(计算机与信息科学系) ; Department of Mechanical Engineering and Applied Mechanics(机械工程与应用力学系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出混合密度网络作为多模态科学学习中更高效、更稳定的替代方法,实现对科学问题中多模态不确定性的有效建模与解决。
RMFlow:通过噪声注入步骤细化均流以实现多模态生成
机构 * Department of Mathematics and Scientific Computing and Imaging (SCI) Institute University of Utah(数学与科学计算及成像学院(SCI)院,犹他大学) ; Department of Mathematics, UCLA(数学系,加州大学洛杉矶分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 RMFlow通过引入噪声注入步骤,改进均流模型,实现高效多模态生成,仅需单次功能评估即可达到接近最先进的性能。
Comments Accepted to ICLR 2026
WordCraft: 通过多模态大语言模型 scaffolding 关键词方法用于L2词汇学习
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; School of Creativity and Art, ShanghaiTech University(创意与艺术学院,上海科技大学) ; Shanghai Fengxian Dai Wen Middle School(上海奉贤戴文中学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
AI总结 WordCraft通过多模态大语言模型辅助L2词汇学习,提升关键词方法的使用效果和学习者参与度。
Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI' 26), April 13--17, 2026, Barcelona, Spain
高效无人机轨迹预测:一种多模态深度扩散框架
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。
Comments in Chinese language
MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距
机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。
多模态缺失数据填补用于阿尔茨海默病分类
机构 * Information Sciences Institute(信息科学研究所) ; University of Southern California(美国南加州大学) ; University of California(加州大学) ; Stevens Neuroimaging and Informatics Institute(史蒂文斯神经影像与信息学研究所)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI
AI总结 本文提出利用条件去噪扩散概率模型填补缺失的DWI扫描,以提高多模态深度学习模型在阿尔茨海默病三类分类中的准确性。
GenAgent:通过代理多模态推理扩展文本到图像生成
机构 * Fudan University(复旦大学) ; Tongyi Lab(通义实验室) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。
HARMONI: 基于大语言模型的多用户人机交互多模态个性化
机构 * Institut Curie, Université Paris-Saclay(巴黎-萨克勒大学Curie研究所) ; Institute of Intelligent Systems and Robotics (ISIR), Sorbonne University(索邦大学智能系统与机器人研究所) ; Assistance Publique – Hôpitaux de Paris (AP-HP), Université Paris Cité(巴黎公共医院(AP-HP)与巴黎城市大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 HARMONI通过多模态个性化框架,利用大语言模型提升多用户人机交互的持续个性化和动态适应能力。
视觉生成通过多模态世界模型解锁类人推理
机构 * Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。
Comments Project page: https://thuml.github.io/Reasoning-Visual-World
Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型
机构 * Skywork Multimodality Team(Skywork多模态团队)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。
CRAFT:连续推理与代理反馈调优用于多模态文本到图像生成
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 CRAFT通过显式推理和反馈调优提升多模态生成模型的可靠性,实现可控且高效的文本到图像生成。
Comments 37 pages, 42 figures
基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习
机构 * Marvin Ridge High School(马文岭高中)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。
Comments 19 pages, 10 figures