arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 217 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 217 篇

2510.08377 2026-07-07 cs.CV 版本更新 70%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16239 2026-07-07 cs.CV 版本更新 70%

EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation

EM3M:用于微观结构分割与生成的电子显微镜图像数据集

Nan Wang, Zhiyi Xia, Yiming Li, Siyuan Zhang, Shi Tang, Zuxin Fan, Xi Fang, Haoyi Tao, Guolin Ke, Yanhui Hong

机构 * DP Technology(DP技术)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。

Comments 31 pages, 13 figures, Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05624 2026-07-03 cs.AI 版本更新 70%

ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

ADMC: 基于注意力扩散模型的缺失模态特征补全

Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, Liangze Yin

机构 * National University of Defense Technology(国防科学技术大学) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 70%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04498 2026-06-09 cs.LG cs.CV 版本更新 70%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 70%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12304 2026-07-24 cs.SD cs.AI cs.MM eess.AS 版本更新 67%

OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu

机构 * The University of Hong Kong(香港大学) Shanda AI Research Tokyo(Shanda AI东京研究所) XIntelligence Technology Co., Limited(XIntelligence技术有限公司)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。

Comments code: https://github.com/OmniCustom-project/OmniCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19064 2026-07-23 cs.CV cs.AI cs.LG cs.MM eess.IV 版本更新 67%

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

机构 * Microsoft Mage Team(微软Mage团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28198 2026-07-15 cs.LG 版本更新 67%

Hierarchical Synthetic Tabular Data Generation: A Hybrid Top-Down and Bottom-Up Framework

层次化合成表格数据生成:一种自上而下与自下而上混合框架

Junfeng Nie, Alvin Jin, Xiaohui Chen

机构 * University of Southern California(南加州大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 提出一种层次化混合自上而下和自下而上(H-TDBU)框架,通过解耦语义结构与随机纹理,结合结构驱动的逻辑约束和轻量级表格生成器,在弱多模态金融基准上提升合成数据的语义一致性和统计保真度。

Comments Accepted as a poster at FMSD @ ICML 2026. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10791 2026-06-19 eess.IV 版本更新 67%

Semantic Satellite Communications for Synchronized Audiovisual Reconstruction

面向同步视听重建的语义卫星通信

Fangyu Liu, Peiwen Jiang, Wenjin Wang, Xiao Li, Shi Jin

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 提出自适应多模态语义传输系统,通过双流生成架构和动态关键帧更新机制,在带宽受限的卫星场景下实现高质量同步视听重建,显著降低带宽消耗并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25531 2026-06-09 eess.SP 版本更新 67%

From Denoising to Decision Making: A Survey on Diffusion Model-Enabled Deep Reinforcement Learning for Wireless Networks

从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述

Nguyen Cong Luong, Zeping Sui, Jie Cao, Min Xu, Nguyen Duc Hai, Zhihao Dong, Nguyen Duc Duy Anh, Qiushi Zhao, Nguyen Quoc Khanh, Zhe Fu, Shaohan Feng, Bo Ma

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)

AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。

Comments 22 pages, 7 figures, Author list corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15408 2026-06-09 cs.CV cs.AI cs.CL cs.LG 版本更新 67%

CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation

CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成

Pablo Messina, Andrés Villa, Juan León Alcázar, Karen Sánchez, Carlos Hinojosa, Denis Parra, Álvaro Soto, Bernard Ghanem

机构 * Pontificia Universidad Católica de Chile(智利天主教大学) CENIA iHEALTH KAUST(科威特皇家科学与技术局)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。

Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-19 cs.CV cs.AI 版本更新 62%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-08-18 cs.CV cs.AI 版本更新 62%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10723 2026-08-18 cs.CV cs.AI cs.LG cs.MA 版本更新 62%

AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation

AllocMV:通过结构化持久状态实现音乐视频生成的最优资源分配

Huimin Wang, Chang Xia, Leilei Ouyang, Yongqi Kang, Yu Fu, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AllocMV提出了一种分层框架,将音乐视频合成建模为多重选择背包问题,通过动态规划优化资源分配,确保跨镜头一致性并降低生成成本。

Comments ECCV 2026 AI4VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 62%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 62%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 62%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25857 2026-08-06 cs.CL cs.CV 版本更新 62%

Shieldstral

护盾斯特拉尔

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan, Abdelaziz Bounhar, Abhijeet Somani, Aditi Kabra, Adrian Valente, Adrien Petralia, Adrien Sadé, Alan Jeffares, Albert Jiang, Aleksandr Timashov, Alexandre Cahill, Alexandre Gavaudan, Alexandre Laval, Alexandre Sablayrolles, Amélie Héliou, Amos You, André Jonasson, Andrew Bai, Andrew Ehrenberg, Andrew Zhao, Angele Lenglemetz, Anmol Agarwal, Arata Suzuki, Arjun Majumdar, Arthur Fournier, Artjom Joosen, Aylin Guliz Akkus, Aysenur Karaduman, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Benjamin Holzschuh, Benjamin Lefaudeux, Benjamin Tibi, Bernhard Stadlbauer, Błażej Osiński, Camille Le Scao, Chaoran Yu, Charlotte Cronjäger, Chen-Yo Sun, Chris Bamford, Christian Wallenwein, Christophe Renaudin, Clémence Lanfranchi, Corentin Barreau, Corentin Sautier, Cristiana-Diana Diaconu, Cyprien Courtot, Daniel Marczak, Darius Dabert, Diego de Las Casas, Dominik Nuss, Dylan Rubini, Dzmitry Soupel, Elizaveta Demyanenko, Elliot Chane-Sane, Emilien Fugier, Emmanuel Gottlob, Erik Aas, Etienne Goffinet, Étienne Millon, Eujeong Choi, Fabian Paischer, Fabian Schlager, Faruk Ahmed, Federico Baldassarre, Filip Szatkowski, Florian Wiesner, Gabrielle Berrada, Gaëtan Ecrepont, Gaétan Lepage, Gaspard Blanchet, Gaspard Donada-Vidal, Gauthier Delerce, Gauthier Guinet, Genevieve Hayes, Georgii Novikov, Gianluca Galletti, Guillaume Breton, Guillaume Kunsch, Guillaume Martin, Guillaume Raille, Gunjan Dhanuka, Gunshi Gupta, Han Zhou, Harshil Shah, Hasan Furkan Vural, Hédi Hadiji, Hope McGovern, Hugo Cisneros, Hugo Thimonier, Indraneel Mukherjee, Ivan Cuevas Salazar, Jacques Sun, Jan Ludziejewski, Jason Rute, Jean Quentin, Jean-Hadrien Chabran, Jean-Malo Delignon, Jie Zhang, Joachim Studnia, Joep Barmentlo, Johannes Brandstetter, John Harvill, Jonas Amar, Jonas Schweizer, Joséphine Delas, Josselin Somerville, Julien Denize, Julien Tauran, Kartik Khandelwal, Khyathi Raghavi Chandu, Kilian Tep, Kush Jain, Larissa Laich, Laura Calem, Laurence Aitchison, Laurent Callot, Laurent Fainsin, Léo Cotteleer, Léonard Blier, Lingxiao Zhao, Louis Martin, Louis Serrano, Lucile Saulnier, Ludovic Ho Fuh, Luis Montero, Manon Chossegros, Marcin Możejko, Margaret Jennings, Markus Hennerbichler, Martin Alexandre, Mathieu Poirée, Mathieu Schmitt, Mathilde Guillaumin, Matthieu André, Matthieu Dinot, Matthieu Futeral, Maurits Bleeker, Mauro Comi, Max Mynter, Maxim Berman, Maxime Darrin, Maxime Louis, Melina Jingting Laimon, Mert Unsal, Mia Chiquier, Michael Pilcer, Michał Pietruszka, Michał Zając, Mikhail Biriuchinskii, Minh-Quang Pham, Minwoo Kang, Morgane Rivière, Namit Katariya, Nathan Grinsztajn, Nathan Simpson, Neeraj Aggarwal, Neha Gupta, Ola Mysiak, Oliver Leicht, Olivier Bousquet, Olivier Duchenne, Parag Jain, Patricia Wang, Patrick Blies, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavan Kumar Reddy, Pavel Kuksa, Philippe Pinel, Philomène Chagniot, Pierre-André Savalle, Piotr Milos, Prateek Gupta, Pravesh Agrawal, Quentin Desreumaux, Quentin Torroba, Quercus Hernandez, Ram Ramrakhya, Randall Isenhour, Ranjit Parva, Raul Perez Pelaez, Reinhard Sonnleitner, Rémi Delacourt, Richard Kurle, Rishi Shah, Rob Romijnders, Rohin Arora, Romain Sauvestre, Roman Soletskyi, Rosalie Millner, Rupert Menneer, Sagar Vaze, Samuel Barry, Samuel Belkadi, Samuel Humeau, Sanchit Gandhi, Sandeep Subramanian, Sarthak Mittal, Saskia Adaime, Sean Cha, Sebastian Kaltenbach, Shashwat Dalal, Shashwat Verma, Sherif Waly, Shrimai Prabhumoye, Siddhant Waghjale, Siddharth Gandhi, Simon Lepage, Simon Sorg, Soham Ghosh, Sophie Marbach, Srijan Mishra, Stanislas Lange, Steve Hong, Sumukh Aithal, Szymon Antoniak, Tarun Kumar Vangani, Teven Le Scao, Théo Cachet, Thibaut Lavril, Thomas Chabal, Thomas Coste, Thomas Defard, Thomas Foubert, Thomas Robert, Thomas Wang, Tianyu Zhang, Tim Lawson, Timothée Lacroix, Tobias Kronlachner, Tom Edwards, Tomas Hodan, Tuhin Das, Tyler Wang, Ulrick BLE, Umar Jamil, Umberto Tomasini, Valentin Macé, Van Phung, Vedant Nanda, Victor Jouault, Victor Letzelter, Victor Paltz, Victor Poucheret, Vincent Maladière, Vincent Pfister, Virgile Richard, Vladislav Bataev, Wen Ding Li, William Havard, William Marshall, Xinghui Li, Xingran Guo, Xinyu Yang, Yann Dreze, Yassine El Ouahidi, Yassir Bendou, Yihan Wang, Yves Martin des Taillades, Zaccharie Ramzi, Zhenlin Xu, Zsofia Csakany

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) DeepSeek-AI(深势科技人工智能)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究提出护盾斯特拉尔这一多模态安全分类器,将内容审核设为二元问答任务,通过特定数据构建方法及评估集,让小的自适应模型在文本安全基准测试中表现出色,在多模态安全分类上达新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 62%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05382 2026-07-28 cs.CV cs.AI 版本更新 62%

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

超越可教内容的搜索:拓展智能体视觉生成的知识边界

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Qwen Applications(通义千问应用) Imperial College London(帝国理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉生成器的世界知识瓶颈,构建专用数据集与基准,提出教-搜协同训练框架定位动态知识边界,实现知识驱动的可迭代视觉生成性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 62%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 62%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 62%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13505 2026-06-24 cs.CL cs.AI cs.LG 版本更新 62%

Ensemble Learning for Large Language Models in Text and Code Generation: A Survey

面向文本与代码生成的大语言模型集成学习综述

Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang

机构 * School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院) Turing Intelligence Technology Limited(图灵智能科技有限公司) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了七种大语言模型集成方法(权重合并、知识融合、混合专家、奖励集成、输出集成、路由和级联),分析了它们在文本与代码生成中提升多样性、输出质量和应用灵活性的能力。

Comments Accepted by IEEE TAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04486 2026-06-16 cs.CV cs.AI cs.LG 版本更新 62%

Efficient Flow Matching using Latent Variables

使用潜在变量的高效流匹配

Anirban Samaddar, Yixuan Sun, Viktor Nilsson, Sandeep Madireddy

机构 * Argonne National Laboratory(阿贡国家实验室) KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Latent-CFM方法,利用预训练深度潜在变量模型提取数据特征作为条件,提升流匹配模型的训练效率和生成质量,在图像和物理场生成任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02465 2026-06-11 cs.AI cs.CV cs.LG 版本更新 62%

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

MentisOculi: 揭示心智图像推理的局限性

Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。

Comments 9 pages, 8 figures, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03933 2026-06-11 cs.CV cs.AI 版本更新 62%

Diffusion-based Cumulative Adversarial Purification for Vision Language Models

基于扩散的累积对抗净化方法用于视觉语言模型

Jia Fu, Yongtao Wu, Yihang Chen, Kunyu Peng, Xiao Zhang, Volkan Cevher, Sepideh Pashami, Anders Holst

机构 * KTH Royal Institute of Technology(皇家理工学院) Swiss Federal Institute of Technology Lausanne(洛桑联邦理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) RISE Research Institutes of Sweden(瑞典RISE研究机构) Halmstad University(哈马碧大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出DiffCAP,一种基于扩散的对抗净化策略,通过理论证明对抗效应随扩散单调衰减,并利用噪声注入与VLM嵌入相似度阈值自适应净化,显著提升防御效果并加速去噪。

Comments Accepted to Transactions on Machine Learning Research (TMLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏