arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 16 篇

2608.26581 2026-08-28 cs.LG 新提交 87%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-08-28 cs.CV 新提交 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 81%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 80%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26535 2026-08-28 cs.AI 新提交 79%

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Multi2AV-Safety:多模态到音视频生成的安全性基准测试

Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26517 2026-08-28 cs.CV 新提交 79%

HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence

HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准

Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Tongji University(同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Trento(特伦托大学) Huawei(华为)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26476 2026-08-28 cs.CV 新提交 79%

Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References

基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强

Cong Cao, Huanjing Yue, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26444 2026-08-28 math.OC 新提交 78%

Integrated Multi-Modal Transit Network Design via Dynamic Line Generation

基于动态线路生成的综合多模式交通网络设计

Ning Duan, Oktay Günlük, Samitha Samaranayake

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 该研究提出统一优化框架,通过列生成启发式方案联合设计多模式交通的线路、频率与按需出行段,在波士顿、芝加哥数据集上较基准方案显著提升乘客量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 77%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-08-28 cs.CV cs.AI 版本更新 73%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27199 2026-08-28 cs.CV cs.AR 新提交 57%

Vision-centric generative AI models: A software-hardware perspective

以视觉为中心的生成式AI模型:软硬件视角

Eleni Tselepi, Cristian Sestito, Shady Agwa, Themis Prodromakis

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26757 2026-08-28 cs.AI 新提交 57%

DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?

DEEPCHART:大型语言模型在忠实的数据科学图表生成方面存在多大差距?

Jiahui tang, Kuicai Dong, Dexun Li, Hongchao Gu, Haocheng Yu, Wei Han, Chen Zhang, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出专家标注的DEEPCHART基准,将图表生成分为提取-推理-可视化流程,发现现有LLMs生成的图表常隐藏数据幻觉,仅靠大上下文窗口无法实现忠实图表生成,需可靠的证据提取与定量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26574 2026-08-28 cs.CL 新提交 57%

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

面向高效扩散大语言模型推理的依赖感知可撤销解码

Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 57%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26111 2026-08-28 cs.AI 新提交 57%

Large Models for Battery Prognostics and Health Management: A Review and Future Roadmap

用于电池 prognostics 与健康管理的大模型:综述与未来路线图

Jiale Liu, Huan Wang, Weicheng Wang, Rong Zhu, Qiqi Wang, Min Xie

机构 * School of Physics and Astronomy, The University of Edinburgh(爱丁堡大学物理与天文学院) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本综述首次全面调研大模型在电池 prognostics 与健康管理(BPHM)中的应用,阐明其基础技术、解决的领域挑战,提出未来研究路线图,为开发下一代自主电池管理系统提供见解。

Comments Published in Renewable and Sustainable Energy Reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26544 2026-08-28 cs.LG 新提交 50%

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏