arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 24 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 24 篇

2512.15052 2026-09-01 cs.CL cs.AI 版本更新 84%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, AprilPyone MaungMaung, Isao Echizen

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-09-01 cs.AI 版本更新 83%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00232 2026-09-01 cs.AI cs.LG 版本更新 83%

Self-Correction Can Amplify Hallucinations: Fact-Level Repair with Graph-Based Evidence Routing in Multimodal Generation

TIGER: 基于图证据路由的可追踪推理用于减轻多模态生成中的幻觉

Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

机构 * Brigham Young University Florida State University

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TIGER框架,通过从输入和输出中独立提取观测图与声明图,并基于图条件风险评分修复高风险声明,以减轻多模态生成中的事实级幻觉。

Comments Accepted at EMNLP 2026 (Main Conference). 29 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-09-01 cs.CV 版本更新 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-09-01 cs.AI cs.CV 版本更新 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新 81%

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2026-09-01 cs.CV 版本更新 79%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Dimple:采用并行解码的离散扩散多模态大语言模型

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出首个离散扩散多模态大语言模型Dimple,采用自回归与扩散结合的训练范式,性能优于LLaVA-NEXT 3.9%,通过置信解码提升推理效率,还探索了结构先验的响应控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28937 2026-09-01 eess.IV 新提交 78%

Multimodal Deep Learning for Uncertainty-Aware Radiation Pneumonitis Risk Prediction

用于不确定性感知放射性肺炎风险预测的多模态深度学习

Jin Yang, Tian Liu, Jing Wang, Robert Samstein, Kenneth Rosenzweig, Julie Bloom, Ming Chao

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究提出MM-DiT框架,通过多模态预训练整合CT图像与放射剂量分布,可联合估计RP风险并量化三类不确定性,在独立队列中验证了其预测准确性与不确定性量化能力。

Comments 30 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交 77%

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新 77%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28669 2026-09-01 cs.CV cs.PL cs.SE 新提交 74%

MIRAGE-CAD: Construction-Mediated Multimodal Generation of Executable CAD Programs

MIRAGE-CAD:面向可执行CAD程序的构造介导多模态生成

Jizong Zhan

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 MIRAGE-CAD针对四类输入实现可执行CAD程序的多模态生成,在2500个保留查询上取得构建与STEP导出成功率,证实需分别评估可执行性、几何保真度等指标。

Comments 64 pages, 5 figures, 20 tables, 7 appendices. Code, evaluation scripts and run reports: https://github.com/Cad-Kernel/MIRAGE-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30342 2026-09-01 cs.CV 新提交 70%

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

CapFrame:基于几何伪标签的3D高斯场景中文本引导视角定位

Jirong Li, Satoshi Ikehata, Shuhei Kurita, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学大学) Denso IT Laboratory, Inc.(电装IT实验室) National Institute of Informatics(信息学研究所)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对3D高斯场景中虚拟相机位姿需人工设置的问题,提出CapFrame框架,通过检索-转换-优化流程实现文本引导的视角定位,实验表明其对齐度优于基线方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-09-01 physics.optics cs.LG 版本更新 67%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30727 2026-09-01 cs.CV cs.AI 新提交 62%

RailGen: Improving Railway Intrusion Detection via Agent-Guided Small-Scale Foreign Object Generation

RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测

Quan Hao, Ziyang Tao, Chenxi Zhang, Yudong Wang, Rui Shi, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30307 2026-09-01 cs.CV cs.AI 新提交 62%

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

ScenePilot:面向文本驱动的3D室内场景生成的生长-修复策略

Jiawei Zhang, Hongsong Wang, Pan Zhou

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ScenePilot是一种检索增强的生长-修复框架,通过HRAP模块检索布局先验、RMR模块进行轻量修复,实现了高效的文本驱动3D室内场景生成,提升了物理合理性等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新 62%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30712 2026-09-01 cs.CL 新提交 57%

GUIDE: Guiding Internal Evidence with Language Instructions

GUIDE:用语言指令引导内部证据

Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim, Seungyeon Ji, Kyungreem Han

机构 * The University of Melbourne(墨尔本大学) Korea Institute of Science and Technology(韩国科学技术研究院) Korea University(高丽大学) University of Science and Technology(科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究针对多模态模型依赖非指令要求的捷径线索的问题,提出GUIDE框架,结合分组参数高效适配与指令条件门控调节多模态证据通路,在多模态任务上提升鲁棒性与可控性,拓展了多模态指令跟随的范围。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 57%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: 10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29793 2026-09-01 cs.CV 新提交 57%

GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation

GridFlow:用于无缝城市级三维点云生成的结构化潜在流

Xinyu Wang, Muhammad Ibrahim, Atif Mansoor, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 该研究提出GridFlow框架,结合多模态条件生成城市级无缝三维点云,并构建City3D-MultiGen基准,实验显示其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31009 2026-09-01 cs.LG 新提交 50%

Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular Generation

用于趋势引导的基于结构的3D分子生成的语言知情流匹配

Tianyu Gao, Zhikai Su, Jiashu Li, Wenjun Gao, Zichuan Ying, Zhe Zhao, Fei Zhang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 该研究提出基于流匹配的语言知情跨模态框架LiFT,通过“感知-演化-组装”智能体和自条件解耦路由器实现趋势引导的3D分子生成,在Cross-Docked2020数据集上验证了其分布匹配、药物化学指标及结构有效性的优势。

Comments Accepted at Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29745 2026-09-01 cs.CR 新提交 50%

JITterFlip: Uncovering Fault Attack Surfaces in JIT-Compiled LLM Serving

JITterFlip:揭示JIT编译大语言模型服务中的故障攻击面

Tairui Wang, Zhi Zhang, Yansong Gao, Xin Zhang, Qingni Shen, Zhonghai Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 JITterFlip是首个针对基于GPU的LLM推理主机侧JIT服务控制平面的位翻转攻击,可生成乱码或正确输出,能绕过现有防御,通过Rowhammer攻击实现跨边界传播,在四个LLM上取得高PPL或延迟放大效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29504 2026-09-01 cs.NI 新提交 50%

RadioSight: Predictive mmWave XR Network Optimization from Dynamic Neural Radio Fields

RadioSight:基于动态神经无线电场的预测性毫米波XR网络优化

Lihao Zhang, Paul Kudyba, Zhenlin An, Haijian Sun

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对毫米波XR网络波束管理易受移动和遮挡导致中断的问题,提出RadioSight系统,结合反向波束追踪与语义同步,实现实时预测性波束优化,显著降低误差、提升吞吐量与链路稳定性。

Comments Accepted to ACM MobiCom 2026. 21 pages, 20 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29255 2026-09-01 cs.NI cs.LG 新提交 50%

A-MADiff: Attention-Guided Multi-Agent DRL with Diffusion Policies for Memory-Aware Task Orchestration in Mobile AIGC Networks

A-MADiff:面向移动AIGC网络中感知内存的任务编排的注意力引导多智能体深度强化学习与扩散策略

Chongzhi Wu, Zhengtao Li, Jiawen Kang, Jinbo Wen, Xiaohuan Li, Maomao Zhang, Ekram Hossain

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对移动AIGC网络中AIGC推理任务导致GPU内存耗尽的问题,本文提出A-MADiff算法,通过协作式多智能体框架建模Dec-POMDP,采用扩散策略与注意力引导机制,显著提升了累积奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26364 2026-09-01 cs.LG 版本更新 50%

Data-to-Energy Stochastic Dynamics

数据到能量的随机动力学

Kirill Tamogashev, Esmeralda S. Whitammer

机构 * University of Edinburgh(爱丁堡大学) CIFAR Fellow(蒙特利尔认知研究院研究员)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种数据到能量的IPF方法,用于建模Schrödinger桥问题,无需数据样本即可学习多模态分布之间的传输,并改进了扩散系数的学习。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏