arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2606.18974 2026-08-26 cs.CV 版本更新 86%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(title);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24688 2026-08-26 cs.LG 新提交 86%

A Multimodal Foundation Model for Longitudinal Patient Representation and Scalable Insight Generation in Oncology

面向肿瘤学纵向患者表示与可扩展洞察生成的多模态基础模型

Eugene Vorontsov, Yi Kan Wang, Alican Bozkurt, Adam Casson, Ludmila Tydlitatova, Michal Zelechowski, Ezra E. W. Cohen, Jyoti D. Patel, Max Banaszak, Caitlin McWilliams, Shane Colley, Kate Sasser, Ryan Fukushima, Eric Lefkofsky, Razik Yousfi, Siqi Liu

机构 * Tempus AI, Inc.(Tempus AI公司)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本研究推出多模态基础模型oFM,基于167万肿瘤患者数据整合多模态信息,在预后基准及治疗队列中表现优于基线特征,还开发了机制发现框架以解释模型,助力肿瘤学临床与药物开发应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22174 2026-08-26 cs.CV 版本更新 79%

When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?

统一多模态模型中视觉生成何时能助力视觉理解?

Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出VGAU-Diag评估框架,发现统一多模态模型的视觉生成仅在简单任务上助益理解,瓶颈多在理解侧,有效生成需瞄准理解瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23943 2026-08-26 cs.CV cs.AI cs.GR 新提交 62%

Luce: Relightable Gaussians for 3D Asset Generation

Luce:用于3D资产生成的可重光照高斯模型

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

机构 * Apple(苹果公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。

Comments 27 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新 62%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新 62%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-08-26 cs.CV cs.AI 版本更新 62%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Zheng Liu, Chonghan Qin, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24121 2026-08-26 cs.CV 新提交 57%

Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models

面向结合大语言模型的放射学报告生成的图监督分层临床对齐

Yingshu Li, Yunyi Liu, Zhanyu Wang, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) ByteDance(字节跳动) University of Wollongong(伍伦贡大学) University of Adelaide(阿德莱德大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交 57%

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏