arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-30 至 2026-01-30 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2507.13993 2026-01-30 eess.IV cs.AI cs.CV 81%

OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models

OrthoInsight:基于多模态大模型的肋骨骨折诊断与报告生成

Ningyong Wu, Jiangbo Zhang, Wenhong Zhao, Jinzhi Wang, Chenzhan Yu, Zhigang Xiu, Duwei Dai, Ziyu Xu, Yongli Yang

机构 * Organizational Management Department, School of Management, Xi’an Jiaotong University(管理学院组织管理部,西安交通大学) West China Longquan Hospital, Sichuan University(四川大学西部临床医学院) School of Electronic Science and Engineering, Xi’an Jiaotong University(西安交通大学电子科学与工程学院) Systems Engineering Institute, Xi’an Jiaotong University(西安交通大学系统工程研究院) Institute of Medical Artificial Intelligence, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第二附属医院医学人工智能研究所) School of Human Settlements and Civil Engineering, Xi’an Jiaotong University(西安交通大学人居环境与土木工程学院) School of Life Science and Technology, Xi’an Jiaotong University(西安交通大学生命科学与技术学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 OrthoInsight通过多模态大模型实现肋骨骨折的自动诊断与报告生成,结合CT图像分析与医学知识图谱,提升诊断效率和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV 79%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21076 2026-01-30 cs.AI 79%

Multi-modal Imputation for Alzheimer's Disease Classification

多模态缺失数据填补用于阿尔茨海默病分类

Abhijith Shaji, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Greg Ver Steeg, Paul M. Thompson, Jose-Luis Ambite

机构 * Information Sciences Institute(信息科学研究所) University of Southern California(美国南加州大学) University of California(加州大学) Stevens Neuroimaging and Informatics Institute(史蒂文斯神经影像与信息学研究所)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出利用条件去噪扩散概率模型填补缺失的DWI扫描,以提高多模态深度学习模型在阿尔茨海默病三类分类中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21950 2026-01-30 cs.LG 78%

Embracing Aleatoric Uncertainty in Medical Multimodal Learning with Missing Modalities

在医疗多模态学习中拥抱概率不确定性与缺失模态

Linxiao Gong, Yang Liu, Lianlong Sun, Yulai Bi, Jing Liu, Xiaoguang Zhu

机构 * HKUST (GZ)(香港科技大学) Tongji University(同济大学) University of Rochester(罗切斯特大学) Meta Fudan University(复旦大学) The University of British Columbia(不列颠哥伦比亚大学) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出AUM框架,通过建模单模态概率不确定性来应对医疗多模态学习中的缺失模态问题,在死亡预测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21129 2026-01-30 cs.RO 78%

WheelArm-Sim: A Manipulation and Navigation Combined Multimodal Synthetic Data Generation Simulator for Unified Control in Assistive Robotics

WheelArm-Sim: 一种结合 manipulation 和 navigation 的多模态合成数据生成模拟器,用于辅助机器人中的统一控制

Guangping Liu, Tipu Sultan, Vittorio Di Giorgio, Nick Hawkins, Flavio Esposito, Madi Babaiasl

机构 * Aerospace and Mechanical Engineering Department, Saint Louis University(圣路易斯大学航空航天与机械工程系) Computer Science Department, Saint Louis University(圣路易斯大学计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 WheelArm-Sim 是一种用于辅助机器人统一控制的多模态合成数据生成模拟器,通过集成轮椅和机械臂控制,为数据驱动的机器学习模型提供支持。

Comments Accepted to IEEE International Symposium on Medical Robotics (ISMR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 62%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 62%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02507 2026-01-30 cs.CV cs.RO 57%

Keeping it Local, Tiny and Real: Automated Report Generation on Edge Computing Devices for Mechatronic-Based Cognitive Systems

保持本地化、小巧和现实:面向机电认知系统的边缘计算设备自动化报告生成

Nicolas Schuler, Lea Dewald, Jürgen Graf

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于边缘计算设备的自动化报告生成方法,利用本地模型实现多模态传感器数据处理,以提升机电认知系统在不同环境中的评估效率与隐私保护。

Comments 6 pages, 4 figures, 1 table; accepted for MECATRONICS-REM 2025 International Conference, PARIS, FRANCE December 3-5 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21669 2026-01-30 cs.LG cs.AI 57%

Expected Return Causes Outcome-Level Mode Collapse in Reinforcement Learning and How to Fix It with Inverse Probability Scaling

预期回报导致强化学习中的结果层面模式崩溃及如何通过逆概率缩放修复它

Abhijeet Sinha, Sundari Elango, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出逆概率缩放方法,通过修正预期回报目标来解决强化学习中的结果层面模式崩溃问题,有效提升多模式策略优化的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 57%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 57%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04589 2026-01-30 cs.CV 57%

MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing

MiLDEdit: 基于推理的多层设计文档编辑

Zihao Lin, Wanrong Zhu, Jiuxiang Gu, Jihyung Kil, Christopher Tensmeyer, Lin Zhang, Shilong Liu, Ruiyi Zhang, Lifu Huang, Vlad I. Morariu, Tong Sun

机构 * University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司) UW-Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 57%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21524 2026-01-30 eess.SP 50%

Channel Extrapolation for MIMO Systems with the Assistance of Multi-path Information Induced from Channel State Information

利用通道状态信息诱导的多路径信息进行MIMO系统的通道外推

Yuan Gao, Xinyi Wu, Jiang Jun, Zitian Zhang, Zhaohui Yang, Shugong Xu, Cheng-Xiang Wang, Zhu Han

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于多路径信息的通道外推框架,利用CSI诱导的PDP特征提升6G网络中CSI获取的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17138 2026-01-30 q-bio.BM 50%

AI Developments for T and B Cell Receptor Modeling and Therapeutic Design

人工智能在T细胞和B细胞受体建模及治疗设计中的发展

Linhui Xie, Aurelien Pelissier, Yanjun Shao, Maria Rodriguez Martinez

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究利用人工智能技术,通过预测和生成框架改进T和B细胞受体建模,提升治疗设计的效率和临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏