arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2601.17761 2026-01-27 cs.LG cs.AI cs.CL 84%

AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation

AR-Omni:一种统一的自回归模型用于任意到任意生成

Dongjie Cheng, Ruifeng Yuan, Yongqi Li, Runyang You, Wenjie Wang, Liqiang Nie, Lei Zhang, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :any-to-any(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AR-Omni提出一种无需专家解码器的统一自回归模型,实现多模态任意到任意生成,解决模态不平衡、视觉保真度和稳定性与创造力平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV 84%

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20406 2026-01-27 cs.RO cs.LG 78%

PointMapPolicy: Structured Point Cloud Processing for Multi-Modal Imitation Learning

PointMapPolicy: 结构化点云处理用于多模态模仿学习

Xiaogang Jia, Qian Wang, Anrui Wang, Han A. Wang, Balázs Gyenes, Emiliyan Gospodinov, Xinkai Jiang, Ge Li, Hongyi Zhou, Weiran Liao, Xi Huang, Maximilian Beck, Moritz Reuss, Rudolf Lioutikov, Gerhard Neumann

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Reality Labs, Meta(Meta现实实验室) Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 PointMapPolicy通过结构化点云处理提升多模态模仿学习的精度与泛化能力,利用xLSTM融合点云与RGB数据,在RoboCasa和CALVIN基准中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18234 2026-01-27 cs.CY cs.AI cs.CL 62%

Generative AI in Saudi Arabia: A National Survey of Adoption, Risks, and Public Perceptions

生成式人工智能在沙特阿拉伯:国家调查:采用、风险和公众认知

Abdulaziz AlDakheel, Ali Alshehre, Esraa Alamoudi, Moslim AlKhabbaz, Ahmed Aljohani, Raed Alharbi

机构 * College of Computing and Informatics, Saudi Electronic University(计算机与信息学院,沙特电子大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过全国调查分析沙特阿拉伯GenAI的采用情况、风险和公众认知,发现93%的受访者积极使用GenAI进行文本任务,但整体意识和理解不均衡,需加强AI素养和伦理培训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17673 2026-01-27 cs.CV cs.AI 62%

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 62%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-01-27 cs.CV cs.AI 62%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Chonghan Qin, Zheng Liu, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17733 2026-01-27 cs.CV cs.GR 57%

Flatten The Complex: Joint B-Rep Generation via Compositional $k$-Cell Particles

扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成

Junran Lu, Yuanqi Li, Hengji Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00884 2026-01-27 stat.CO stat.ML 50%

Generating Synthetic Data with Locally Estimated Distributions for Disclosure Control

通过局部估计分布生成合成数据以实现披露控制

Ali Furkan Kalay

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出局部重采样器方法,通过局部估计分布生成合成数据,有效降低异常值导致的披露风险,提升数据效用与隐私保护的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏