arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-09 至 2026-01-09 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2601.03193 2026-01-09 cs.CV cs.AI 84%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV 83%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04506 2026-01-09 cs.LG cs.AI cs.CE 74%

Surface-based Molecular Design with Multi-modal Flow Matching

基于表面的分子设计与多模态流匹配

Fang Wu, Zhengyuan Zhou, Shuting Jin, Xiangxiang Zeng, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University of Science and Technology(武汉科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multi-modal(title);分类 cs.AI

AI总结 SurfFlow通过多模态流匹配算法实现基于分子表面的肽共同设计,提升肽与受体的结合准确性,并在PepMerge基准中优于全原子基线。

Journal ref KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05124 2026-01-09 cs.CV 70%

Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

Re-Align:基于结构化推理的对齐方法用于上下文图像生成与编辑

Runze He, Yiji Cheng, Tiankai Hang, Zhimin Li, Yu Xu, Zijin Yin, Shiyi Zhang, Wenxun Dai, Penghui Du, Ao Ma, Chunyu Wang, Qinglin Lu, Jizhong Han, Jiao Dai

机构 * Hunyuan, Tencent(腾讯文库) IIE, CAS(中国科学院信息工程研究所) UCAS Project Page(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 Re-Align通过结构化推理引导的对齐方法,提升上下文图像生成与编辑任务的性能。

Comments 13 pages, 9 figures, project page: https://github.com/hrz2000/realign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 70%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04359 2026-01-09 cs.CV 57%

PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache

PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04915 2026-01-09 cs.HC 50%

OnomaCompass: A Texture Exploration Interface that Shuttles between Words and Images

OnomaCompass: 一种连接词语与图像的纹理探索界面

Miki Okamura, Shuhey Koyama, Li Jingjing, Yoichi Ochiai

专题命中 多模态生成 :cross-modal(abstract)

AI总结 OnomaCompass通过连接拟声词与图像的潜在空间,帮助用户更高效地发现材料,减少工作量并提升用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏