arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2602.05251 2026-02-06 cs.LG 82%

TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training

TADS: 任务感知的数据选择用于多任务多模态预训练

Guanjie Cheng, Boyi Li, Lingyu Sun, Mengying Zhu, Yangyang Wu, Xinkui Zhao, Shuiguang Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 TADS通过整合内在质量、任务相关性和分布多样性,提升多任务多模态预训练的数据效率,实现更高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07209 2026-02-06 cs.CV cs.AI cs.GR 81%

SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model

SIRR-LMM:通过大多模态模型实现单图像反射去除

Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

机构 * Futurewei Technologies(未来科技公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIRR-LMM方法,通过大模型和合成数据集生成技术,提升单图像反射去除的性能。

Comments 12 pages, 14 figures, accepted in WACVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22120 2026-02-06 cs.CV 74%

See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning

看得少,看得对:双向感知塑造用于多模态推理

Shuoshuo Zhang, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Yujiu Yang, Rui Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出BiPS,通过双向感知塑造提升多模态推理性能,有效增强细粒度视觉依赖并提升跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05785 2026-02-06 cs.CV cs.AI cs.LG 73%

ReText: Text Boosts Generalization in Image-Based Person Re-identification

ReText:文本提升基于图像的人员重识别泛化能力

Timur Mamedov, Karina Kvanchiani, Anton Konushin, Vadim Konushin

机构 * Tevian, Moscow, Russia(莫斯科 Tévian) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 ReText通过结合多摄像头和单摄像头数据,利用文本描述增强语义线索,实现更强大的跨领域人员重识别泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05909 2026-02-06 cs.CV 57%

CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression

CLIP-Map: 结构化矩阵映射用于参数高效的CLIP压缩

Kangjie Zhang, Wenxuan Huang, Xin Zhou, Boxiang Zhou, Dejia Song, Yuan Xie, Baochang Zhang, Lizhuang Ma, Nemo Chen, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 CLIP-Map通过结构化矩阵映射和克罗内克因子分解实现参数高效的CLIP压缩,有效保留原始权重信息并在高压缩比下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 57%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15281 2026-02-06 cs.CV 57%

StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians

StyleMe3D: 通过多编码器在3D高斯上实现解耦先验的风格化

Cailin Zhuang, Yaoqi Hu, Xuanyang Zhang, Wei Cheng, Jiacheng Bao, Shengqi Liu, Yiying Yang, Xianfang Zeng, Gang Yu, Ming Li

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) Guangming Laboratory(光明实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 StyleMe3D通过多编码器在3D高斯上实现解耦先验的风格化,利用动态风格分数蒸馏和多模态对齐策略提升风格迁移效果。

Comments 18 pages; Project page: https://styleme3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏