arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2602.08126 2026-02-13 cs.CV 83%

MambaFusion: Adaptive State-Space Fusion for Multimodal 3D Object Detection

MambaFusion:多模态3D目标检测的自适应状态空间融合

Venkatraman Narayanan, Bala Sai, Rahul Ahuja, Pratik Likhar, Varun Ravi Kumar, Senthil Yogamani

机构 * Qualcomm Technologies, Inc(高通技术公司) Qualcomm India Private Limited(高通印度私人有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 MambaFusion通过结合选择性状态空间模型与窗口化变换器,实现高效且可靠的多模态3D目标检测,提升自动驾驶系统的感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04755 2026-02-13 cs.CV cs.AI cs.MM 82%

Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning

少量数据中的真实性:为高效多模态推理选择高价值数据

Shenshen Li, Xing Xu, Kaiyuan Deng, Lei Wang, Heng Tao Shen, Fumin Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Computer Science and Engineering(计算机科学与工程学院) Tongji University(同济大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出RAP方法,通过识别高价值认知样本和替换平凡实例,有效提升多模态推理效率,仅用9.3%训练数据即可实现性能超越。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11494 2026-02-13 cs.CV 70%

Arbitrary Ratio Feature Compression via Next Token Prediction

通过下一个标记预测实现任意比例特征压缩

Yufan Liu, Daoyuan Ren, Zhipeng Zhang, Wenyang Luo, Bing Li, Weiming Hu, Stephen Maybank

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) People AI, Inc.(People AI公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science and Mathematics, Birkbeck College, University of London(伦敦大学伯克贝克学院计算机科学与数学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种通过下一个标记预测实现任意比例特征压缩的框架,解决了传统方法在灵活性和通用性上的不足,通过引入混合解决方案和实体关系图约束模块,提升了压缩特征的质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 67%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09843 2026-02-13 cs.CV 57%

Kelix Technical Report

Kelix技术报告

Boyang Ding, Chenglong Chu, Dunju Zang, Han Li, Jiangxia Cao, Kun Gai, Muhao Wei, Ruiming Tang, Shiyao Wang, Siyang Mao, Xinchen Luo, Yahui Liu, Zhixin Ling, Zhuoran Yang, Ziming Li, Chengru Song, Guorui Zhou, Guowang Zhang, Hao Peng, Hao Wang, Jiaxin Deng, Jin Ouyang, Jinghao Zhang, Lejian Ren, Qianqian Wang, Qigen Hu, Tao Wang, Xingmei Wang, Yiping Yang, Zixing Zhang, Ziqi Wang

机构 * Kuaishou Technology(快手科技)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 Kelix是一种完全离散的自回归统一模型,旨在缩小离散和连续视觉表示之间的理解差距。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11672 2026-02-13 cs.CV 57%

U-Net with Hadamard Transform and DCT Latent Spaces for Next-day Wildfire Spread Prediction

具有Hadamard变换和DCT潜在空间的U-Net用于次日野火蔓延预测

Yingyi Luo, Shuaiang Rong, Adam Watts, Ahmet Enis Cetin

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) US Forest Service(美国森林服务局) Pacific Wildland Fire Science Laboratory(太平洋野火科学实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TD-FusionUNet模型,通过Hadamard和DCT变换提升野火预测精度,以更少参数实现更高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 50%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22488 2026-02-13 eess.SP cs.LG 50%

EEG-to-Gait Decoding via Phase-Aware Representation Learning

通过相意识表示学习实现EEG到步态解码

Xi Fu, Weibang Jiang, Rui Liu, Gernot R. Müller-Putz, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院,南洋理工大学,新加坡) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(计算机科学与工程系,上海交通大学,上海) Institute of Neural Engineering, Graz University of Technology, Graz, Austria(神经工程研究所,格拉茨技术大学,奥地利) Centre of AI in Medicine (C-AIM), Nanyang Technological University, Singapore(医学人工智能中心(C-AIM),南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NeuroDyGait通过相意识表示学习实现EEG到步态解码,提升跨受试者性能并满足实时BCI需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11511 2026-02-13 stat.ME math.ST stat.TH 50%

Representation Learning with Blockwise Missingness and Signal Heterogeneity

具有块状缺失和信号异质性的表示学习

Ziqi Liu, Ye Tian, Weijing Tang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出APPCA方法,通过锚定投影和PCA处理块状缺失和信号异质性,提升多源数据整合的表示学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏