arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 46 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2407.11018 2026-02-13 cs.NI eess.SP 50%

QoE-Driven Multi-Task Offloading for Semantic-Aware Edge Computing Systems

面向语义的多任务卸载:用于语义感知边缘计算系统的QoE驱动方法

Xuyang Chen, Daquan Feng, Wei Jiang, Qu Luo, Gaojie Chen, Yao Sun

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出语义感知的多任务卸载框架,通过优化资源分配提升边缘计算系统的用户体验。

Comments 18 pages, accepted by IEEE TNSE

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2602.12083 2026-02-13 cs.AI cs.LO 57%

Differentiable Modal Logic for Multi-Agent Diagnosis, Orchestration and Communication

可微模态逻辑用于多智能体诊断、协调与通信

Antonin Sulc

机构 * Lawrence Berkeley National Lab(伯克利劳伦斯国家实验室) Berkeley(伯克利)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出可微模态逻辑,通过神经符号方法实现多智能体系统的调试与协调,结合知识注入和多模态推理,提升智能体间的信任与因果推理能力。

Comments 29 pages, 8 figures, 8 tables, Tutorial at 3rd International Conference on Neuro-Symbolic Systems (NeuS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11750 2026-02-13 cs.SE cs.AI cs.HC 57%

AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild

AmbiBench:在真实场景中超越单次指令的移动GUI代理基准测试

Jiazheng Sun, Mingxuan Li, Yingying Zhang, Jiayang Niu, Yachen Wu, Ruihan Jin, Shuyu Lei, Pengrongrui Tan, Zongyu Zhang, Ruoyi Wang, Jiachen Yang, Boyu Yang, Jiacheng Liu, Xin Peng

机构 * Fudan University(复旦大学) Jilin University(吉林大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.AI

AI总结 AmbiBench是首个针对移动GUI代理在真实场景中超越单次指令的双向意图对齐的基准测试,通过引入清晰度分类和MUSE框架评估代理在不同清晰度下的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12072 2026-02-13 stat.AP 50%

Enhanced Forest Inventories for Habitat Mapping: A Case Study in the Sierra Nevada Mountains of California

增强的森林调查用于栖息地制图:加利福尼亚州内华达山脉的案例研究

Maxime Turgeon, Michael Kieser, Dwight Wolfe, Bruce MacArthur

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出增强森林调查方法,通过整合遥感数据与地面调查,用于高分辨率野生动物栖息地制图,为森林管理和生态保护提供空间明确的工具。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2602.08126 2026-02-13 cs.CV 83%

MambaFusion: Adaptive State-Space Fusion for Multimodal 3D Object Detection

MambaFusion:多模态3D目标检测的自适应状态空间融合

Venkatraman Narayanan, Bala Sai, Rahul Ahuja, Pratik Likhar, Varun Ravi Kumar, Senthil Yogamani

机构 * Qualcomm Technologies, Inc(高通技术公司) Qualcomm India Private Limited(高通印度私人有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 MambaFusion通过结合选择性状态空间模型与窗口化变换器,实现高效且可靠的多模态3D目标检测,提升自动驾驶系统的感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04755 2026-02-13 cs.CV cs.AI cs.MM 82%

Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning

少量数据中的真实性:为高效多模态推理选择高价值数据

Shenshen Li, Xing Xu, Kaiyuan Deng, Lei Wang, Heng Tao Shen, Fumin Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Computer Science and Engineering(计算机科学与工程学院) Tongji University(同济大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出RAP方法,通过识别高价值认知样本和替换平凡实例,有效提升多模态推理效率,仅用9.3%训练数据即可实现性能超越。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11494 2026-02-13 cs.CV 70%

Arbitrary Ratio Feature Compression via Next Token Prediction

通过下一个标记预测实现任意比例特征压缩

Yufan Liu, Daoyuan Ren, Zhipeng Zhang, Wenyang Luo, Bing Li, Weiming Hu, Stephen Maybank

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) People AI, Inc.(People AI公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science and Mathematics, Birkbeck College, University of London(伦敦大学伯克贝克学院计算机科学与数学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种通过下一个标记预测实现任意比例特征压缩的框架,解决了传统方法在灵活性和通用性上的不足,通过引入混合解决方案和实体关系图约束模块,提升了压缩特征的质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 67%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09843 2026-02-13 cs.CV 57%

Kelix Technical Report

Kelix技术报告

Boyang Ding, Chenglong Chu, Dunju Zang, Han Li, Jiangxia Cao, Kun Gai, Muhao Wei, Ruiming Tang, Shiyao Wang, Siyang Mao, Xinchen Luo, Yahui Liu, Zhixin Ling, Zhuoran Yang, Ziming Li, Chengru Song, Guorui Zhou, Guowang Zhang, Hao Peng, Hao Wang, Jiaxin Deng, Jin Ouyang, Jinghao Zhang, Lejian Ren, Qianqian Wang, Qigen Hu, Tao Wang, Xingmei Wang, Yiping Yang, Zixing Zhang, Ziqi Wang

机构 * Kuaishou Technology(快手科技)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 Kelix是一种完全离散的自回归统一模型,旨在缩小离散和连续视觉表示之间的理解差距。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11672 2026-02-13 cs.CV 57%

U-Net with Hadamard Transform and DCT Latent Spaces for Next-day Wildfire Spread Prediction

具有Hadamard变换和DCT潜在空间的U-Net用于次日野火蔓延预测

Yingyi Luo, Shuaiang Rong, Adam Watts, Ahmet Enis Cetin

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) US Forest Service(美国森林服务局) Pacific Wildland Fire Science Laboratory(太平洋野火科学实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TD-FusionUNet模型,通过Hadamard和DCT变换提升野火预测精度,以更少参数实现更高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 50%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22488 2026-02-13 eess.SP cs.LG 50%

EEG-to-Gait Decoding via Phase-Aware Representation Learning

通过相意识表示学习实现EEG到步态解码

Xi Fu, Weibang Jiang, Rui Liu, Gernot R. Müller-Putz, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院,南洋理工大学,新加坡) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(计算机科学与工程系,上海交通大学,上海) Institute of Neural Engineering, Graz University of Technology, Graz, Austria(神经工程研究所,格拉茨技术大学,奥地利) Centre of AI in Medicine (C-AIM), Nanyang Technological University, Singapore(医学人工智能中心(C-AIM),南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NeuroDyGait通过相意识表示学习实现EEG到步态解码,提升跨受试者性能并满足实时BCI需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11511 2026-02-13 stat.ME math.ST stat.TH 50%

Representation Learning with Blockwise Missingness and Signal Heterogeneity

具有块状缺失和信号异质性的表示学习

Ziqi Liu, Ye Tian, Weijing Tang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出APPCA方法,通过锚定投影和PCA处理块状缺失和信号异质性,提升多源数据整合的表示学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 3 篇

2602.11615 2026-02-13 cs.LG 71%

SkillRater: Untangling Capabilities in Multimodal Data

SkillRater: 解构多模态数据中的能力

Naveen Sahi, Jeremy Dohmann, Armen Aghajanyan, Akshat Shrivastava

专题命中 其他多模态 :multimodal(title)

AI总结 SkillRater通过分解多模态数据质量为多个独立能力维度,提升模型在视觉理解、OCR和STEM推理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11472 2026-02-13 cs.CR cs.DC 50%

Future Mining: Learning for Safety and Security

未来采矿:安全与安全的学习

Md Sazedur Rahman, Mizanur Rahman Jewel, Sanjay Madria

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种统一的智能安全和安全架构,整合多模态感知、安全联邦学习、强化学习、DTN通信和能量感知传感,以提升采矿环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18494 2026-02-13 eess.SY cs.SY 50%

Real-Time Prediction of Lower Limb Joint Kinematics, Kinetics, and Ground Reaction Force using Wearable Sensors and Machine Learning

利用可穿戴传感器和机器学习实时预测下肢关节运动学、动力学和地面反作用力

Josée Mallah, Yu Zhu, Kailang Xu, Gurvinder S. Virk, Shaoping Bai, Luigi G. Occhipinti

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出利用可穿戴传感器和机器学习实时预测下肢关节运动学、动力学和地面反作用力,适用于生物反馈应用。

详情

展开后加载摘要…

URL PDF HTML 收藏