arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2602.06418 2026-02-09 cs.LG q-bio.BM 50%

Adaptive Protein Tokenization

自适应蛋白质标记化

Rohit Dilip, Ayush Varshney, David Van Valen

机构 * California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Howard Hughes Medical Institute(霍华德·休斯医学研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出了一种自适应蛋白质标记化方法,通过全局标记生成提升生成和表示任务性能,支持零样本蛋白质缩小和亲和力成熟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01789 2026-02-06 cs.RO 50%

RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation

RFS: 通过残差流引导的强化学习用于灵巧操作

Entong Su, Tyler Westenbroek, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08420 2026-02-05 cs.RO 50%

LiDAR, GNSS and IMU Sensor Fine Alignment through Dynamic Time Warping to Construct 3D City Maps

通过动态时间规整实现LiDAR、GNSS和IMU传感器精细对齐以构建3D城市地图

Haitian Wang, Hezam Albaqami, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * University of Western Australia(西澳大学) University of Jeddah(朱尔法大学) Umm Al-Qura University(乌姆·阿勒·盖拉大学) King Khalid University(国王·卡利德大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过动态时间规整实现LiDAR、GNSS和IMU传感器精细对齐,以提高3D城市地图构建的精度和一致性。

Comments This paper has been submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 50%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03319 2026-02-04 cs.LG cond-mat.mtrl-sci cs.IT math.IT 50%

Information-Theoretic Multi-Model Fusion for Target-Oriented Adaptive Sampling in Materials Design

信息论多模型融合用于材料设计中的目标导向自适应采样

Yixuan Zhang, Zhiyuan Li, Weijia He, Mian Dai, Chen Shen, Teng Long, Hongbin Zhang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出了一种基于信息论的多模型融合框架,用于材料设计中的目标导向自适应采样,通过低熵信息状态和多模型融合提高样本效率和可靠性。

Comments 37 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00514 2026-02-04 cs.RO 50%

A Low-Cost Vision-Based Tactile Gripper with Pretraining Learning for Contact-Rich Manipulation

一种低成本的基于视觉的触觉夹具,用于接触丰富的操作

Yaohua Liu, Binkai Ou, Zicheng Qiu, Ce Hao, Hengjun Zhang

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) School of Computing, National University of Singapore(计算机学院,新加坡国立大学) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16936 2026-02-04 cs.LG 50%

SPAR: Self-supervised Placement-Aware Representation Learning for Distributed Sensing

SPAR:用于分布式传感的自监督位置感知表示学习

Yizhuo Chen, Tianchen Wang, You Lyu, Yanlan Hu, Jinyang Li, Tomoyoshi Kimura, Hongjue Zhao, Yigong Hu, Denizhan Kara, Tarek Abdelzaher

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SPAR通过信号与位置的二元性原则,提出了一种自监督位置感知表示学习框架,提升分布式传感在多种模态和任务中的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01916 2026-02-03 cs.RO 50%

ForSim: Stepwise Forward Simulation for Traffic Policy Fine-Tuning

ForSim:基于逐步前向模拟的交通策略微调

Keyu Chen, Wenchao Sun, Hao Cheng, Zheng Fu, Sifa Zheng

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 ForSim通过逐步闭环前向模拟范式提升交通模拟的保真度,结合组相对优化微调交通策略,提高安全性与效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00974 2026-02-03 cs.LG 50%

Forest-Guided Semantic Transport for Label-Supervised Manifold Alignment

森林引导的语义传输用于标签监督的流形对齐

Adrien Aumon, Myriam Lizotte, Guy Wolf, Kevin R. Moon, Jake S. Rhodes

机构 * Department of Mathematics and Statistics, Université de Montréal, Montreal, Canada(蒙特利尔大学数学与统计学系) Mila - Quebec AI Institute, Montreal, Canada(魁北克人工智能研究所) Department of Mathematics and Statistics, Utah State University, Logan, Utah, USA(犹他州立大学数学与统计学系) Department of Statistics, Brigham Young University, Provo, Utah, USA(Brigham Young 大学统计学系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 FoSTA通过森林引导的语义传输对齐方法,提升多模态数据对齐和标签转移的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20321 2026-02-02 cs.RO 50%

TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation

TaF-VLA:面向力感知操控的视觉-语言-动作模型中的触觉-力对齐

Yuzhe Huang, Pei Lin, Wanlin Li, Daohan Li, Jiajun Li, Jiaming Jiang, Chenxi Xiao, Ziyuan Jiao

机构 * Beihang University(北航大学) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 TaF-VLA通过触觉-力对齐提升视觉-语言-动作模型在力感知操控中的性能。

Comments 17pages,9fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21792 2026-01-30 cs.LG 50%

NetMamba+: A Framework of Pre-trained Models for Efficient and Accurate Network Traffic Classification

NetMamba+: 一种用于高效准确网络流量分类的预训练模型框架

Tongze Wang, Xiaohui Xie, Wenduo Wang, Chuyi Wang, Jinzhou Liu, Boyan Huang, Yannan Hu, Youjian Zhao, Yong Cui

机构 * Institute for Network Sciences and Cyberspace, Tsinghua University(网络科学与网络空间研究院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Zhongguancun Laboratory(中关村实验室) Central South University(中南大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NetMamba+通过高效架构、多模态表示和标签分布感知微调,实现高效准确的网络流量分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21420 2026-01-30 cs.LG 50%

ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation

ConceptMoE: 适应性令牌到概念压缩以实现隐式计算分配

Zihao Huang, Jundong Zhou, Xingwei Qu, Qiyang Min, Ge Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 ConceptMoE通过动态合并语义相似令牌实现隐式计算分配,提升语言和视觉语言任务性能,同时减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18326 2026-01-27 cs.LG 50%

Cognitive Fusion of ZC Sequences and Time-Frequency Images for Out-of-Distribution Detection of Drone Signals

基于ZC序列和时频图像的认知融合用于无人机信号的分布外检测

Jie Li, Jing Li, Lu Lv, Zhanyu Ju, Fengkui Gong

机构 * State Key Laboratory of Integrated Services Network(集成服务网络国家重点实验室) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出基于ZC序列和时频图像的认知融合算法,用于提升无人机信号分布外检测的性能,实验表明其在识别和检测指标上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 50%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19034 2026-01-27 eess.SP 50%

Fast Vortex Beam Alignment for OAM Mode Multiplexing in LOS MIMO Networks

快速涡旋束对齐用于 LOS MIMO 网络中的 OAM 模式复用

Poorya Mollahosseini, Yasaman Ghasempour

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 OrthoVortex 提出了一种快速且精确的 OAM 模式对齐方法,通过跨模式相位识别实现快速对齐,提升 LOS MIMO 网络的容量和信干比。

Comments 13 pages, 12 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16009 2026-01-23 cs.SE 50%

The Role of Cognitive Abilities in Requirements Inspection: Comparing UML and Textual Representations

认知能力在需求检查中的作用:比较UML和文本表示

Giovanna Broccia, Sira Vegas, Alessio Ferrari

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究比较UML和文本表示在需求检查中的效果,发现认知能力影响UML辅助检查的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13927 2026-01-21 eess.IV 50%

Towards Modality-Agnostic Continual Domain-Incremental Brain Lesion Segmentation

面向模态无关的持续域增量性脑部病变分割

Yousef Sadegheih, Dorit Merhof, Pratibha Kumari

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 CLMU-Net通过灵活的模态处理和重放机制,提升持续域增量性脑部病变分割的性能和鲁棒性。

Comments Submitted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06980 2026-01-21 cs.DB cs.LG 50%

Relational Database Distillation: From Structured Tables to Condensed Graph Data

关系数据库蒸馏:从结构化表到压缩图数据

Xinyi Gao, Jingxi Zhang, Lijian Chen, Tong Chen, Lizhen Cui, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Shandong University(山东大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究提出关系数据库蒸馏方法,将大规模结构化数据库压缩为紧凑图数据,保留预测能力,通过异质图结构和核岭回归引导目标实现高效学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12469 2026-01-21 physics.plasm-ph 50%

SPARC Tokamak Error Field Expectations and Physics-Based Correction Coil Design

SPARC环形磁体误差场预期与基于物理的校正线圈设计

N. C. Logan, C. E. Myers, R. Sweeney, C. Paz-Soldan, M. Pharr, N. Leuthold, M. Nickerson, J. Halpern, I. Stewart

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 SPARC环形磁体通过基于物理的校正线圈设计,实现高效误差场校正和抑制边缘局域模,确保高场运行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21743 2026-01-21 cs.CY 50%

When Proximity Falls Short: Inequalities in Commuting and Accessibility by Public Transport in Santiago, Chile

当距离不足:智利圣地亚哥公共交通通勤与可达性中的不平等

Cesar Marin-Flores, Leo Ferres, Henrikki Tenkanen

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究利用移动电话数据分析智利圣地亚哥公共交通通勤与可达性不平等,发现社会经济群体间存在显著差异,高收入群体并未始终享有更短的通勤时间。

Comments 30 pages, Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16245 2026-01-21 cs.LG q-bio.BM 50%

Large-Scale Multi-omic Biosequence Transformers for Modeling Protein-Nucleic Acid Interactions

大规模多组学生物序列变压器用于建模蛋白质-核酸相互作用

Sully F. Chen, Robert J. Steele, Glen M. Hocky, Beakal Lemeneh, Shivanand P. Lad, Eric K. Oermann

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 OmniBioTE是一种大规模多组学生物序列变压器,通过混合蛋白质和核酸数据训练,实现了对蛋白质-核酸相互作用的高效预测和结构信息学习。

Comments 47 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10972 2026-01-19 eess.SP 50%

DuTrack: Long-Term Indoor Human Tracking with Dual-Channel Sensing and Inference

DuTrack: 基于双通道感知与推断的长时室内人体跟踪

Mengning Li, Wenye Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 DuTrack通过融合双通道感知与推断技术,实现长时室内人体跟踪,显著降低跟踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10944 2026-01-19 cs.IR 50%

PRISM: Personalized Recommendation via Information Synergy Module

基于信息协同模块的个性化推荐(PRISM)

Xinyi Zhang, Yutong Li, Peijie Sun, Letian Sha, Zhongxuan Han

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 PRISM通过信息协同模块实现个性化推荐,通过分解多模态信息并动态加权以提升推荐效果。

Comments Accepted as a Full Paper at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10412 2026-01-16 eess.IV 50%

An effective interactive brain cytoarchitectonic parcellation framework using pretrained foundation model

一种利用预训练基础模型的有效交互式脑皮层分区框架

Shiqi Zhang, Fang Xu, Pengcheng Zhou

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种利用预训练基础模型的交互式脑皮层分区框架,通过多层特征融合和轻量级解码器实现高效分割,提升大规模数据集的分割精度。

Comments 10 pages, 5 figures, Accepted at IMIP2026 Code: https://github.com/Confetti22/cytoarch_brain_parcellation_dino

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06473 2026-01-13 eess.SY cs.LG cs.SY 50%

Hybrid LSTM-UKF Framework: Ankle Angle and Ground Reaction Force Estimation

混合LSTM-UKF框架:踝角和地面反作用力估计

Mundla Narasimhappa, Praveen Kumar

机构 * Department of Computer Science Engineering SRMIST University(计算机科学工程系 SRMIST 大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出混合LSTM-UKF框架,用于在不同行走速度下准确估计踝角和地面反作用力,通过多模态传感器融合提升生物力学分析的可靠性。

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20034 2025-12-24 cs.IR 50%

VSA:Visual-Structural Alignment for UI-to-Code

VSA:面向UI到代码的视觉-结构对齐

Xian Wu, Ming Zhang, Zhiyu Fang, Fei Li, Bin Wang, Yong Jiang, Hao Zhou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 VSA通过视觉-结构对齐提升UI到代码的模块化和一致性,生成类型安全的组件以提高软件工程效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20617 2025-12-23 stat.CO 50%

Approximating evidence via bounded harmonic means

通过有界调和均值近似证据

Dana Naderi, Christian P Robert, Kaniav Kamary, Darren Wraith

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 通过椭圆覆盖方法改进调和均值估计器,有效解决无限方差问题,提供更稳定和精确的证据近似

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06189 2025-12-19 cs.RO cs.HC 50%

Accessible and Pedagogically-Grounded Explainability for Human-Robot Interaction: A Framework Based on UDL and Symbolic Interfaces

可及且以教学为导向的机器人可解释性:基于UDL和符号接口的框架

Francisco J. Rodríguez Lera, Raquel Fernández Hernández, Sonia Lopez González, Miguel Angel González-Santamarta, Francisco Jesús Rodríguez Sedano, Camino Fernandez Llamas

机构 * Grupo de Robótica , EIIIA Campus de Vegazana, Universidad de León(机器人组,EIIIA校区,莱昂大学) C.E.E. Ntra. Sra. Del Sagrado Corazón(圣心宗女会)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于UDL和符号接口的框架,旨在通过多模态解释板提升人机交互中不同需求用户的可解释性与教学导向性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14935 2025-12-18 cs.CR cs.LG 50%

Cloud Security Leveraging AI: A Fusion-Based AISOC for Malware and Log Behaviour Detection

基于AI的云安全:一种融合式AISOC用于恶意软件和日志行为检测

Nnamdi Philip Okonkwo, Lubna Luxmi Dhirani

机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) University of Limerick(利默里克大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出了一种基于AI的融合式AISOC,通过融合恶意软件检测和日志异常检测结果,提升云安全操作中心在受限制环境下的威胁检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏