arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2605.19322 2026-05-20 cs.CV 57%

DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs

DynaTok: 时序自适应和位置偏见感知的视频大语言模型token压缩

Minyoung Park, Taehun Kong, Sangjun Ahn

机构 * LG Electronics, Seoul, South Korea(LG电子,首尔,韩国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DynaTok,一种无需训练的时序自适应和位置偏见感知的token压缩框架,通过在时序和空间维度上分配token预算,有效减少冗余的时空覆盖,提升视频大语言模型的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19227 2026-05-20 cs.CR cs.AI 57%

Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

逐token被入侵:统一自回归模型中的后门漏洞

Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了统一自回归模型中的后门漏洞问题,提出了一种名为Token by Token Backdoor Attack (ToBAC)的攻击方法,展示了如何通过数据和模型污染策略在多模态生成中引发有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09203 2026-05-20 cs.CV cs.RO 57%

3D Modeling and Automated Measurement of Concrete Cracks via Segment Anything Refinement and Visual Inertial LiDAR Fusion

通过段落任何精修和视觉惯性LiDAR融合进行混凝土裂缝的3D建模与自动测量

Pengru Deng, Jiapeng Yao, Chun Li, Su Wang, Xinrun Li, Varun Ojha, Xuhui He

机构 * School of Civil Engineering(土木工程学院) Central South University(中南大学) Hunan Provincial Key Laboratory for Disaster Prevention and Mitigation of Rail Transit Engineering Structures(湖南省铁路工程结构灾害预防与 mitigation 工程结构重点实验室) Nvidia School of Computing(计算学院) Newcastle University(新castle大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种结合计算机视觉技术和多模态同时定位与建图(SLAM)的创新框架,用于二维裂缝检测、三维重建和三维自动裂缝测量,解决了现有方法在适应性和鲁棒性方面的不足,特别是在处理曲线或复杂几何形状时的挑战。

Comments Title and author list updated

Journal ref Computer-Aided Civil and Infrastructure Engineering, Volume 45, 2026, 100019, ISSN 1093-9687

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18837 2026-05-20 cs.LG cs.AI eess.SP 57%

VCR: Learning Valid Contextual Representation for Incomplete Wearable Signals

VCR:学习不完整可穿戴信号的有效上下文表示

Yuxuan Weng, Wenhan Luo, Qijia Shao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VCR框架,通过学习鲁棒于模态缺失的表示,解决可穿戴信号不完整问题,提升在多种健康监测任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18039 2026-05-19 cs.CV 57%

SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals

SGSoft: 通过模板引导的软信号学习融合语义-几何特征以实现3D形状对应

Soyeon Yoon, Chang Wook Seo, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Anigma Technologies(Anigma科技公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SGSoft方法,通过模板引导的软信号学习融合语义-几何特征,实现3D形状对应,解决了结构变化、非等距变形和拓扑不一致的挑战,实现了最先进的跨类别泛化和最佳精度-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17354 2026-05-19 cs.CV 57%

GeoHand: Unlocking Prior Geometry Knowledge for Monocular 3D Hand Reconstruction

GeoHand: 解锁先验几何知识以实现单目3D手形 reconstruction

Weiquan Lin, Yaoqing Hu, Liangchen Dai, Xu Tang, Xingyu Chen

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoHand框架,通过解锁冻结的基础单目几何估计器MoGe2中的高质量几何先验,结合地图级GeoAdapter和门控跨模态token融合策略,实现高精度手形重建,尤其在严重遮挡和手-物体交互场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16973 2026-05-19 cs.CV cs.LG 57%

SHED: Style-Homogenized Embedding Alignment for Domain Generalization

SHED: 风格均质化嵌入对齐用于领域泛化

Kai Gan, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(1 东南大学计算机科学与工程学院,南京 210096,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(2 教育部计算机网络与信息集成重点实验室(东南大学),中国)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出SHED方法,通过均质化嵌入对齐来解决领域泛化中的信息不对称问题,实验表明其在多个基准测试中取得了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16893 2026-05-19 cs.AI 57%

NGM: A Plug-and-Play Training-Free Memory Module for LLMs

NGM: 一种无需训练的插拔式内存模块用于大语言模型

Yuwen Qu, Wenhui Dong, Chenyang Si, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出NGM,一种无需训练的插拔式内存模块,通过因果n-gram编码器和余弦门控内存注入器,实现高效的知识检索,提升大语言模型在代码生成和知识密集型任务中的性能。

Comments Code is available at https://github.com/PioneerQyw/NGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16768 2026-05-19 cs.CV eess.IV 57%

Axial-Relation Guided Fusion State Space Model for Optical-Elevation Sensing Image Segmentation

基于轴向关系引导的融合状态空间模型用于光学-海拔感测图像分割

Feng Gao, Zhilin Jin, Yanhai Gan, Junyu Dong, Qian Du

机构 * State Key Laboratory of Physical Oceanography, Ocean University of China(中国海洋大学物理海洋学国家重点实验室) Department of Electrical and Computer Engineering, Mississippi State University(密苏里州立大学电气与计算机工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于状态空间模型的框架,用于光学-海拔遥感图像分割,通过引入多尺度状态空间模块和轴向关系引导融合模块,有效提升了多源遥感图像语义分割的性能和计算效率。

Comments Accepted by IEEE GRSL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10027 2026-05-19 cs.CV 57%

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

SinkTrack: 基于注意力sink的上下文锚定用于大语言模型

Xu Liu, Guikun Chen, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 SinkTrack通过将<BOS>作为信息锚点,注入关键上下文特征,缓解大语言模型的幻觉和上下文遗忘问题,实验显示在文本和多模态任务中均取得显著提升。

Comments ICLR 2026. Code: https://github.com/67L1/SinkTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08936 2026-05-19 cs.CV 57%

M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model

M-IDoL:面向医学基础模型的模态特定与多样化表示学习的信息分解

Yihang Liu, Longzhen Yang, Jiaxiong Yang, Ying Wen, Lianghua He, Heng Tao Shen

机构 * School of Computer Science and Technique(计算机科学与技术学院) Tongji University(同济大学) School of Communications and Electronic Engineering(通讯与电子工程学院) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出M-IDoL,通过信息分解提升医学基础模型的模态特异性和多样性,通过最大化跨模态熵和最小化内模态不确定性,在21个下游任务中实现优于现有模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16085 2026-05-19 cond-mat.mtrl-sci cs.CV 57%

Machine Learning Enabled Graph Analysis of Particulate Composites: Application to Solid-state Battery Cathodes

机器学习赋能的颗粒复合材料分析:应用于固态电池正极

Zebin Li, Shimao Deng, Yijin Liu, Jia-Mian Hu

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于机器学习的框架,将多模态X射线图像转化为拓扑感知图,用于分析颗粒复合材料的微观结构与性能关系,以固态电池正极为例验证了三相交点和离子/电子传导通道的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22901 2026-05-19 cs.LG cs.AI q-bio.BM q-bio.GN 57%

Missing-Modality-Aware Graph Neural Network for Cancer Classification

面向缺失模态的图神经网络用于癌症分类

Sina Tabakhi, Chen, Chen, Haiping Lu

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MAGNET模型,通过动态患者-模态多头注意力机制融合低维模态嵌入,以提升部分模态下的多模态预测性能,实验表明其在癌症分类任务中优于现有方法。

Comments 27 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16414 2026-05-19 cs.CV 57%

NERVE: A Neuromorphic Vision and Radar Ensemble for Multi-Sensor Fusion Research

NERVE:一种用于多传感器融合研究的神经形态视觉与雷达集成系统

Omar Mansour, Pietro Martinello, Ethan Milon, YingFu Xu, Manolis Sifalakis, Guangzhi Tang, Amirreza Yousefzadeh

机构 * 1University of Twente, Netherlands 2University of Modena 3University of Strasbourg, France 4IMEC the Netherlands, Netherlands 5Innatera, Netherlands 6Maastricht University, Netherlands

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 NERVE包含257分钟同步记录的多传感器数据,用于评估多模态融合,通过DVS与雷达结合提升人体检测和距离估计性能。

Comments To be published in ICJNN 2026 Maastricht

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16080 2026-05-18 cs.CV 57%

ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation

ReAlign:通过推理对齐表示实现通用图像伪造检测

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出ReAlign框架,通过对比学习将LLM生成的高质量推理文本转化为轻量级AIGI检测器,提升检测准确性和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV 57%

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15300 2026-05-18 cs.CV 57%

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15252 2026-05-18 cs.LG cs.AI eess.SP 57%

PDRNN: Modular Data-driven Pedestrian Dead Reckoning on Loosely Coupled Radio- and Inertial-Signalstreams

PDRNN:模块化数据驱动的行人死记生忘在松散耦合的无线电和惯性信号流中

Peter Bauer, Andreas Porada, Felix Ott, Christopher Mutschler, Tobias Feigl

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PDRNN,一种模块化混合AI辅助PDR系统,通过独立的机器学习模型估计关键参数均值和方差,提升动态运动中的定位精度与鲁棒性。

Comments 12 pages

Journal ref IEEE/ION Position, Location and Navigation Symposium (PLANS), Salt Lake City, UT, May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14990 2026-05-15 cs.CV 57%

Characterizing the visual representation of objects from the child's view

从儿童视角表征物体的可视化分析

Jane Yang, Tarun Sepuri, Alvin Wei Ming Tan, Khai Loong Aw, Michael C. Frank, Bria Long

机构 * Department of Psychology, University of California San Diego(加州大学圣地亚哥分校心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究分析了儿童日常经验中物体类别表征的视觉输入,发现常见物体如杯子、椅子占据主导地位,而多数类别出现频率低。尽管物体视角多样,但检测到的类别在上位类别中表现出更强的聚类特征。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13621 2026-05-14 cs.CV 57%

WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning

WD-FQDet:通过小波分解和频率感知查询学习的多光谱检测变换器

Chunjin Yang, Xiwei Zhang, Yiming Xiao, Fanman Meng

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出WD-FQDet框架,通过小波分解和频率感知查询学习分离红外与可见光的共性与专用特征,提升多光谱目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11033 2026-05-14 physics.plasm-ph cs.AI 57%

TokaMind for Power Grid: Cross-Domain Transfer from Fusion Plasma

TokaMind用于电网:从融合等离子体的跨域迁移

JC Wu, Norton Lee, Kai Siang Chen

机构 * TaiScience Research Group(TaiScience研究组) Fu Jen Catholic University(辅仁大学) Center for Geometry and Physics(几何与物理中心) Institute for Basic Science (IBS)(基础科学研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 TokaMind通过多模态Transformer模型在等离子体诊断数据上预训练,展现优于CNN的方法。研究发现其表示在物理不同但结构相似的领域有效,尤其在电网同步相位数据中表现最佳,提出跨域迁移框架和评估协议。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11840 2026-05-13 cs.CV 57%

Selection, Not Fusion: Radar-Modulated State Space Models for Radar-Camera Depth Estimation

选择,而非融合:雷达-相机状态空间模型用于雷达-相机深度估计

Zhangcheng Hou, Tomoaki Ohtsuki

机构 * School of Science and Technology(科学与技术学部)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出雷达-调制选择(RMS)模型,通过在Mamba的选择性扫描中引入雷达信号,提升雷达-相机深度估计的精度与效率,实现在nuScenes数据集上取得最佳性能。

Comments 16 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11799 2026-05-13 cs.CV 57%

SB-BEVFusion: Enhancing the Robustness against Sensor Malfunction and Corruptions

SB-BEVFusion:增强对传感器故障和损坏的鲁棒性

Markus Essl, Marta Moscati, Mubashir Noman, Muhammad Zaigham Zaheer, Usman Naseem, Shah Nawaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) MBZUAI(穆罕默德·本·拉希德人工智能研究所) Macquarie University(麦考瑞大学) Linz Institute of Technology(林茨技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SB-BEVFusion框架,通过处理缺失或损坏的相机和激光雷达数据,提升自动驾驶3D目标检测在传感器故障和损坏场景下的鲁棒性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-05-13 cs.RO cs.AI 57%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11034 2026-05-13 cs.CR cs.AI cs.LG cs.PF 57%

MambaNetBurst: Direct Byte-level Network Traffic Classification without Tokenization or Pretraining

MambaNetBurst:无需分词或预训练的直接字节级网络流量分类

Gayan K. Kulatilleke, Siamak Layeghy, Mahsa Baktashmotlagh, Marius Portmann

机构 * University of Queensland, Brisbane, Australia(昆士兰大学,布里斯班,澳大利亚)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 MambaNetBurst基于Mamba-2架构,直接对原始字节进行分类,无需分词或预训练,实现了高效的网络流量分类。

Comments 16 pages, 2 figures. Pareto-optimal frontier. Transformer vs Mamba vs Mamba-2 scaling performance. Code and data available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10470 2026-05-12 cs.CV 57%

Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution

适应性上下文至关重要:迈向可证明的多模态引导超分辨率

Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出M$^3$ESR框架,通过动态模态融合提升超分辨率的泛化和语义一致性,理论分析揭示了多模态SR的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09982 2026-05-12 cs.CV 57%

ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

ERASE: 通过自适应两阶段令牌剪枝消除冗余视觉令牌

Yuna Lee, Kyoungho Min, Yulhwa Kim

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Department of Semiconductor Systems Engineering, Sungkyunkwan University, Republic of Korea(半导体系统工程系,成均馆大学,大韩民国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ERASE框架,通过自适应两阶段令牌剪枝方法减少冗余视觉令牌,实验证明在85%的令牌剪枝率下,模型准确率保持在89.46%。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09243 2026-05-12 cs.AI q-bio.NC 57%

How Much is Brain Data Worth for Machine Learning?

脑数据对机器学习有多大价值?

Lane Lewis, Zhixin Wang, David Schwab, Xaq Pitkow

机构 * Neuroscience Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学神经科学研究所) Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) NSF AI Institute for Artificial and Natural Intelligence (ARNI)(国家科学基金会人工智能与自然智能研究所) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) CUNY Graduate Center, New York, NY, USA(纽约市立大学研究生中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文通过数学建模探讨脑数据与任务数据在机器学习中的价值与交换率,分析不同条件下脑数据对模型性能的提升作用。

Comments 9 pages main text, 5 figures, 34 pages of appendix with detailed proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09173 2026-05-12 cs.LG cs.AI 57%

WavesFM: Hierarchical Representation Learning for Longitudinal Wearable Sensor Waveforms

WavesFM:纵向可穿戴传感器波形的分层表示学习

Peng Cao, Zhijian Yang, Tennison Liu, Jonathan Wang, Jiang Wu, Magdalena Proszewska, Arvind Pillai, Mingwu Gao, Amir Farjadian, Lawrence Cai, Emily Blanchard, Daniel McDuff, Pramod Rudrapatna, Matthew Thompson, Anupam Pathak, Mark Malhotra, Shwetak Patel, Dina Katabi, Paolo Di Achille, Ming-Zher Poh

机构 * Google Research(谷歌研究) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08985 2026-05-12 cs.CV 57%

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

LLaVA-UHD v4: 什么使多模态大语言模型中的高效视觉编码成为可能?

Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学) ModelBest

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文通过 slice-based 编码和 intra-ViT 早期压缩,提升了多模态大语言模型在高分辨率图像输入中的视觉编码效率,减少 55.8% 的 FLOPs 而不牺牲下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏