arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2607.12071 2026-07-21 cs.CL 版本更新 57%

Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建

Boda Xiao, Xiran Xu, Songyi Li, Yujie Yan, Xihong Wu, Heping Cheng, Jing Chen

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03614 2026-07-21 cs.LG cs.AI 版本更新 57%

Neural Global Optimization via Iterative Refinement from Noisy Samples

通过噪声样本迭代细化的神经全局优化

Qusay Muzaffar, David Levin, Michael Werman

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种神经方法,通过迭代细化从噪声样本中寻找全局极小值,实验表明其在多模态测试函数上比传统方法有显著提升。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19504 2026-07-21 cs.CV 版本更新 57%

FusionNet: Physics-Aware Representation Learning for Multi-Spectral and Thermal Data via Trainable Signal-Processing Priors

FusionNet:通过可训练信号处理先验对多光谱和热数据进行物理感知表示学习

Georgios Voulgaris

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对水泥生产设施监测难题,提出FusionNet框架,通过整合多光谱数据,嵌入信号处理先验,经消融研究等实验验证,该框架能结合物理感知特征选择与深度学习架构,高精度检测水泥生产设施,为工业监测提供可靠框架。

Comments Accepted for publication in the IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03826 2026-07-21 q-bio.QM cs.AI 版本更新 57%

CORE -- A Cell-Level Coarse-to-Fine Image Registration Engine for Multi-stain Image Alignment

CORE——用于多染色图像对齐的细胞级粗到细图像配准引擎

Esha Sadia Nasir, Behnaz Elhaminia, Mark Eastwood, Catherine King, Owen Cain, Lorraine Harper, Paul Moss, Dimitrios Chanouzas, David Snead, Nasir Rajpoot, Adam Shephard, Shan E Ahmed Raza

机构 * Tissue Image Analytics (TIA) Centre, Department of Computer Science, University of Warwick, UK(tissue image analytics (TIA) 中心,计算机科学系,沃里克大学,英国) Department of Immunology and Immunotherapy, College of Medicine and Health, University of Birmingham, UK(免疫学与免疫治疗系,医学院与健康学院,伯明翰大学,英国) Department of Cellular Pathology, Queen Elizabeth Hospital Birmingham, UK(细胞病理学系,伯明翰女王医院,英国) Renal Unit, Queen Elizabeth Hospital Birmingham, University Hospitals Birmingham NHS Foundation Trust, UK(肾病科,伯明翰女王医院,伯明翰大学医院 NHS 基础信托,英国) Department of Applied Health Sciences, College of Medicine and Health, University of Birmingham, UK(应用健康科学系,医学院与健康学院,伯明翰大学,英国) Histofy Ltd, Coventry, UK(Histofy 有限公司,考文垂,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对多染色组织切片细胞核水平分析,提出CORE粗到细框架,粗配准利用组织掩码提取等,细粒度用形状感知模型,细胞水平用CPD估计位移场,经多数据集评估,CORE在多方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26743 2026-07-20 cs.CV 版本更新 57%

Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation

深度语义对齐与亲和力引导融合的结构化雷达点云生成

Amjad Hussain, Wenjie Liu, Yuchen Tan, Fuyuan Ai, Zecheng Li, Chunyi Song, Xin Qiu

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对毫米波雷达点云稀疏、噪声大、结构不完整的问题,提出基于视觉-雷达融合的多模态点云生成方法,利用图像语义约束和稀疏补全策略提升点云质量,并在检测跟踪任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06479 2026-07-20 cs.RO cs.CV cs.SY eess.SY 版本更新 57%

Holistic Fusion: Task- and Setup-Agnostic Robot Localization and State Estimation with Factor Graphs

整体融合:基于因子图的与任务和设置无关的机器人定位与状态估计

Julian Nubert, Turcan Tuna, Jonas Frey, Cesar Cadena, Katherine J. Kuchenbecker, Shehryar Khattak, Marco Hutter

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NASA Jet Propulsion Laboratory(美国国家航空航天局喷气推进实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对移动机器人定位与状态估计问题,提出整体融合方法,通过因子图公式融合多类型测量,注重局部平滑性与一致性,能在典型硬件上实现低延迟、平滑在线估计及低漂移全局定位,在多场景验证了框架有效性。

Comments 21 pages, 25 figures, 9 tables, Transactions on Robotics, accepted

Journal ref Transactions on Robotics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15220 2026-07-17 cs.CV 新提交 57%

Structural-Semantic Reciprocal Learning for Unsupervised Visible-Infrared Person Re-Identification

用于无监督可见光-红外行人重识别的结构-语义交互学习

Moyao Tian, Shijia Liu, Yan Yang, Xin Yuan, Minshi Chen, Wei Wang, Xiao Wang

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-Time Industrial System, Wuhan University of Science and Technology(武汉科技大学智能信息处理与实时工业系统湖北省重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) China University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对无监督可见光-红外行人重识别的挑战,提出结构-语义交互学习框架SSRL。通过细粒度结构解耦和闭环语义校准机制,实现结构与语义学习的交互,有效过滤伪标签噪声,在相关数据集上表现优于现有方法。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15054 2026-07-17 cs.CV 新提交 57%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13800 2026-07-17 eess.IV cs.CV 版本更新 57%

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

多图像胸部X光片分类中的前瞻性临床指征、事后报告泄露和融合设计:患者聚类评估

Kamran Shahid, Muhammad Munwar Iqbal

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究多图像胸部X光片分类,用多种模型比较,含仅图像、仅指征等。评估不同模型在多指标下表现,发现前瞻性指征与报告目标关联大,排列感知融合有竞争力,事后报告文本存在问题,如造成报告标签循环等。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13892 2026-07-16 cs.CV 新提交 57%

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

用于CT理解的基于器官条件模式令牌的细粒度视觉语言预训练

Guoliang You, Xiaomeng Chu

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 研究从CT扫描和报告进行视觉语言预训练的难题,提出OCP-CT框架,通过保留全局对比分支、引入器官模式接口等方法,在公开基准上实现零样本异常诊断,相比先前结果有显著AUROC增益。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13500 2026-07-16 cs.CV 新提交 57%

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

用于高效视觉语言模型的无注意力轻量级令牌约简

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Xiaoyi Pang, Jiahui Hu, Jiacheng Du, Shuguo Zhuo

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型在边缘设备部署难的问题,提出无注意力轻量级令牌约简框架,通过基于熵的准则估计令牌重要性,引入一致性信号确保视觉覆盖,经实验验证该框架在精度和效率权衡上表现出色。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 57%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 57%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 57%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12419 2026-07-15 cs.CV 新提交 57%

DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection

DeGuNet:用于高效激光雷达-相机3D检测的深度引导超紧凑骨干网络

Haifa Zhang, Yijing Wang, Peixi Peng, Zhiqiang Zuo

机构 * Tianjin University(天津大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对自动驾驶中激光雷达与相机融合检测依赖2D预训练骨干网络的问题,提出DeGuNet,通过稀疏感知机制有效对齐图像与激光雷达深度,实验证明其能消除架构冗余,提升效率并提高mAP,建立参数高效多模态3D感知新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12398 2026-07-15 cs.CV cs.RO 新提交 57%

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction

全局观察,局部细化:用于稳健徒手三维超声重建的全局视觉引导和局部超声线索

Yameng Zhang, Zhongyu Chen, Dianye Huang, Xiangyu Chu, K. W. Samuel Au, Zhongliang Jiang

机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对徒手三维超声重建中探头姿态估计易累积误差问题,提出全局到局部姿态估计框架,利用双相机分支和B模式分支及跨模态融合模块,经多尺度姿态损失约束,在数据集和体内实验中有效降低轨迹漂移,提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12111 2026-07-15 cs.LG cs.AI cs.DC cs.MA cs.NI 新提交 57%

PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解

Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。

Comments submitted to IEEE TCCN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10762 2026-07-14 cs.CV cs.LG cs.RO 新提交 57%

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

TOLiD:通过用于蒸馏的令牌提升弥合视觉基础模型与激光雷达预训练之间的架构差距

Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * SAIVT Group, School of Electrical Engineering and Robotics, Queensland University of Technology(澳大利亚昆士兰科技大学电气工程与机器人学院SAIVT组) CSIRO Robotics, CSIRO(澳大利亚联邦科学与工业研究组织机器人部)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究提出TOLiD方法,通过耦合激光雷达主干与从冻结VFM教师初始化的学生ViT,利用视锥体池化、注意力及掩码双线性采样等技术,解决模态和架构差距问题,在多数据集上评估显示能提升迁移效果。

Comments Accepted to The IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10130 2026-07-14 cs.CV 新提交 57%

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

TextGaze:利用文本场景线索提示注视目标估计

Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究注视目标估计问题,提出TextGaze统一跨模态架构,利用大型视觉语言模型平衡多分支与简化设计范式,通过冻结编码器提取视觉特征、设计融合模块等进行联合预测,在多数据集上评估有竞争力,为传统设计提供简化替代。

Comments Accepted by IJCAI 2026. All contents are available at: https://github.com/idremo/TextGaze-IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10103 2026-07-14 cs.CR cs.CL 新提交 57%

A Survey on LLM Watermarking: Theory and Deployment

大语言模型水印:理论与部署综述

Huy Phan, Kieu Dang, Ojaswi Dulal, Aiham AL Shukairi, Abby Shine, Chase Garner, Phung Lai

机构 * Truman State University(特伦特州立大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 综述大语言模型水印技术,通过从业者核心问题组织内容,综合技术家族并分析安全效用权衡,回顾攻击策略、评估协议等,为LLM水印设计提供实际指导,明确可靠部署的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13731 2026-07-14 cs.SD eess.AS 57%

Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion

通过说话人识别、知识蒸馏和分层融合进行多说话人对话中的情绪识别

Xiao Li, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出通过说话人识别、知识蒸馏和分层融合方法,提升多说话人对话中情绪识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 57%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03018 2026-07-08 cs.CV cs.SD 新提交 57%

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning

$C^3$ASD:多层次一致性驱动的表示学习

Jin Hong, Jisoo Park, Junseok Kwon

机构 * Chung-Ang University(中央大学)

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 cs.CV

AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24805 2026-07-08 cs.CV 新提交 57%

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo: 用于立体3D道路异常检测的高效双解码器Transformer

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出DDStereo,一种双解码器立体Transformer,通过轻量级解码器分支和紧凑视差特征提取器,实现实时开放集3D目标检测,在封闭和开放集协议下均达到最先进精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04314 2026-07-07 eess.AS cs.SD 新提交 57%

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

MOSAIC:融合生物语音特征与自监督表示的可解释多令牌交叉注意力统一语音防欺骗方法

Yugwon Won

机构 * AI Security R&D Team(人工智能安全研发团队)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 eess.AS

AI总结 针对现有语音防欺骗融合方法可解释性差、跨模态学习受限问题,提出MOSAIC可解释多令牌交叉注意力框架,实现跨特征对齐可视化,在多数据集上取得优异性能。

Comments 5 pages, 2 figures. Submitted to IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 57%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02568 2026-07-07 cs.CV 新提交 57%

MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement

MAGE:基于视图引导的点云补全,具有高效模态对齐和自适应几何增强

Weize Quan, Zhengwei Wu, Kai Wang, Dong-Ming Yan

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GIPSA-lab, Univ. Grenoble Alpes, CNRS, Grenoble INP(格勒诺布尔大学GIPSA实验室,法国国家科学研究中心,格勒诺布尔国立综合理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出统一几何感知框架,集成高效模态对齐与自适应几何增强,解决视图引导点云补全的跨模态几何不一致问题,含几何感知模态对齐等模块,实验证明性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17101 2026-07-07 cs.CL cs.LG physics.comp-ph 57%

A quantitative analysis of semantic information in deep representations of text and images

深度文本和图像表示中语义信息的定量分析

Santiago Acevedo, Andrea Mascaretti, Riccardo Rende, Matéo Mahaut, Marco Baroni, Alessandro Laio

机构 * Scuola Internazionale Superiore di Studi Avanzati (SISSA)(国际先进研究科学研究所(SISSA)) Universitat Pompeu Fabra (UPF)(庞培法拉大学(UPF)) Catalan Institute of Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 本文通过信息不平衡度分析,发现语义信息在深度模型中分布广泛,且在特定网络层具有最强的预测能力,同时揭示了语言和模型规模对表示预测性的影响。

Comments Published as a journal article at Transactions of Machine Learning Research (TMLR)

Journal ref TMLR 2026: https://openreview.net/forum?id=sBnaFSIuGR

详情

展开后加载摘要…

URL PDF HTML 收藏