arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 33 篇

2608.25493 2026-09-01 cs.CV 版本更新 90%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

Comments 19 pages, Accepted 37th British Machine Vision Conference, BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21670 2026-09-01 cs.CV cs.LG 版本更新 87%

Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion

通过有界一致性实现多样性:多模态融合的几何正则化

Zixuan Xia, Hao Wang, Pengcheng Weng, Yanyu Qian, Yangxin Xu, William Dan, Fei Wang

机构 * Department of Informatics University of Bern(伯尔尼大学信息学院) College of Computing and Data Science Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Software Engineering Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);audio-visual(abstract)

AI总结 提出一种轻量级即插即用的几何正则化框架,通过有界一致性原则在保持模态特异多样性的同时约束跨模态漂移,提升多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28603 2026-09-01 cs.AI 新提交 85%

C3-UniMM: Causal Cycle-Consistent Unified Multimodal Modeling via Super Alignment and Shared Decoding Space

C3-UniMM:通过超级对齐与共享解码空间实现因果循环一致性的统一多模态建模

Yujie Shen, Lianlei Shan

机构 * Hunan University(湖南大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.AI

AI总结 本文提出C3-UniMM框架,通过结构化隐式因果图(SLCG)与统一解码空间解决现有统一多模态模型的跨模态结构一致性问题,在多任务上性能优于现有基线。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30857 2026-09-01 cs.CV cs.AI 新提交 84%

TAMI: Temporally Aligned, Missingness-Aware, and Interpretable Multimodal Fusion for Mental Health Assessment in Older Adults with Mild Cognitive Impairment

TAMI:面向轻度认知障碍老年人心理健康评估的时间对齐、缺失感知与可解释多模态融合框架

Merna Bibars, Bolaji Omofojoye, Allan I. Levey, Rachel Hershenberg, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Cairo University(开罗大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对轻度认知障碍老年人心理健康筛查的多模态分析局限,提出TAMI框架,通过时间对齐、缺失感知与可解释性设计,在49名受试者的抑郁、焦虑分类中取得良好效果,且开放式问题可实现与完整访谈相当的筛查性能。

Comments 19 pages, submitted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29235 2026-09-01 cs.CV 新提交 83%

Uncertainty-Aware Multimodal Anti-UAV Detection via Evidential Fusion and Conflict-Discounted Belief Aggregation

基于证据融合与冲突折扣信念聚合的不确定性感知多模态反无人机检测

Sharanda Suttorp, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansour Alsahag

机构 * University of Amsterdam(阿姆斯特丹大学) SUNY Empire State University(纽约州立大学帝国州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有多模态反无人机检测未建模不确定性的问题,本文扩展EDTC提出DBF方法实现多模态融合,在Anti-UAV基准上达到0.670准确率、至少38 FPS,校准良好但定位失败检测能力弱于空间方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29139 2026-09-01 cs.AI 新提交 83%

More Perspectives, Stronger Signals: Multi-Perspective Enhancement and Progressive Fusion for Multimodal Entity Representation Learning

更多视角,更强信号:面向多模态实体表示学习的多视角增强与渐进融合

Chenyi Xiong, Yan Zhang, Jing Hu, Ziyue Qin, Kui Xiao, Xiaopan Lyu, Xiaoju Hou, Zhifei Li

机构 * School of Computer Science, Hubei University(湖北大学计算机学院) School of Cyber Science and Technology, Hubei University(湖北大学网络空间安全学院) Institute of Vocational Education, Guangdong Industry Polytechnic University(广东轻工职业技术学院职业教育学院) School of Computer Science, Hubei Key Laboratory of Big Data Intelligent Analysis and Application, Hubei University(湖北大学计算机学院、湖北省大数据智能分析与应用重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态实体表示学习中存在的模态内语义过平滑、跨模态噪声过滤不足问题,提出PrismF框架,通过多视角增强与渐进融合策略,在KVC16K等基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28726 2026-09-01 cs.AI 新提交 83%

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

Pro-Router:面向高效多模态大语言模型推理的、具备自适应边云协作的令牌感知渐进式模型路由方法

Xinyuan Gui, Shaowen Wang, Sheng Sun, Zijian Wang, Zishu Yu, Zheming Yang

机构 * Anyscale(安尼斯科尔公司) Mississippi State University(密西西比州立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理开销大的问题,提出具备自适应边云协作的Pro-Router方法,通过两阶段渐进式决策机制提升路由准确率与速度,端到端吞吐量显著优于现有方案。

Comments 9 pages, 7 figures, 2 tables. Code: https://github.com/xinyuangui2/pro-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06113 2026-09-01 cs.CV 版本更新 83%

Multimodal Feature Prototype Learning for Interpretable and Discriminative Cancer Survival Prediction

用于可解释且具判别性癌症生存预测的多模态特征原型学习

Shuo Jiang, Zhuwen Chen, Liaoman Xu, Yanming Zhu, Changmiao Wang, Jiong Zhang, Feiwei Qin, Yifei Chen, Zhu Zhu

机构 * Hangzhou Dianzi University(杭州电子科技大学) School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Laboratory of Advanced Theranostic Materials and Technology, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(先进诊疗材料与技术实验室,宁波材料技术与工程研究所,中国科学院) School of Biomedical Engineering, Tsinghua University(生物医学工程学院,清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出多模态框架FeatProto,通过三项创新改进原型学习,在四个公开癌症数据集上,实现了更准确可解释的癌症生存预测,为医疗原型学习提供新视角。

Comments 12 pages, 8 figures

Journal ref IEEE Journal of Biomedical and Health Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19597 2026-09-01 cs.LG stat.ML 82%

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence

对比表示学习的几何力学:对齐势、熵分散和跨模态散度

Yichao Cai, Zhen Zhang, Yuhang Liu, Javen Qinfeng Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文通过测度论框架,在大批量极限下证明InfoNCE目标与确定性能量景观的等价性,揭示单模态与对称多模态之间的几何分岔,并指出跨模态散度项导致模态间隙。

Comments Accepted at ICML 2026; v8: Exposition and notation refined; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28794 2026-09-01 cs.CR cs.CV 新提交 81%

Breaking Darknet CAPTCHAs with general purpose LLM

用通用大语言模型破解暗网验证码

Benjamin Fehrensen, Jens Hubler

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本研究针对暗网验证码,提出结合MLLM与经典计算机视觉的混合框架,通过任务重构或专用工具缓解MLLM的几何处理局限,实现90%以上的破解成功率。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26582 2026-09-01 cs.CV cs.AI 版本更新 81%

Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology

星融合:一种多模态变换器架构,通过球面拓扑实现离散天体定向

May Hammad, Menatallh Hammad

机构 * Department of Aerospace Informatics, Julius-Maximilians-Universität Würzburg(航空航天信息学系,乌尔姆-马克斯-普朗克大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Star-Fusion架构,通过球面拓扑分类解决天体定向问题,采用球面K-means聚类和多模态融合策略,实现高精度和高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31065 2026-09-01 cs.CV 新提交 79%

Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery

用于玻璃体视网膜手术阶段识别的叙事、显微镜及iOCT图像的多模态共享潜在表示

Onur Izmitlioglu, Shervin Dehghani, Tarek Ghannoum, Benedikt Schworm, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) SynthesEyes GmbH(SynthesEyes公司) LMU University Hospital(慕尼黑大学附属医院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出以显微镜视图为共享锚点的多模态框架,结合手术叙事与iOCT,用双路MS-TCN++实现玻璃体视网膜手术的宏观与微观阶段识别,提升了宏观阶段识别性能,为细粒度测量提供了探索途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30371 2026-09-01 cs.CV 新提交 79%

MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation

MCSeg:用于多模态心脏图像分割的体积金字塔Transformer的预训练与微调

Zhiyu Ye, Hairong Zheng, Tong Zhang

机构 * Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出MCSeg网络,通过新型SFP连接ViT编码器与CNN解码器,结合自监督预训练与RMI损失,在多模态心脏图像分割任务中优于11种SOTA方法,小样本场景也表现出色

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29897 2026-09-01 cs.CL 新提交 79%

When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents

当历史是多模态时:重新思考长视野智能体的上下文管理

Jiaqi Su, Cong Pang, Jiawei Hong, Tiankuo Yao, Zixuan Chen, Xin Lou, Lewei Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出视觉渲染(VR)作为上下文管理器,并构建无需训练的VERA策略,在多模态任务中保留原生视觉观测,相比无压缩减少31.5%-63.1%的累计非缓存令牌,在多模态基准中准确率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29291 2026-09-01 cs.AI 新提交 79%

Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling

通过核心扩展路由与统一计算调度加速统一多模态模型

Wengyi Zhan, Chenqian Yan, Songwei Liu, Mingbao Lin, Rongrong Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CE-Router方法,通过核心扩展路由与统一计算调度减少统一多模态模型的冗余计算,在保留98.03%密集理解性能的同时实现1.93倍端到端推理加速,提升了质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29285 2026-09-01 cs.CV 新提交 79%

3D-MRL: Nested Multimodal 3D Representations via Matryoshka Representation Learning

3D-MRL:基于套娃表示学习的嵌套多模态3D表示

Márcus Lobo, Vitor Matias, Jeová Farias, Moacir Ponti

机构 * Bowdoin College(鲍登学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有多模态3D预训练方法需多模型适配不同计算预算的问题,提出3D-MRL框架,可通过单个模型生成不同维度3D表示,在多数据集上提升了3D识别与检索性能。

Comments Accepted at the British Machine Vision Conference (BMVC) 2026. Project page: https://usmarcv.github.io/3DMRL_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29220 2026-09-01 cs.CV 新提交 79%

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30503 2026-09-01 astro-ph.IM 新提交 78%

DINOspec: Efficient Multimodal Alignment of Vision and Spectral Foundation Models for Astronomy

DINOspec:面向天文学的视觉与光谱基础模型的高效多模态对齐

Erica Lastufka, Mariia Drozdova, Daniel Schaerer, Svyatoslav Voloshynovskiy

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 DINOspec框架通过轻量适配器和对比学习,对齐冻结的DINOv3图像编码器与预训练的AION-1光谱分词器,在20472对天体数据上提升了星系形态和光谱分类性能,验证了科学基础模型可通过轻量表征对齐组合。

Comments 4 pages, 1 figure, submitted to NeurIPS Representations for the Physical Sciences Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31097 2026-09-01 cs.AI 新提交 74%

Cross-Regional Grapevine Cold Hardiness Prediction via Learned Multimodal Latent Representations

基于学习的多模态潜在表示的跨区域葡萄抗寒性预测

William Solow, Paola Pesantez-Cabrera, Markus Keller, Lav Khot, Sandhya Saisubramanian, Alan Fern

机构 * Oregon State University(俄勒冈州立大学) Washington State University(华盛顿州立大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 该研究针对现有抗寒性预测模型仅适特定区域的局限,提出基于多模态潜在表示的框架,可实现跨区域抗寒性预测,在北美六区域数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30912 2026-09-01 cs.AI cs.CL 新提交 62%

Responsible Integration of AI in Cancer Genomics: Barriers, Risks, and Pathways to Trustworthy Clinical Translation

负责任地将人工智能整合到癌症基因组学中:障碍、风险及实现可信赖临床转化的路径

Bahar İlgen, Yiannos Tolias, Denise Kühnert, Paraskevi Papadopoulou, Magnus Westerlund, Dominik Heider, Katharina Ladewig, Georges Hattab

机构 * Robert Koch Institute(罗伯特·科赫研究所) European Commission(欧洲委员会) Deree-The American College of Greece(希腊 Deree 美国学院) Åbo Akademi University(奥布学术大学) Arcada University of Applied Sciences(阿卡达应用科学大学) University of Münster(明斯特大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本综述分析AI与NLP在癌症基因组学临床转化中的障碍,提出应对四大相互关联失败领域的框架与路线图,强调需从系统层面解决问题而非仅提升模型能力。

Comments Review article

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28691 2026-09-01 cs.CV cs.AI 新提交 62%

Defending Wearable VLMs Against Private Attribute Inference

防御可穿戴视觉语言模型(VLM)抵御私有属性推断

Zhimin Li, Pan Wang, Jingxian Chen, Yuantao Tang, Anthony Chen, Qian Lou, Jingtong Hu

机构 * Swanson School of Engineering, University of Pittsburgh(匹兹堡大学斯旺森工程学院) North Allegheny Senior High(北阿勒格尼高级中学) College of Engineering, Michigan State University(密歇根州立大学工程学院) University of Central Florida(中佛罗里达大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对可穿戴VLM的视觉令牌可能泄露私有属性的问题,提出TGAP方法,可大幅降低隐私推断准确率,同时维持较高效用,为可穿戴多模态AI的隐私保护提供可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-09-01 cs.CL cs.MM 版本更新 62%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

Comments Findings of ACL, EMNLP26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03549 2026-09-01 cs.CV cs.CL 版本更新 62%

FEA-SLT: A Gloss-Free End-to-End Framework for Facial-Expression-Aware Sign Language Translation

FEA-SLT:一种面向面部表情感知的手语翻译的无词汇端到端框架

Guobin Tu, Di Weng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出FEA-SLT框架,通过面部表情感知融合模块利用面部动态作为语义锚点,解决无词汇手语翻译中手势歧义问题,在PHOENIX14T和CSL-Daily数据集上达到最优BLEU性能。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-09-01 cs.CV cs.AI 版本更新 62%

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30824 2026-09-01 cs.CV 新提交 57%

Whole-Body MRI Classification via Prompt-Based Clinical Conditioning

基于提示的临床条件下的全身MRI分类

Laura Daza, Marta Hasny, Cristina González, Julia A. Schnabel

机构 * Helmholtz Munich(亥姆霍兹慕尼黑) Technical University of Munich(慕尼黑工业大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出基于提示的多模态框架TACTIC,整合全身MRI与结构化临床数据,可处理缺失临床数据,在五项WB-MRI分类任务中优于仅图像方法,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30758 2026-09-01 cs.CV 新提交 57%

CheXGround: Anatomical Region Tokens for Grounded Longitudinal Chest X-ray Interpretation

CheXGround:用于 grounded 纵向胸部 X 线片解读的解剖区域标记

Adonay Demewez Gebremedhin, Wessam Shehieb, Sara Alansari, Mohamad Alansari, Muzammal Naseer, Sajid Javed, Naoufel Werghi

机构 * Ajman University(阿治曼大学) University of Birmingham(伯明翰大学) Khalifa University(哈利法大学) University of Western Australia(西澳大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出 CheXGround,一种基于区域的纵向胸部 X 线片语言模型,通过时序区域-短语对齐预训练目标关联区域标记与临床文本,在多项放射学任务上较基线模型提升性能,验证了解剖层面组织纵向证据的有效性。

Comments Accepted for publication at the 37th British Machine Vision Conference (BMVC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30247 2026-09-01 cs.CV 新提交 57%

OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

OPUS:一个简单而有效的开放词汇检测统一框架

Xiaoyan Wei, Zhimin Yao, Ruilin Yang, Wei Zhang, Yong Dai, Yi Zhang, Wei Ge

机构 * Megvii Technology Inc.(旷视科技) X-Humanoid

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出 OPUS 框架,以简单设计结合语义视觉表示与 ICA 训练策略,在 COCO 等数据集上实现最优 Visual-I 性能,平衡多类型提示精度,将混合提示转为互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29194 2026-09-01 cs.CV 新提交 57%

RLG-TPV: Radar- and LiDAR-Guided Tri-Perspective View Fusion for Camera-Radar 3D Object Detection

RLG-TPV:用于相机-雷达3D目标检测的雷达与激光雷达引导的三视角视图融合

Ahmet Mete Dokgoz, A. Enes Doruk, Hasan F. Ates

机构 * Ozyegin University(厄兹伊金大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出RLG-TPV多模态TPV框架,融合雷达与激光雷达几何引导,结合射线引导注意力、多普勒时间融合等技术,在nuScenes验证集上较CRN基线显著降低方向和速度误差,提升相机-雷达3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29179 2026-09-01 cs.IR cs.AI 新提交 57%

TAAL: Mitigating Early Beam Pruning in Generative Recommendation via Temporal Autoregressive Alignment

TAAL:通过时间自回归对齐缓解生成式推荐中的早期束剪枝

Lianjie Li, Zhiying Tu, Dianhui Chu, Hongliang Sun

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对生成式推荐中早期束搜索分支的真实 SID 剪枝问题,提出 TAAL 方法,通过训练时的联合软目标对齐与推理时的 PMI 分数校准,在三个公开基准上显著提升推荐性能与 SID 存活率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29054 2026-09-01 cs.AI 新提交 57%

Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL

让提示桥接防御知识:通过漏洞感知GPL实现可迁移图净化

Shuomin Xue, Jingyuan Li, Ju Jia, Jingxuan Yu, Xiaojun Jia

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 针对现有图对抗净化方法领域受限的缺陷,提出ProGAP方案,通过漏洞感知图提示学习实现可迁移图净化,性能提升1%-9%且时间消耗最多减少2.2倍。

Comments To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 7 figures, and 4 tables. Shuomin Xue and Jingyuan Li contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏