arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-17 至 2026-08-17 共收录 37 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2608.13861 2026-08-17 cs.CV 新提交 79%

XSA-MAD: Cross-modal Semantic Alignment for Morphing Attack Detection

XSA-MAD:用于变形攻击检测的跨模态语义对齐

Jie Jin, Mahiro Tokumasu, Yu Makino, Masakatsu Nishigaki, Tetsushi Ohki

机构 * RIKEN AIP(理化学研究所人工智能项目)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对现有图像型变形攻击检测方法泛化性差的问题,提出基于CLIP的多模态框架XSA-MAD,通过对齐图像与语义空间实现对不同变形攻击的检测,在高保真攻击下性能优于现有方法

Comments accepted to ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2608.13957 2026-08-17 cs.SD cs.MM eess.AS 新提交 81%

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

H2H音乐即兴:一种音乐即兴的通信模型及视听数据集

Aleksandra Teng Ma, Anthony Cammarota, Jiayi Wang, Alexandria Smith, Cheng-Zhi Anna Huang, Jeffrey Albert, Alexander Lerch

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 该研究针对现有AI即兴系统缺乏通信意识的问题,通过与专业即兴者协作推导通信模型,并构建首个自由即兴的H2H视听数据集,为AI音乐伙伴设计提供新资源。

Comments Published in the Proceedings of the Society for Music Information Retrieval Conference (ISMIR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 57%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2608.14157 2026-08-17 cs.AI cs.LG 新提交 79%

Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine

消除时间性笔记冗余可提升医学多模态强化学习性能

Chenran Weng, Joo Seung Lee, Malini Mahendra, Anil Aswani

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对机械通气决策的RL方法缺失笔记临床信息的问题,提出冗余感知多模态框架,通过两种策略去除笔记冗余,在ICU数据上显著提升了RL临床决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 70%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交 50%

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2608.14029 2026-08-17 cs.CL 新提交 79%

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

S2Dialog:结合语义与声学风格建模的多模态对话检索

Xueqi Wang, Zhigang Wang, Runqing Zhang, Zhenqi Jia, Junfeng Zhao

机构 * College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) University of Electronic Science and Technology of China, Shenzhen Campus(电子科技大学深圳校区)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对现有多模态对话检索方法无法捕捉对话全局语义与风格一致性的问题,提出S2Dialog框架,结合对话级文本与声学检索器及对比学习,在DailyTalk数据集上实现出色检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14355 2026-08-17 cs.AI 新提交 70%

Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

解耦共享表示可改进形态-转录组整合

Julian Ostermaier, Swann Ruyter, Reuben Dorent, Daniel Racoceanu

机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) AP-HP(巴黎公共医疗集团) Inria(法国国家信息与自动化研究所) Paris Brain Institute – ICM(巴黎脑研究所 – ICM)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14252 2026-08-17 cs.AI cs.CL 新提交 62%

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

无校正控制的基础:大语言模型的真值追踪剖面

Brett Reynolds

机构 * Humber Polytechnic(亨伯理工学院) University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。

Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13939 2026-08-17 cs.CV cs.AI 新提交 62%

CMCNet: Aligning Ultrasound Image Embeddings with Textual TI-RADS Representations for Fine-Grained Thyroid Classification

CMCNet:将超声图像嵌入与文本TI-RADS表示对齐以用于细粒度甲状腺分类

Bingxin Yu, Xueli Wang, Jerry Zhou, Wenyan Wang, Li Wen, Lan Huang, Xin Feng, Fengfeng Zhou, Kewei Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建含600个甲状腺结节的STN数据集,提出CMCNet模型,通过中心间隔对比损失对齐图像与文本嵌入,实现细粒度甲状腺分类,性能优于多类基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2608.14043 2026-08-17 cs.CV 新提交 90%

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :MLLM(title,title_cn);分类 cs.CV

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13679 2026-08-17 cs.GR 新提交 82%

Strand-based Hairstyle Generation via Large Reconstruction and Multimodal Models

基于 strand 的发型生成:结合大型重建模型与多模态模型

Conghui Hao, Tao Huang, Yuefan Shen, Tongtong Wang, Zhongtian Zheng, Kui Wu

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 该研究提出一种结合 LRMs、LMMs 与经典几何处理的自动流程,可从单视图图像快速生成高质量、适配生产的各类基于 strand 的发型,适用于现代数字人工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14138 2026-08-17 cs.CV cs.AI 新提交 81%

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

SPARGen:通过原生多模态生成统一空间感知与推理

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14446 2026-08-17 cs.AI 新提交 79%

Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports

Wyvern:用于生成基于事实的多模态报告的智能体框架

Beatrice Alessandra Motetti, Emilien Guandalino, Daniele Jahier Pagliari, Alessio Burrello, Lorenz K. Müller, Konstantin Berestizshevsky, Lukas Cavigelli

机构 * Politecnico di Torino(都灵理工大学) Huawei Research(华为研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14032 2026-08-17 cs.IR cs.AI 新提交 79%

HAM-RAG: Hierarchy-Aware Multimodal RAG for Structure-Faithful Interleaved Generation

HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成

Yin Li, Ziyang Hu, Zhiyu Guo, Xiangyu Liu, Wenbin Li, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Fugee Tsung

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14226 2026-08-17 cs.CV 新提交 57%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14207 2026-08-17 cs.RO cs.CV 新提交 57%

MMUSV-Sim: A Perception-Oriented Simulation and Data-Generation Platform for Multi-USV Cooperative Perception

MMUSV-Sim:面向多无人水面艇协同感知的感知导向型仿真与数据生成平台

Ziao Li, Jianxiong Ye, Biao Tang, Leping Zhang, Kun Zuo, Siyu Huang, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院) School of Intelligent Imagery Engineering, Beijing Film Academy(北京电影学院智能影像工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于Unreal Engine 5和Project AirSim的MMUSV-Sim仿真与数据生成平台,用于多USV协同感知,实验表明其生成的数据集可使激光雷达协同BEV船舶检测的AP@0.5达72.74,显著优于单USV方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 5 篇

2608.13891 2026-08-17 cs.HC 新提交 82%

DepressionAgent: Reading, Listening, Seeing, and Deliberating Multimodal Evidence for Depression Risk Assessment

DepressionAgent:用于抑郁风险评估的阅读、倾听、观察与审议多模态证据框架

Fangjie Zhu, Haifeng Lu, Sicheng Zhao, Runhao Zeng, Xiping Hu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对现有多模态抑郁评估隐式特征融合的不足,提出以证据为中心的DepressionAgent框架,通过显式证据审议等机制在多基准上取得竞争力性能,且有效性与可检查性获多维度验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14389 2026-08-17 cs.CV cs.AI 新提交 81%

GBU-Palm: A Multimodal Video Dataset and Benchmark for Palm Presentation Attack Detection

GBU-Palm:用于掌纹呈现攻击检测的多模态视频数据集与基准

Yingjie Ma, Zitong Yu, Wei Jia, Ajay Kumar, Linlin Shen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GBU-Palm多模态掌纹PAD数据集与基准,通过控制泄漏协议分离身份与攻击谱系,测试4种视频架构,发现环境变化下架构性能下降,RGB-NIR融合未始终优于仅RGB输入,为跨环境掌纹PAD研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 81%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14049 2026-08-17 cs.RO 新提交 50%

FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects

FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试

Xingyu Zhu, Wenshuo Han, Zhouyu Wang, Yuran Wang, Ruihai Wu, Hao Dong, Fan Tang, Hechang Chen, Hyung Jin Chang, Yixing Gao

机构 * Jilin University(吉林大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Birmingham(伯明翰大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。

Comments This paper is accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13797 2026-08-17 cs.LG 新提交 50%

Recent Advances in Deep Learning-Based Drug-Target Binding Affinity Prediction

基于深度学习的药物-靶点结合亲和力预测的最新进展

Jafin Khan, Md Hossain Shuvo

机构 * Prairie View A&M University(普雷里维尤农工大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文综述近期基于深度学习的药物-靶点结合亲和力预测方法,分析其优势、局限与研究缺口,指出当前方法存在数据集偏差等问题,探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 4 篇

2608.13807 2026-08-17 physics.optics cs.CV physics.med-ph 新提交 79%

Label-Free Deep-Tissue Peripheral Nerve Detection with a Handheld Multimodal OCT Probe and NerveDetNet

使用手持式多模态OCT探头和NerveDetNet进行无标记深层组织周围神经检测

Yihan Wang, Ruilin You, Shaobai Li, Jiabin Chen, Bofan Song, Anh D. Le, Rongguang Liang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 该研究开发了结合手持式多模态OCT探头与NerveDetNet的无标记框架,可在不切开组织的情况下检测皮下周围神经并解析深度,其性能优于多种基线方法,具备术中应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 70%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 57%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 50%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 8 篇

2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 84%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14152 2026-08-17 cs.AI 新提交 83%

Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

面向科技情报(STI)的高效多模态多语言观点抽取:一种基于QLoRA的微调方法

Sheng Hong, Xuanqi Wang, Jiacheng Wang, Yuwei Wang

机构 * Beihang University(北京航空航天大学) Nanchang University(南昌大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本研究针对科技情报观点抽取的噪声过滤与结构化输出问题,提出基于QLoRA微调的多模态框架,在2194样本数据集上实现多语言观点抽取性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13973 2026-08-17 cs.CV 新提交 83%

Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation

重新思考多模态零样本异常检测中的辅助模态:从语义融合到条件调制

Peng Wu, Xin Ge, Yujia Sun, Guansong Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本研究针对现有多模态零样本异常检测方法的缺陷,提出即插即用的辅助条件增强框架,通过全局到局部的条件调制实现选择性多模态增强,在MVTec 3D-AD等数据集上提升了现有RGB零样本异常检测器的性能并达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13980 2026-08-17 cs.CV 新提交 77%

FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation

FIRM:面向遥感推理分割的掩码细粒度令牌内表示

Weidong Tang, Kaiyu Li, Yikai Wang, Yanan Wu, Haotian Gan, Shihong Wang, Xiangyong Cao

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏