arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 220 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 220 篇

2607.04665 2026-07-07 cs.CV 新提交 57%

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval

DiCE-CIR:用于高效零样本合成图像检索的直接合成学习

Gwang-Ho Na, Ho-Joong Kim, Seong-Whan Lee

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)(信息通信技术规划与评估研究所(IITP)) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究零样本合成图像检索问题,提出直接合成学习方法DiCE-CIR,直接组合参考图像和编辑文本预测合成查询表示,用大语言模型自动构建训练样本,训练轻量级模块,实验表明其性能优且效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03865 2026-07-07 cs.RO cs.AI 新提交 57%

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching

通过递归校正、频率一致性和对比流匹配实现高保真一步生成视觉运动策略

Yuran Chen, Xinye Cai, Zhonglin Gong, Yang Huang

机构 * School of Safety Science and Engineering, Anhui University of Science and Technology(安徽理工大学安全科学与工程学院) State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学煤矿智能开采技术与装备国家重点实验室) School of Artificial Intelligence, Anhui University of Science and Technology(安徽理工大学人工智能学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究针对生成模型多步采样有延迟、一步加速方法有偏差等问题,提出含递归校正、频率一致性和对比流匹配三机制的框架,解决相关问题,实验显示该方法在低延迟下性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27794 2026-06-29 cs.CV 新提交 57%

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

文本作为照明:面向语言引导医学图像分割的空间对比度Retinex学习

Jian Shi, Cheng Zhen, Pingping Zhang, Rui Xu, Yanan Lv, Yili Ma, Huan Bi, Haojie Li, Huchuan Lu

机构 * School of Software Technology & DUT-RU International School of Information Science and Engineering, Dalian University of Technology(大连理工大学软件学院 & 大连理工大学-俄罗斯国际信息科学与工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) Central Hospital of Dalian University of Technology(大连理工大学中心医院) Cancer Hospital of Dalian University of Technology(大连理工大学肿瘤医院) College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出TIRNet框架,将文本嵌入作为语义照明调制特征,通过Retinex启发模块和对比损失实现语言与分割的精确对齐,在MosMedData+和QaTa-COV19数据集上取得最优性能。

Comments Aceepted by MICCAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20390 2026-06-26 cs.CV 新提交 57%

Geometry-Aware Superpixel Graph Transformer with Metadata for Skin Lesion Classification

几何感知超像素图变换器结合元数据用于皮肤病变分类

Muhammad Azeem, Tanveer Hussain, Amr Ahmed, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种基于区域的图学习框架,将病变建模为超像素图,利用几何边属性和元数据上下文节点,通过边缘感知图变换器实现多模态融合,在四个公开数据集上取得优于现有方法的分类性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22872 2026-06-23 cs.CV 新提交 57%

Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering

Fursee: 用于毛装身份检索与聚类的混合YOLO-DINOv3框架

Jundi Wu

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对毛装照片人工分类成本高的问题,提出三阶段混合框架Fursee,结合YOLO检测裁剪、ArcFace优化DINOv3嵌入和DBSCAN自动聚类,在检索与聚类任务上超越GPT5.5等主流多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21838 2026-06-23 cs.CV cs.LG 新提交 57%

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Neuromatch Boston University(波士顿大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 57%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17027 2026-06-16 cs.CV 新提交 57%

MeshLoom: Feed-Forward Non-Rigid Registration of Mesh Sequences

MeshLoom: 网格序列的前馈式非刚性配准

Jianqi Chen, Jiraphon Yenphraphai, Xiangjun Tang, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, Rameen Abdal

机构 * KAUST Saudi Arabia(沙特阿拉伯国王科技大学) Snap Inc. United States of America(Snap Inc. 美国) Purdue University United States of America(普渡大学 美国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出MeshLoom,一种前馈式配准网络,通过拓扑感知编码器-解码器直接重建网格序列的顶点变形,实现秒级多网格配准,并在非刚性配准任务上达到最先进水平,同时支持运动插值和网格变形。

Comments Project page: https://meshloom.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14941 2026-06-16 cs.AI 新提交 57%

Semantics-Enhanced Retrieval-Augmented Time Series Forecasting

语义增强的检索增强时间序列预测

Shiqiao Zhou, Zipeng Wu, Holger Schöner, Edouard Fouché, IAG Wilson, Shuo Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Montreal(蒙特利尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对非平稳性下仅靠时间序列相似性检索不足的问题,提出SERAF框架,通过双模态检索(时间序列及其自生成文本描述)联合利用历史模式,提升预测性能。

Comments Accepted to the ICML 2026 Workshop on Forecasting as a New Frontier of Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14078 2026-06-15 cs.LG cs.AI 新提交 57%

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

通过持续学习中的灾难性遗忘视角重新思考后门对抗性去学习

Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Key Laboratory of Media Security, Shenzhen University(深圳大学媒体安全深圳市重点实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文将后门学习与去学习建模为持续学习视角下的三阶段过程,基于灾难性遗忘机制推导完全后门去学习的必要条件,并提出盲反演-后门对抗性去学习(BI-BAU)方法,通过期望最大化算法优化最大后验目标,有效消除后门效应。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13427 2026-06-12 cs.CV 新提交 57%

VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits

VietFashion:面向文化服饰的草图-文本组合图像检索基准

Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出VietFashion基准,针对越南传统服饰奥黛,结合手绘草图和文本描述进行多目标检索,揭示现有方法在细粒度文化语义和跨模态组合上的不足。

Comments ICMR 2026. Project page: https://hng0303.github.io/VietFashion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 57%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07698 2026-06-09 cs.LG cs.AI 新提交 57%

Pharmacogenomic Knowledge Graph Augmentation for Graph Neural Network-Based Drug-Drug Interaction Prediction

基于图神经网络的药物相互作用预测的药理基因组学知识图谱增强

Juergen Dietrich

机构 * AI Solutions Berlin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过整合PharmGKB的药理基因组学先验知识(CYP酶注释)作为特征向量,增强图神经网络在药物相互作用预测中的性能,在配对数据划分下显著提升DDI类型分类,但未能突破信息天花板。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06524 2026-06-08 eess.IV cs.CV cs.LG 新提交 57%

Advanced Flood Prediction with Physics-Guided Deep Learning: Combining UNet, FNO, and SAR/Optical Imagery

基于物理引导深度学习的先进洪水预测:结合UNet、FNO与SAR/光学影像

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

机构 * National Center for Atmospheric Research (NCAR)(国家大气研究中心)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出物理引导深度学习框架,融合多模态遥感与浅水方程约束,通过UNet-FNO混合架构实现高精度洪水预测,IoU达0.82,F1达0.90。

Comments This paper has been accepted for publication in the Proceedings of the IEEE Radar Conference (RadarConf 2026). The final authenticated version will be available through IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17144 2026-08-19 cs.HC 新提交 50%

Health Inquiry with AI: How Empathetic Expression and Conversational Contexts Shape Users' Communicative Acts

AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为

Xi Zheng, Xuyu Yang, Can Liu, Yuhan Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。

Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14627 2026-08-18 eess.SP 新提交 50%

AI-Native 6G for Distributed Intelligence: Traffic Characteristics, Awareness, and AI Grid

面向分布式智能的AI原生6G:流量特性、感知与AI网格

Lopamudra Kundu, Xingqin Lin, Shuvo Chowdhury, Sree Sankar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 50%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15741 2026-08-18 cs.RO 新提交 50%

Some Modifications to Our End-to-End UAV Planner

对我们的端到端无人机规划器的若干改进

Junjie Lu, Bailing Tian

机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15624 2026-08-18 cs.IR 新提交 50%

Can Retrievers Find the Same Paper from Different Aspects? A Multi-Aspect Full-Paper Scientific Retrieval Benchmark

检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准

Yiyang Wei, Fang Guo, Qiji Zhou, Zhizhang Fu, Mengru Ding, Kai Yang, Yue Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08880 2026-08-11 cs.SE 新提交 50%

Fusing UI Structure & Semantics for Feature-Oriented App Screen Retrieval & Clustering

融合UI结构与语义的面向特征的应用屏幕检索与聚类

Arun Krishna Vajjala, Yanfu Yan, Ajay Krishna Vajjala, Shrunal Pothagoni, Denys Poshyvanyk, Kevin Moran

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。

Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04489 2026-08-06 quant-ph physics.app-ph physics.chem-ph 新提交 50%

Engineering Nanodiamonds for Quantum Sensing: Material Constraints at the Nanoscale

用于量子传感的纳米金刚石工程:纳米尺度下的材料约束

Ashutosh Rathi, Keisuke Oshimi, Kento Sasaki, Kensuke Kobayashi, Yutaka Shikano, Oliver Benson, Tim Schröder, Shery L. Y. Chang, Masazumi Fujiwara

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究聚焦纳米金刚石中氮-空位中心的材料约束机制,提出缓解策略,推动其作为移动量子传感器在生物传感与纳米尺度科学中的可靠应用。

Comments Published in ACS Nano under CC-BY 4.0

Journal ref ACS Nano 20, 17143 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 50%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 50%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25196 2026-07-29 cs.LG 新提交 50%

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展

Arnav Bendre, Guneesh Gupta, Kavish Grover, Chayan Aggarwal, Shreyansh Modi

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。

Comments 32 pages, 9 Figures, submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24760 2026-07-29 cs.IR 新提交 50%

CHaystack: Benchmarking Chinese Document Retrieval and VQA

CHaystack:中文文档检索与视觉问答基准测试

Hanxi Li

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21320 2026-07-24 math.LO 新提交 50%

Post Completeness in Conditional Logic

条件逻辑中的波斯特完全性

Giuliano Rosella, Yale Weiss

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文系统研究某些基本条件逻辑的波斯特完全扩张,确定了正则和正规的此类逻辑,证明相关嵌入定理类似结论,还表明某些基本条件逻辑有不可数多个扩张,其在条件规则下闭包放宽,对条件逻辑格结构及多模态逻辑有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17651 2026-07-21 cs.RO 新提交 50%

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

HCPG-Flow:用于流策略机器人操作的分层接触进展引导

Guanghu Xie, Mingxu Li, Shuo Zhang, Yonglong Zhang, Yifan Yang, Yang Liu, Zongwu Xie, Baoshi Cao

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人技术与系统国家重点实验室,哈尔滨工业大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究机器人操作流策略中动作选择问题,提出HCPG-Flow方法,通过分层、以对象为中心的接触进展引导增强SAC-Flow,在模拟和物理任务中提高成功率,减少完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 50%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏