arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 109 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

2608.26495 2026-08-28 cs.CV 新提交 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26659 2026-08-28 cs.LG 新提交 50%

Simple Actors and Deep Critics for Scalable Reinforcement Learning

用于可扩展强化学习的简单演员与深度评论家

Guhyeon Kang, Jaehwi Lee, Minhae Kwon

机构 * Sungkyunkwan University(成均馆大学) Soongsil University(崇实大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出LAC算法,将容量分配给深度评论家而非简单演员,解决离线RL中加深评论家的三种失效模式,在OGBench上实现与强基线相当性能且推理延迟最高降4倍。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26579 2026-08-28 cs.IR 新提交 50%

Preference Flow Matching with Spectral Factorization for Micro-video Recommendation

结合谱分解的微视频推荐偏好流匹配方法

Xinxin Dong, Haokai Ma, Fei Hu, YuZe Zheng, Bin Wu, Yonghui Yang, Xiaodong Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对微视频推荐中主流方法的语义动态纠缠与流匹配模型忽略时间结构的问题,提出PrismRec框架,通过谱语义分解和上下文校准偏好匹配,在四个数据集上较SOTA提升最高22.65%且效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21686 2026-08-28 cs.HC 版本更新 50%

UrbanGazeVis: A Visualization System for Analyzing Eye-Tracking Data on Urban Safety Perception

UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统

Andres De La Puente, Luis Sante, Felipe Moreno-Vera, Mauro Diaz, Jorge Poco

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 5 篇

2509.08897 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 85%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27121 2026-08-28 cs.MM cs.CV cs.LG 新提交 84%

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space

AI如何体验艺术:自监督多模态嵌入空间中的涌现审美结构

Corey D.C. Heath

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出自监督多模态嵌入框架,在无显式标签的情况下发现AI的审美结构,探讨其与人类情感标签的差异,可应用于RAG媒体组织与自动标注等场景。

Comments Accepted at ICMI Companion '26 (Companion Publication of the 28th ACM International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26414 2026-08-28 cs.CL cs.IR 新提交 79%

Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval

Case2Flow:通过多模态检索连接患者病例与指南流程图

Jiale Wei, Yufan Chen, Alexander Jaus, Zdravko Marinov, Julian Friedrich, Simon Reiß, Jens Kleesiek, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Hospital Essen(埃森大学医院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究提出Case2Flow任务,构建含202份流程图的FlowAtlas语料库,提出无需训练的CRISP方法优化多模态检索,提升Recall@1达18.71个百分点,为病例匹配指南流程图提供可行方案。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26964 2026-08-28 cs.LG 新提交 78%

Graph-Based Pseudo-multimodal Contrastive Learning for 12-Lead ECG Representations

基于图的伪多模态对比学习用于12导联心电图表征

Mengyu Wang, Kozo Okada, Takafumi Goto, Natsuko Jinba, Hiroki Yamaya, Kiyoshi Hibi, Tomoki Hamagami

机构 * Yokohama National University(横滨国立大学) Yokohama City University Medical Center(横滨市立大学医学中心) Fukuda Denshi Co.,Ltd(福田电子株式会社)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对现有12导联ECG分析方法难以捕捉导联间依赖与全局模式的问题,提出Graph-CMMC框架,通过将ECG波形转换为GADF图像构建伪多模态表征,结合图关系模块建模导联间依赖,在冠状动脉闭塞分类任务上取得了有竞争力的性能。

Comments 7 pages, 7 figures. Presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-28 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 16 篇

2608.26581 2026-08-28 cs.LG 新提交 87%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-08-28 cs.CV 新提交 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 81%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 80%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26535 2026-08-28 cs.AI 新提交 79%

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Multi2AV-Safety:多模态到音视频生成的安全性基准测试

Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26517 2026-08-28 cs.CV 新提交 79%

HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence

HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准

Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Tongji University(同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Trento(特伦托大学) Huawei(华为)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26476 2026-08-28 cs.CV 新提交 79%

Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References

基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强

Cong Cao, Huanjing Yue, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26444 2026-08-28 math.OC 新提交 78%

Integrated Multi-Modal Transit Network Design via Dynamic Line Generation

基于动态线路生成的综合多模式交通网络设计

Ning Duan, Oktay Günlük, Samitha Samaranayake

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 该研究提出统一优化框架,通过列生成启发式方案联合设计多模式交通的线路、频率与按需出行段,在波士顿、芝加哥数据集上较基准方案显著提升乘客量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 77%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-08-28 cs.CV cs.AI 版本更新 73%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27199 2026-08-28 cs.CV cs.AR 新提交 57%

Vision-centric generative AI models: A software-hardware perspective

以视觉为中心的生成式AI模型:软硬件视角

Eleni Tselepi, Cristian Sestito, Shady Agwa, Themis Prodromakis

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26757 2026-08-28 cs.AI 新提交 57%

DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?

DEEPCHART:大型语言模型在忠实的数据科学图表生成方面存在多大差距?

Jiahui tang, Kuicai Dong, Dexun Li, Hongchao Gu, Haocheng Yu, Wei Han, Chen Zhang, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出专家标注的DEEPCHART基准,将图表生成分为提取-推理-可视化流程,发现现有LLMs生成的图表常隐藏数据幻觉,仅靠大上下文窗口无法实现忠实图表生成,需可靠的证据提取与定量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26574 2026-08-28 cs.CL 新提交 57%

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

面向高效扩散大语言模型推理的依赖感知可撤销解码

Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 57%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26111 2026-08-28 cs.AI 新提交 57%

Large Models for Battery Prognostics and Health Management: A Review and Future Roadmap

用于电池 prognostics 与健康管理的大模型:综述与未来路线图

Jiale Liu, Huan Wang, Weicheng Wang, Rong Zhu, Qiqi Wang, Min Xie

机构 * School of Physics and Astronomy, The University of Edinburgh(爱丁堡大学物理与天文学院) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本综述首次全面调研大模型在电池 prognostics 与健康管理(BPHM)中的应用,阐明其基础技术、解决的领域挑战,提出未来研究路线图,为开发下一代自主电池管理系统提供见解。

Comments Published in Renewable and Sustainable Energy Reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26544 2026-08-28 cs.LG 新提交 50%

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 24 篇

2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-08-28 cs.CR cs.AI cs.CV 版本更新 91%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26856 2026-08-28 cs.CV cs.AI 新提交 86%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27214 2026-08-28 cs.CV 新提交 85%

CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection

CODE:面向开放世界目标检测的跨模态校准与动态抑制

Hao Xu, Zhaoning Shi, Hehe Jin, Bo Ma

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文针对开放世界目标检测的语义歧义与过度抑制问题,提出含三个互补组件的CODE框架,在真实世界检测基准上超越此前最优方法。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 84%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :MLLM(title,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏