arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2608.21133 2026-08-24 cs.CV cs.CR 新提交 83%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29667 2026-08-24 cs.CV cond-mat.mtrl-sci cs.AI 版本更新 81%

MatMMExtract: An Open-Source Pipeline for Panel-Level Extraction of Grounded Image-Text Pairs from Materials Science Literature

解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集

Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅塔家庭数据科学与人工智能学院) Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Department of Metallurgical and Materials Engineering(冶金与材料工程系)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

AI总结 针对科学文献中复合图像导致图文配对困难的问题,提出MatMMExtract管道,通过分解复合图、利用大语言模型生成结构化标注,构建包含39万对面板级图文对的MatSciFig数据集,并引入MaterialScope检测数据集和微调YOLO12检测器,显著提升视觉语言检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-08-24 cs.MM cs.AI cs.CV cs.GR 新提交 75%

When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Yangchen Zeng, Haoyu Wang, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20414 2026-08-24 cs.AI cs.CV 新提交 73%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 62%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21170 2026-08-24 cs.CV cs.AI 新提交 62%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17886 2026-08-24 cs.CV cs.CL 版本更新 62%

When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA

当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用

Pume Tuchinda, Parinthapat Pengpun, Romrawin Chumpu, Patomporn Payoungkhamdee, Sarana Nutanong, Peerat Limkonchotiwat

机构 * VISTEC Bangkok Christian International School(巴吞普林国际学校) AI Singapore(AI新加坡)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11055 2026-08-24 cs.CV 版本更新 57%

Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection

Crane:用于零样本异常检测的上下文引导提示学习与注意力优化

Alireza Salehi, Mohammadreza Salehi, Reshad Hosseini, Cees G. M. Snoek, Makoto Yamada, Mohammad Sabokrou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出基于CLIP的框架Crane,通过相关性注意力模块、上下文引导提示学习等改进零样本异常检测,在7个工业基准上显著提升图像级AP与像素级AUPRO,还衍生出更强变体Crane+。

Comments British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2512.17474 2026-08-24 eess.AS cs.SD 版本更新 89%

Benchmarking Commercial Speech Recognition and Multimodal Large Language Models on Dysarthric Speech: Severity-Stratified Baselines and Architecture-Specific Prompting Effects

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 eess.AS

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20387 2026-08-24 cs.CL cs.AI 新提交 62%

Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions

Poly-InstructTTS:基于开放式指令学习野外场景下的高表现力语音合成

Junhui Zhang, Qianhui Xu, Qingxiang Guo, Dawei Yang, Ling Miao, Qiangqiang Wang, Yang Song

机构 * ZuoYeBang Technology(作业帮科技)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有TTS模型难以通过自然语言指令控制细粒度表现力的问题,本文提出Poly-InstructTTS模型,构建1000小时指令标注语料库,采用多模态流水线等技术实现高表现力语音合成,相关成果可在项目页面获取。

Comments Accepted to Interspeech 2026. Demo page: this https URL (https://zhangjh915.github.io/PolyInstructTTS-demo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20433 2026-08-24 cs.RO cs.HC cs.MM cs.SD 新提交 57%

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

类人音乐机器人作为音乐诱发情绪研究的实验接口

Vincent K.M. Cheung, Jia-Yeu Lin

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Waseda University(早稻田大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。

Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20880 2026-08-24 cs.HC 新提交 50%

Live Artifacts: Authoring Dynamic Media via Live Layers Encapsulating Generative Specifications

动态制品:通过封装生成式规范的实时图层创作动态媒体

Leixian Shen, Haotian Li, Hugo Romat, Fanny Chevalier, Nicolai Marquardt, Nathalie Riche

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究定义了介于静态资源与交互式软件间的Live Artifacts,提出LiveCanvas创作系统,可让创作者通过视觉画布编排动态生成式制品,经评估能帮助用户从创作静态输出转向打造响应式生成式制品。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2608.21022 2026-08-24 cs.CV cs.MM 新提交 86%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21030 2026-08-24 cs.CV cs.CL cs.LG 新提交 81%

COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET:面向视频多模态大语言模型的对比运动增强时序推理

Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Sun Yat-Sen University(中山大学) Pingan Technology(平安科技)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 77%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 57%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20802 2026-08-24 cs.AI 新提交 57%

SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

SPARC:采用保形贝叶斯最后层的运动预测单通缩放方法

Sakif Hossain, Julian Teusch, Jörg P. Müller

机构 * Clausthal University of Technology (TU Clausthal)(克劳斯塔尔工业大学(克劳斯塔尔工业大学))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SPARC,一种贝叶斯-保形不确定性层,在9个数据集-协议模块上的NLL及MPJPE+NLL综合指标优于基线,可作为轻量风险监控工具。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20376 2026-08-24 cs.CL cs.LG 新提交 57%

TH-GNN: Heterogeneous Temporal Graph Neural Networks for LLM-Agent Shilling Attack Detection

TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络

Shivam Swarup, Divya Prakash Shrivastava, Rakesh Thakur

机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) Zayed University(扎耶德大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2608.20756 2026-08-24 cs.CV cs.AI 新提交 89%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20886 2026-08-24 cs.CV cs.LG 新提交 79%

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

EviRank:用于多模态图像重排序的结构化相关性证据

Enjun Du, Siyi Liu, Zirong Chen, Xinyu Zuo, Jinwen Luo, Ruiwen Tao, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态图像重排序器的不足,提出EviRank将查询解析为结构化证据包,通过证据条件验证实现重排序,在五个基准上达SOTA,蒸馏学生模型保留超90%能力且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-08-24 cs.IR cs.AI cs.CV cs.MM 版本更新 67%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Accepted by KDD'26 Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20840 2026-08-24 cs.IR cs.CV 新提交 57%

KoViDoRe: Korean Visual Document Retrieval

KoViDoRe:韩文视觉文档检索

Yongbin Choi, Yongwoo Song, Mujeen Sung

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有韩文视觉文档检索基准的不足,本文推出KoViDoRe基准及配套训练数据集Ko-VDR Train Public,评估发现现有模型难以处理该任务,为相关模型开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2608.20382 2026-08-24 cs.CL cs.CV 新提交 86%

Decoupled Vision-Language System for Multimodal Understanding and Generation

用于多模态理解与生成的解耦式视觉-语言系统

Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Li Auto(理想汽车)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出多模态大语言模型Libra的解耦式视觉-语言架构,通过开关注意力与FFN模块实现自模态与跨模态解耦,在理解与生成任务上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-08-24 cs.AI 新提交 83%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02507 2026-08-24 cond-mat.mtrl-sci cs.ET cs.LG physics.app-ph physics.comp-ph 版本更新 78%

Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design

迈向自动发现:逆向材料设计中生成模型、多模态学习与闭环工作流综述

Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * Institute of Condensed Matter and Nanosciences, Université Catholique de Louvain(凝聚态与纳米科学研究所,比利时列日-努瓦尔桑大学) WEL Research Institute(WEL研究机构)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文综述了逆向材料设计中生成晶体结构建模、多模态学习和闭环设计管道的最新进展,重点讨论了可行性约束与物理先验的施加方式、多模态融合策略以及多种逆向设计策略(如条件生成与潜在优化、贝叶斯优化、强化学习和主动学习),并指出了常见失败模式及基于分阶段报告的评估实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20809 2026-08-24 cs.CV cs.AI 新提交 62%

TRACE: Training-time Report-guided and Clinically Ordered Concept Editing

TRACE:训练时报告引导且临床有序的概念编辑

Wentao Yue, Tianyou Lai, Jiayu Luo, Qingyu Mao, Ziying Wang, Zhenyuan Ning, Qilei Li

机构 * Lanzhou University(兰州大学) Shenzhen University(深圳大学) Southern Medical University(南方医科大学) Central China Normal University(华中师范大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对乳腺超声诊断深度学习方法可解释性与鲁棒性不足的问题,提出训练时报告引导的TRACE框架,结合SCMT与BUSC基准,实现仅图像输入的高性能诊断与跨域鲁棒性提升。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20932 2026-08-24 cs.CV 新提交 57%

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

OccluRank:仅添加序数秩的可控遮挡感知布局到图像生成

Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出OccluRank框架,仅添加序数秩实现可控遮挡感知布局到图像生成,构建相关数据集与基准,实验表明其能可靠保留实例、遵循布局并实现期望遮挡关系,性能相当。

Comments 16 pages, 7 figures. Code: this https URL (https://github.com/Wenyang-hong/OccluRank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20383 2026-08-24 eess.SY cs.AI 新提交 57%

Infrared Hotspot-Guided Early Warning of Lithium-Ion Battery Thermal Runaway Under Mechanical Abuse

机械滥用下锂离子电池热失控的红外热点引导预警

Syed Sajid Ullah, Salman Khan, Muhammad Zunair Zamir

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对机械滥用下锂离子电池热失控预警问题,提出两阶段融合红外热点动态与多模态特征的方法,经实验验证可实现更早的预警与更高的ROC-AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-08-24 cs.CV 版本更新 57%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏