Video-FLAIR: Not Whether to Reason, But How
Video-FLAIR:不是是否推理,而是如何推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Video-FLAIR:不是是否推理,而是如何推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。
用于可扩展强化学习的简单演员与深度评论家
机构 * Sungkyunkwan University(成均馆大学) ; Soongsil University(崇实大学)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出LAC算法,将容量分配给深度评论家而非简单演员,解决离线RL中加深评论家的三种失效模式,在OGBench上实现与强基线相当性能且推理延迟最高降4倍。
Comments Accepted at CIKM 2026
结合谱分解的微视频推荐偏好流匹配方法
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究针对微视频推荐中主流方法的语义动态纠缠与流匹配模型忽略时间结构的问题,提出PrismRec框架,通过谱语义分解和上下文校准偏好匹配,在四个数据集上较SOTA提升最高22.65%且效率更优。
UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。
循环机制与Transformer结合的通用多模态检索模型
机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。
Comments TPAMI 2026
AI如何体验艺术:自监督多模态嵌入空间中的涌现审美结构
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 该研究提出自监督多模态嵌入框架,在无显式标签的情况下发现AI的审美结构,探讨其与人类情感标签的差异,可应用于RAG媒体组织与自动标注等场景。
Comments Accepted at ICMI Companion '26 (Companion Publication of the 28th ACM International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 4 figures, 2 tables
Case2Flow:通过多模态检索连接患者病例与指南流程图
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; University Hospital Essen(埃森大学医院)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究提出Case2Flow任务,构建含202份流程图的FlowAtlas语料库,提出无需训练的CRISP方法优化多模态检索,提升Recall@1达18.71个百分点,为病例匹配指南流程图提供可行方案。
Comments Accepted by EMNLP 2026 Main
基于图的伪多模态对比学习用于12导联心电图表征
机构 * Yokohama National University(横滨国立大学) ; Yokohama City University Medical Center(横滨市立大学医学中心) ; Fukuda Denshi Co.,Ltd(福田电子株式会社)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对现有12导联ECG分析方法难以捕捉导联间依赖与全局模式的问题,提出Graph-CMMC框架,通过将ECG波形转换为GADF图像构建伪多模态表征,结合图关系模块建模导联间依赖,在冠状动脉闭塞分类任务上取得了有竞争力的性能。
Comments 7 pages, 7 figures. Presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)
Mol-JEPA:用于分子的多模态联合嵌入预测架构
机构 * University of Tübingen(蒂宾根大学) ; Boehringer Ingelheim(勃林格殷格翰) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学)
专题命中 跨模态检索 :multimodal(title);分类 cs.AI
AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。
激活异常值很重要:量化多模态大语言模型的鲁棒恢复
机构 * Huawei(华为)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。
Comments 14 Pages, 5 figures, 5 tables
RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Alibaba DAMO Academy(阿里巴巴达摩院)
专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。
Comments Accepted to EMNLP 2026 Main Conference
面向扩散多模态大语言模型的视觉信息引导并行解码
机构 * Seoul National University(首尔大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)
Multi2AV-Safety:多模态到音视频生成的安全性基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Hefei University of Technology(合肥工业大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。
HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Shenzhen University(深圳大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Pengcheng Laboratory(鹏城实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Trento(特伦托大学) ; Huawei(华为)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。
基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) ; Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。
基于动态线路生成的综合多模式交通网络设计
专题命中 多模态生成 :multi-modal(title,abstract)
AI总结 该研究提出统一优化框架,通过列生成启发式方案联合设计多模式交通的线路、频率与按需出行段,在波士顿、芝加哥数据集上较基准方案显著提升乘客量。
信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交
机构 * Fuzhou University(福州大学) ; Jilin University(吉林大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL
AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。
Comments Accepted to Findings of EMNLP 2026
多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。
以视觉为中心的生成式AI模型:软硬件视角
机构 * The University of Edinburgh(爱丁堡大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。
DEEPCHART:大型语言模型在忠实的数据科学图表生成方面存在多大差距?
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 该研究推出专家标注的DEEPCHART基准,将图表生成分为提取-推理-可视化流程,发现现有LLMs生成的图表常隐藏数据幻觉,仅靠大上下文窗口无法实现忠实图表生成,需可靠的证据提取与定量推理。
面向高效扩散大语言模型推理的依赖感知可撤销解码
机构 * Seoul National University(首尔大学) ; Sungkyunkwan University(成均馆大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。
手术视频生成:从扩散模型到世界模型:综述
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。
Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)
用于电池 prognostics 与健康管理的大模型:综述与未来路线图
机构 * School of Physics and Astronomy, The University of Edinburgh(爱丁堡大学物理与天文学院) ; City University of Hong Kong(香港城市大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本综述首次全面调研大模型在电池 prognostics 与健康管理(BPHM)中的应用,阐明其基础技术、解决的领域挑战,提出未来研究路线图,为开发下一代自主电池管理系统提供见解。
Comments Published in Renewable and Sustainable Energy Reviews
Chart2SVG:从栅格图表图像生成可编辑的SVG
机构 * Renmin University of China(中国人民大学) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Shandong University(山东大学) ; Microsoft Research(微软研究院) ; Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) ; University of Technology Sydney(悉尼科技大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。
用于鲁棒跨数据集图像分类的MLLM路由异质集成模型
机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) ; University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。
Comments 15 pages (single column), 4 figures, 7 tables
PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。
Comments to appear in EMNLP 2026
从推理到像素:用于VQA和分割的接地医学多模态大语言模型
机构 * Nanjing University of Science and Technology(南京理工大学) ; Sungkyunkwan University(成均馆大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。
Comments accepted by ECCV 2026
CODE:面向开放世界目标检测的跨模态校准与动态抑制
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 本文针对开放世界目标检测的语义歧义与过度抑制问题,提出含三个互补组件的CODE框架,在真实世界检测基准上超越此前最优方法。
Comments Accepted by ACM Multimedia 2026 (MM '26)
被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态评测 :MLLM(title,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。
Comments 17 pages, 3 figures, 5 tables