Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources
多模态气候虚假信息检测:整合视觉-语言模型与外部知识源
机构 * CRIM
专题命中 图文多模态 :multimodal(title);分类 cs.AI
AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态气候虚假信息检测:整合视觉-语言模型与外部知识源
机构 * CRIM
专题命中 图文多模态 :multimodal(title);分类 cs.AI
AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。
为大型视觉-语言模型设计对抗输入使用黑盒优化
机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) ; School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。
Comments EACL
基于自然语言的火星地表全球映射
机构 * School of Science, Southern University of Science and Technology(南方科技大学科学学院) ; China University of Geosciences(中国地质大学) ; University of Hong Kong(香港大学) ; Hubei Key Laboratory of Planetary Geology, China University of Geosciences(湖北省行星地质重点实验室,中国地质大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 MarScope通过自然语言驱动的视觉-语言框架,实现了火星地表的全球映射,实现了高效、灵活的地质分析和大规模数据探索。
关注式AV融合网络:基于混合注意力的音频-视觉质量预测
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS
AI总结 本文提出一种结合学习音频特征和手工设计视频特征的混合注意力模型,用于提升音频-视觉质量预测的准确性和鲁棒性。
Comments Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026
TeleMem: 构建面向代理AI的长期和多模态记忆
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。
VIOLA:迈向最小标注的视频情境学习
机构 * Keio University(Keio大学) ; Keio AI Research Center(Keio人工智能研究中心) ; NVIDIA(NVIDIA公司)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。
Event-VStream: 基于事件驱动的长视频流实时理解
机构 * University of Houston(德克萨斯大学休斯顿分校) ; The University of Texas at Arlington(德克萨斯理工大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Temple University(特拉华大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。
多事件视频-文本检索
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Oxford(牛津大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。
Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally
从单一视角进行多层推理以学习透视抓取
机构 * Southern University of Science and Technology(南方科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究提出了一种基于视觉的透视感知架构,通过单一视觉输入实现多模态感知,无需外部摄像头或力传感器即可学习反应抓取。
Comments 39 pages, 13 figures, 2 tables, for supplementary videos, see https://bionicdl.ancorasir.com/?p=1658, for opensourced codes, see https://github.com/ancorasir/SeeThruFinger
无止境的进化:统一多模态增量学习以实现持续全景感知
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种统一多模态和多任务持续学习的持续全景感知模型,通过跨模态编码器和可变知识继承模块解决灾难性遗忘问题,并在多任务增量场景中实现模型进化。
Comments arXiv admin note: substantial text overlap with arXiv:2407.14242
ExDR:基于解释的动态检索增强多模态虚假新闻检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; WeChat AI, Tencent(微信AI,腾讯)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 ExDR通过基于解释的动态检索增强生成框架,提升多模态虚假新闻检测的准确性和泛化能力。
Comments 11 pages, 3 figures, 7 tables
通过嵌套多模态对比学习进行皮肤病变表型分析
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.AI
AI总结 SLIMP通过嵌套多模态对比学习,结合图像与元数据提升皮肤病变分类性能。
重新思考组合图像检索评估:从图像编辑中获得的细粒度基准
机构 * CASIA(中国科学院自动化研究所) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; UCAS(中国科学院大学) ; HKUST(GZ)(香港科技大学(广州)) ; NTU(国立新加坡大学) ; Yale(耶鲁大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。
Comments Under review
异质不确定性引导的复合图像检索与细粒度概率学习
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出异质不确定性引导范式,通过细粒度概率学习提升复合图像检索的鲁棒性和准确性。
Comments Accepted for publication and oral presentation at AAAI 2026
认知AI框架2.0:人类思维模拟的进展
专题命中 跨模态检索 :multimodal(abstract)
AI总结 认知AI框架2.0通过统一的记忆架构和受控的知识更新,提升人机交互的个性化与适应性,解决可扩展性、偏见缓解和伦理合规等挑战。
揭开黑箱:多模态基础模型中情感建模的初步洞察
机构 * Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学) ; Tsinghua University, Beijing, China(清华大学)
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV
AI总结 本研究揭示多模态基础模型中情感建模的关键机制,发现前馈门控投影模块对情感理解和生成至关重要,通过参数高效调整实现高性能。
超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。
Skywork UniPic 2.0: 通过在线强化学习构建 Kontext 模型以实现统一多模态模型
机构 * Skywork Multimodality Team(Skywork多模态团队)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Skywork UniPic 2.0 通过在线强化学习构建 Kontext 模型,实现统一多模态模型,提升图像生成与编辑能力。
GeMM-GAN: 一种基于组织病理图像和临床描述的多模态生成模型,用于基因表达谱生成
专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI
AI总结 GeMM-GAN通过结合图像和文本信息生成逼真的基因表达谱,提升疾病预测准确性。
Comments 12 pages, 2 figures. Published at Image Analysis and Processing - ICIAP 2025 Workshops
可解释的深度伪造检测与强化学习增强的自混合图像
机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。
Comments Accepted at ICASSP 2026
PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试
机构 * Peking University(北京大学) ; Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学) ; Hong Kong Polytechnic University(香港理工大学) ; City University of Hong Kong(香港城市大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。
Skywork UniPic 3.0:通过序列建模实现统一的多图像合成
机构 * Skywork
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Skywork UniPic 3.0通过序列建模实现统一的多图像合成,采用新颖的训练范式和高效的数据流程,在单图像编辑和多图像合成任务中均取得优异性能。
通过表征自编码器扩展文本到图像扩散变换器
机构 * New York University(纽约大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。
Comments website: https://rae-dit.github.io/scale-rae/
PAINT: 用于虚拟免疫组化病理学的路径感知集成下尺度转换
机构 * School of Computer Science and Engineering, Northwestern Polytechnical University(计算机科学与工程学院,西北工业大学) ; Monash University(墨尔本大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 PAINT通过结构优先的自回归框架,提升虚拟免疫组化合成的结构保真度和临床应用效果。
DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散
机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。
Comments 8 pages, 5 figures
MapViT:一种基于视觉Transformer的两阶段框架,用于动态环境中实时无线电质量地图预测
机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) ; NEC Laboratories Europe(NEC欧洲实验室) ; i2CAT Foundation(i2CAT基金会) ; Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构(ICREA))
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 MapViT通过两阶段ViT框架实现实时动态环境中无线信号质量预测,结合预训练和微调方法提升准确性和效率,适用于资源受限的移动机器人场景。
Comments This paper has been accepted for publication at IEEE International Conference on Communications (ICC) 2026
谱生成流模型:一种受物理启发的向量大语言模型替代方案
机构 * UC Berkeley(伯克利大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。
MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统
机构 * ABB Inc(ABB公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。
Comments 12 pages, 2 figures, Submitted to ACL
感知挑战:多模态大语言模型能否解决简单感知问题?
机构 * IIT Delhi(德里印度理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。
Chat-TS: 提升时间序列与自然语言数据的多模态推理能力
机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) ; Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) ; Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。