IceWatch: Forecasting Glacial Lake Outburst Floods (GLOFs) using Multimodal Deep Learning
IceWatch: 使用多模态深度学习预测冰湖溃决洪水(GLOFs)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 IceWatch通过多模态深度学习结合空间和时间视角,实现对冰湖溃决洪水的高效预测,提升预警系统的可靠性与实用性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
IceWatch: 使用多模态深度学习预测冰湖溃决洪水(GLOFs)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 IceWatch通过多模态深度学习结合空间和时间视角,实现对冰湖溃决洪水的高效预测,提升预警系统的可靠性与实用性。
DAOS: 一种基于驾驶员行为与物体协同的多模态舱内行为监测数据集
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) ; College of Computer Science and Technology, Harbin Engineering University(哈尔滨工程大学计算机科学与技术学院) ; Singapore University of Technology and Design (SUTD), Singapore(新加坡科技设计大学) ; Continental Automotive Singapore Pte. Ltd.
专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV
AI总结 DAOS数据集通过多模态数据和动作-物体关系网络提升驾驶员行为识别的准确性与鲁棒性。
GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) ; School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。
基于图像-语言基础模型的图像到视频迁移学习:全面综述
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。
Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer
OmniTransfer: 一种用于时空视频转换的综合框架
机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。
Comments Github Page: https://pangzecheung.github.io/OmniTransfer/
ActAvatar: 时空感知的精确动作控制用于对话虚拟角色
机构 * Renmin University of China(中国人民大学) ; Tencent Hunyuan(腾讯文yne) ; Tsinghua University(清华大学)
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV
AI总结 ActAvatar通过文本引导实现对话虚拟角色的相位级动作控制,引入相位感知交叉注意力、渐进式音频-视觉对齐和双阶段训练策略,提升动作控制精度和视觉质量。
Comments Project Page: https://ziqiaopeng.github.io/ActAvatar/
当规则不足时:基于智能体的短视频平台新兴内容问题发现
机构 * TikTok Inc.(TikTok公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出基于多模态大语言模型智能体的自动问题发现方法,有效提升短视频平台新兴内容问题的发现与治理效率。
集成的纳米电光机械脉冲神经元
专题命中 视频多模态 :multimodal(abstract)
AI总结 该研究展示了一种集成纳米电光机械脉冲神经元,实现高效数据处理与多模功能,适用于低延迟边缘计算和脑启发光学机械计算。
Comments 4 figures
Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。
思考后再嵌入:生成性上下文提升多模态嵌入
机构 * AI at Meta(Meta人工智能部门) ; University of Central Florida(中央佛罗里达大学) ; New York University(纽约大学)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本研究提出Think-Then-Embed框架,通过生成性推理提升多模态嵌入性能,实现更高效的复杂指令处理。
语义一致的双向对比哈希用于噪声多标签跨模态检索
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出语义一致的双向对比哈希方法,通过跨模态语义一致性分类和双向软对比哈希模块,有效应对多标签数据中的噪声问题,提升跨模态检索的鲁棒性与性能。
面向低功耗边缘平台的实时多模态嵌入视觉框架:用于目标检测、面部情绪识别和生物识别
机构 * 1,2Department of Mechatronics Engineering, Rajshahi University of Engineering \& Technology 3 ,4,5Department of Internet of Things ; Robotics Engineering, University of Frontier Technology, Bangladesh 6Department of Computer Science ; Engineering, Varendra University, Rajshahi, Bangladesh 7Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh Emails: , , 3
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出了一种面向低功耗边缘平台的实时多模态视觉框架,通过自适应调度机制整合目标检测、面部识别和情绪检测,提升边缘设备上的智能感知效率与隐私保护。
一种多模态辅助系统,用于帮助盲人或低视力者进行产品定位与检索
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文提出一种多模态辅助系统,通过目标检测与视觉-语言模型结合,帮助盲人或低视力者自主完成产品定位与检索,提升其自主性和控制感。
基于大语言模型的可干预多模态适配器用于肺癌手术后并发症预测
机构 * University at Buffalo(布法罗大学) ; Roswell Park Comprehensive Cancer Center(罗斯威尔帕克综合癌症中心)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI
AI总结 MIRACLE通过整合术前临床和放射学数据,利用超球面嵌入空间和干预式深度学习模块,实现肺癌手术后并发症风险的预测与可解释性管理。
Comments Accepted to P2P-CV @ WACV 2026
ManipShield: 一种用于图像篡改检测、定位和解释的统一框架
机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; University of Electronic and Science Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。
NewsRECON: 用于图像上下文化的新闻文章检索
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(通用知识处理实验室(UKP实验室)、计算机科学系、图恩大学(TU Darmstadt)和应用网络安全国家研究中心ATHENE) ; Department of Electrical Engineering, KU Leuven(电气工程系、鲁汶大学) ; Department of Computer Science, KU Leuven(计算机科学系、鲁汶大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 NewsRECON通过链接图像与相关新闻文章,利用元数据推断图像日期和位置,优于现有方法并结合多模态大语言模型实现新的SOTA结果。
Comments Preprint under review. Code available at https://github.com/jtonglet/arxiv2025-newsrecon
细粒度零样本组合图像检索与互补视觉-语义整合
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Zhejiang University(浙江大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出CVSI方法,通过互补视觉-语义整合提升细粒度零样本组合图像检索性能。
基于检索增强语言模型的统一变分填补框架用于电动汽车充电数据
机构 * Department of Data Science and AI, Faculty of IT and Monash Energy Institute, Monash University(数据科学与人工智能系,信息科技学院和莫纳什能源研究所,莫纳什大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文提出PRAIM框架,利用检索增强语言模型和变分神经架构,提升电动汽车充电数据填补的准确性和统计分布保留能力,从而提高预测性能。
Comments 15 pages
Journal ref IEEE Transactions on Smart Grid, 2026
GenView++:统一自适应生成增强和质量驱动监督以实现对比表征学习
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 GenView++通过自适应生成增强和质量驱动监督,提升对比学习在视觉和视觉-语言任务中的性能。
Comments The code is available at \url{https://github.com/xiaojieli0903/GenViewPlusPlus}
SMc2f: 从粗到细的机器人自主性鲁棒场景挖掘
机构 * Department of Computer Science at Xi’an University of Technology(西安理工大学计算机科学系) ; department of Computer Science & Engineering at the University of California, Merced(加州大学默塞德分校计算机科学与工程系)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 SMc2f通过从粗到细的流程,利用视觉语言模型和文本-轨迹对比学习提升机器人场景挖掘的鲁棒性和效率。
多模态奖励基准2:评估多模态奖励模型用于交错文本和图像
机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。
Comments Code and data available at https://github.com/facebookresearch/MMRB2
基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习
机构 * Marvin Ridge High School(马文岭高中)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。
Comments 19 pages, 10 figures
多模态空间组学:从数据获取到计算整合
专题命中 多模态生成 :multimodal(title,abstract)
AI总结 本文综述了多模态空间组学数据整合的计算方法,涵盖从概率模型到深度学习的多种算法原理,以整合不同分子层和图像数据。
一种高效且多模态的导航系统与一步世界模型
机构 * Tsinghua University(清华大学) ; Xiaomi (China)(小米(中国))
专题命中 多模态生成 :multi-modal(title,abstract)
AI总结 本文提出了一种高效多模态导航系统,通过一步世界模型和3D U-Net骨干网络,提升导航效率和鲁棒性。
探索通用型自主多模态代理用于病理报告生成
专题命中 多模态生成 :multimodal(title,abstract)
AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。
Comments 6 pages, 1 figure, accepted paper for BVM 2026
Journal ref BVM 2026, https://bvm-conf.org
弥合模态:联合合成与配准框架用于对齐扩散磁共振成像与T1加权图像
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Brigham and Women’s Hospital(布里奇沃特医院) ; Harvard Medical School(哈佛医学院)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种基于生成配准网络的无监督框架,通过图像合成和变形场学习,提升扩散MRI与T1加权图像的配准精度。
推动扩散语言模型及其变体未来发展的十大开放挑战
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; Peking University(北京大学) ; Huawei Technologies(华为技术有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出推动扩散语言模型及其变体发展的十大挑战,并提出以多尺度标记化、主动遮罩和潜在思考为核心的四支柱战略路线图,旨在突破因果瓶颈,实现复杂结构推理和多模态整合。
虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。
大规模人工智能模型用于无线物理层
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) ; National Mobile Communications Research Laboratory, Southeast University(国家移动通信研究中心,东南大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文提出利用大规模人工智能模型改进无线物理层通信,通过预训练模型和专用模型策略提升性能与适应性,并探讨未来研究方向。
Comments A collection of paper on Large AI Models for wireless physical layer can be found at https://github.com/AI4Wireless/LAM4PHY_6G
DomainCQA: 从领域特定图表中构建知识密集型问答
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。
Comments 83 pages, 59 figures