HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents
HKRAG:面向视觉丰富文档的综合知识检索增强生成
专题命中 跨模态检索 :multimodal(abstract)
AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
HKRAG:面向视觉丰富文档的综合知识检索增强生成
专题命中 跨模态检索 :multimodal(abstract)
AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。
HBridge: 通过非对称H形架构桥接异构专家以实现统一的多模态理解和生成
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 HBridge通过非对称H形架构,优化异构专家的模态先验利用,提升多模态生成效率与质量。
通过语言代理进行多模态数据探索
机构 * Zurich University of Applied Sciences(瑞士应用科学大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上
Comments Accepted to the IJCNLP AACL 2025 Findings
多模态生成式AI:多模态大语言模型、扩散模型与统一
机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。
Comments 21 pages, 10 figures, 3 tables
Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025
从生成到检测:一个多模态多任务数据集用于基准测试健康误信息
机构 * Macquarie University(麦考瑞大学) ; University of Sydney(悉尼大学) ; UTS(UTS大学) ; MBZUAI
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出MM Health数据集,包含人类和AI生成的多模态健康误信息,用于基准测试可靠性检查、原创性检查和细粒度AI检测。
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 24245-24260, 2025
校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。
Comments Code at https://github.com/BienLuky/Rectified-SpaAttn
生成式AI用于动画:一种调查
机构 * University of Rochester(罗切斯特大学) ; UCSB ; University of Oxford(牛津大学) ; CMU(卡内基梅隆大学) ; Purdue University(普渡大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文调查生成式AI如何通过自动化任务革新传统动画流程,降低技术门槛,扩大创作者群体,并促进艺术创新。
Comments Accepted by ICCV 2025 AISTORY Workshop
通过VLM引导的迭代自优化提升物理导向的视频生成
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。
Comments ICCV 2025 Physics-IQ Challenge Third Place Solution
MovieDreamer:用于生成连贯长视觉序列的分层生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。
Comments 30 pages, 22 figures
VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习
机构 * Peking University(北京大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。
MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准
机构 * ETH Zürich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; HUG
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。
Comments Accepted to NeurIPS 2025
多领域泛化用于全球光伏评估的多模态大语言模型
机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。
Comments 5 pages, 7 figures
通过解构多模态表示量化模态贡献
机构 * PES University(PES大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于部分信息分解的框架,通过分解多模态表示中的预测信息,量化各模态的贡献,提供更清晰的多模态行为分析。
Comments 16 pages, 11 figures
超越关系:基于语义的多模态分析与LLM原生查询优化
机构 * Zhejiang University(浙江大学) ; Aalborg University(奥胡斯大学)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI
AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。
OncoVision:通过注意力驱动的多模态AI整合乳腺X线和临床数据以提升乳腺癌诊断
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 OncoVision通过注意力驱动的多模态AI整合乳腺X线和临床数据,提升乳腺癌诊断的准确性和实用性。
基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习
机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) ; Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。
Comments Submitted to Neurocomputing
多模光学成像平台用于定量烧伤评估
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 本文提出了一种多模光学成像平台,结合高光谱成像与激光散斑成像,用于快速准确评估烧伤严重程度,适用于战场等恶劣环境。
4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Beijing Zhongguancun Academy(北京中关村学院)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。
基于Mamba的深度学习方法用于无线多模态可穿戴系统中的睡眠分期(无脑电图)
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出基于Mamba的深度学习方法,用于无脑电图的无线多模态可穿戴系统中实现睡眠分期,通过整合多种生物信号提升睡眠阶段识别的准确性。
Comments 40 pages, 24 figures. Authors Andrew H. Zhang, Alex He-Mo, and Richard Fei Yin contributed equally
GazeProphetV2:基于头部运动的注视预测,实现移动VR中的高效视网膜渲染
机构 * PES University(PES大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 GazeProphetV2通过结合头部运动和视觉信息,提升移动VR中的注视预测准确性,为高效视网膜渲染和用户体验优化提供新方法。
MedROV:面向跨多种医学影像模态的实时开放词汇检测
机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MedROV是首个实时开放词汇医学影像检测模型,通过大规模数据集和伪标签策略提升检测性能,实现40 mAP50的提升并达到70 FPS的实时处理速度。
LungEvaty: 一种可扩展、开源的基于Transformer的深度学习模型,用于LDCT筛查中的肺癌风险预测
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; TUM University Hospital(慕尼黑技术大学医院) ; Imperial College London(伦敦帝国学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 LungEvaty是一种基于Transformer的深度学习模型,利用LDCT扫描预测肺癌风险,通过全肺输入和解剖学指导注意力实现高效且准确的预测。
IndEgo:工业场景及协作工作的人际助理数据集
机构 * Fraunhofer IPK(弗劳恩霍夫研究所) ; Technical University of Berlin(柏林技术大学) ; University of Tübingen(图宾根大学) ; RWTH Aachen University(亚琛工业大学) ; Leibniz University Hannover(汉诺威莱布尼茨大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 IndEgo数据集旨在通过工业场景中的协作工作提升人机交互助理的多模态理解与错误检测能力。
Comments Accepted to NeurIPS 2025 D&B Track. Project Page: https://indego-dataset.github.io/
VidComposition: MLLMs能否分析编译视频中的构成?
机构 * University of Rochester(罗切斯特大学) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。
Comments Accepted to CVPR 2025
VQ-VA世界:迈向高质量的视觉问题-视觉回答
专题命中 多模态评测 :image-text(abstract);分类 cs.CV
AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。
ADNet: 一个大规模且可扩展的多领域异常检测基准,涵盖380个现实世界类别
机构 * Communication University of China(中国通信大学) ; DZ Matrix(DZ矩阵) ; Tsinghua University(清华大学) ; Hunan University(湖南大学) ; Central South University(中南大学) ; UNSW Sydney(新南威尔士大学悉尼分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 ADNet是一个大规模多领域异常检测基准,涵盖380个现实世界类别,通过多模态数据支持异常检测研究。
深度隐式认知促进可靠推理链推理
机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。
Comments This paper has been accepted by AAAI-26
大型语言模型在论证挖掘中的应用:综述
机构 * University of Manchester(曼彻斯特大学) ; Imperial College London(伦敦帝国学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。
Comments Work draft
MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准
机构 * University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。
Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5
OceanGym: 一个用于水下具身智能体的基准环境
专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。
Comments Work in progress