Diffusion-Driven State Space Models
扩散驱动的状态空间模型
机构 * Montana State University(蒙塔纳州立大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。
Comments Accepted to ProbML 2026 Workshop Track
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
扩散驱动的状态空间模型
机构 * Montana State University(蒙塔纳州立大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。
Comments Accepted to ProbML 2026 Workshop Track
CoRDE:面向机器人操作结构泛化的概念先验路由扩散专家
机构 * College of Information Science and Technology, Eastern Institute of Technology, Ningbo(宁波东方理工大学(暂名)信息科学与技术学院) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo(浙江省工业智能与数字孪生重点实验室,宁波东方理工大学(暂名)) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) ; Faculty of Science and Engineering, University of Nottingham Ningbo China(宁波诺丁汉大学理工学院)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出CoRDE框架,通过概念先验引导路由和低秩专家池,解决扩散模型在多任务长时程操作中的结构泛化不足和路由崩溃问题。
Comments 8 pages, 3 figures, Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。
智能感知,更优思考:面向下一代网络的边缘感知
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。
通过先验映射协同进化训练扩散策略
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; CFAR Agency for Science Technology and Research(科技研究局(CFAR)) ; IHPC Agency for Science Technology and Research(科技研究局(IHPC))
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出GoRL框架,通过将策略优化限制在易处理的潜空间,同时用条件生成解码器合成动作,解耦优化与生成,实现稳定优化与表达力提升,在连续控制任务上显著超越基线。
Comments Ver 3 (Accepted as a conference paper by ICML 2026)
陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败
机构 * Salesforce AI Research(Salesforce AI 研究院) ; University of Cambridge(剑桥大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; Carnegie Mellon University(卡内基梅隆大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。
Comments Under Review
我们的基准测试足够吗?多模态大语言模型持续学习分析
机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。
Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"
跨模态验证实现无标注野生动物监测
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 多模态评测 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出利用物种活动模式专家知识作为无标注验证信号,通过视觉和声学管道独立恢复活动模式并与行为先验三方一致,实现无需人工标注的野生动物监测。
Comments Presented at the 2026 CV4Animals Workshop, colocated with CVPR
HumaniBench: 一种以人为中心的大型多模态模型评估框架
机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) ; University of Central Florida(中央佛罗里达大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。
Vaani 基准测试 V1.0:一个包容性的印地语多模态基准数据集
专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS
AI总结 针对印地语自动语音识别系统缺乏地理和人口多样性基准的问题,本文提出一个包含104个地区、多参考转录的多模态数据集,用于更鲁棒和包容的ASR评估。
PIVOTSBench:评估多模态大语言模型中的细粒度人际关系推理
机构 * Sun Yat-sen University(中山大学) ; University of Michigan(密歇根大学) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 提出PIVOTS基准,基于Social-IQ 2.0和YouTube数据,评估多模态大语言模型在心理学研究基础上预测双向人际关系维度的能力,并包含辅助任务分析关键视觉线索。
用于肺栓塞风险评估的高效多模态临床问答
机构 * University of Auckland(奥克兰大学) ; University of Cambridge(剑桥大学) ; University of Adelaide(阿德莱德大学) ; University of Melbourne(墨尔本大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。
CulMind:中国文化遗产中的多模态理解与推理基准
机构 * University of International Relations(国际关系学院) ; Kedge Business School(凯致商学院) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Capital Normal University(首都师范大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。
DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架
机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA ; organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA ; organization= Department of Industrial ; Systems Engineering, University of Florida , city= Gainesville , country= USA ; organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA ; organization= Department of Geography ; Sustainability, University of Tennessee , city= Knoxville , country= USA
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。
利用多模态深度学习与姿态引导注意力预测点球方向
机构 * University of New South Wales(新南威尔士大学) ; Virtusa Pvt. Ltd.(维塔萨私人有限公司) ; University of Moratuwa(摩图瓦大学)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出一种实时多模态深度学习框架,通过RGB帧和2D关键点预测点球方向,采用双分支架构和注意力机制,准确率达89%,适用于门将训练与战术分析。
Journal ref Sports Analytics, ISACE 2025, Lecture Notes in Computer Science, vol. 15925, pp. 179-192, Springer, Cham, 2026
当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议
机构 * Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Southern Methodist University(南卫理公会大学)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。
Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026
MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准
机构 * NVIDIA, USA(NVIDIA美国分公司) ; University of Maryland, College Park, USA(马里兰大学帕克分校)
专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。
Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU
生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究
机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) ; Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) ; Pi MedTech(Pi医疗科技) ; School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。
贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准
机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) ; Computer Science Laboratory(计算机科学实验室) ; SRI International(SRI国际)
专题命中 多模态评测 :multi-modal(title,abstract)
AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。
Comments Oral Paper at UAI 2026
通过学习的代理令牌实现忠实的接地视觉推理
机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。
Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer
FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手
机构 * College of Engineering, Purdue University(普渡大学工程学院) ; Toyota InfoTech Labs(丰田信息技术实验室)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。
CodePercept: 基于代码的MLLM视觉STEM感知
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) ; Qwen Team(通义实验室) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :MLLM(title_cn,abstract_cn);分类 cs.CV
AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。
Comments Accepted by CVPR2026
Thalia:用于火山活动监测的全球多模态数据集
机构 * Remote Sensing Lab, National Technical University of Athens, Greece(希腊国家技术大学远程传感实验室) ; Department of Informatics and Telematics, Harokopio University of Athens, Greece(希腊雅典霍罗科普利奥大学信息与电信系) ; Image Processing Laboratory (IPL), Universitat de València, Spain(西班牙瓦伦西亚大学图像处理实验室) ; National Observatory of Athens, Greece(希腊国家天文台)
专题命中 多模态评测 :multi-modal(title);分类 cs.CV
AI总结 针对火山监测中InSAR数据复杂且标注数据集稀缺的问题,本文构建了Thalia数据集,整合多源高分辨率时空数据,并提供专家标注和基准评估,推动深度学习在火山变形监测中的应用。
AIR: MLLMs中的自适应交错推理与代码
机构 * Independent Researcher(独立研究员)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出自适应交错推理框架AIR,通过强化学习训练代码增强的复杂数值计算任务,采用分组约束奖励函数和两阶段数据构建,使性能平均提升6.1个百分点。
Comments 19 pages, 4 figures
Koshur Pixel:克什米尔语的大规模合成OCR数据集
专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL
AI总结 针对低资源语言克什米尔语,提出首个大规模合成OCR数据集Koshur Pixel,包含613,078个图像-文本对,采用SynthOCR-Gen框架生成,覆盖多种字体和文本粒度,并集成25种以上数据增强策略,为训练OCR系统、数字化克什米尔文本遗产提供基础资源。
电子巴比伦图书馆中的自动楔形文字符号检测:大规模数据集与端到端楔形文字OCR流水线
机构 * Institute of Assyriology and Hittite Studies, LMU Munich(慕尼黑大学亚述学与赫梯学研究所) ; Department of Statistics, LMU Munich(慕尼黑大学统计系) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出基于可变形检测Transformer(DETR)的楔形文字符号检测模型,在最大标注数据集上实现28-37%的COCO指标提升,并应用于eBL语料库生成290万检测结果。
Comments Under review
超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。
Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026
评估与增强遥感多模态大语言模型的否定理解能力
机构 * Peng Cheng Laboratory(鹏城实验室) ; Tsinghua University(清华大学) ; Central South University(中南大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。
Comments ECCV 2026 Accepted
CLoE: 面向鲁棒缺失模态分割的专家一致性学习
机构 * University of Chinese Academy Sciences(中国科学院大学) ; School of Medicine, Southeast University(东南大学医学院) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出CLoE框架,通过模态专家一致性和区域专家一致性双重目标,结合可靠性感知门控网络,解决多模态分割中模态缺失导致的专家分歧和不稳定融合问题,在BraTS 2020和MSD Prostate上超越现有方法。
HERCULES:面向异构多机器人SLAM、协同感知与探索的开源仿真框架
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Georgia Tech Research Institute(佐治亚理工学院研究所)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 提出基于UE5的开源仿真框架HERCULES,支持异构无人机-无人车协同,解决架构限制,提供共享导航栈、红外相机和动态环境,验证了多机器人SLAM与探索的有效性。
Comments 19 pages, 14 figures, and 12 tables